使用python进行汉语分词

是丫丫呀1年前 (2023-11-21)阅读数 17#技术干货

文章标签分词

目前我常常使用的分词有结巴分词、NLPIR分词等等

最近是在使用结巴分词，稍微做一下推荐，还是蛮好用的。

一、结巴分词简介

利用结巴分词进行中文分词，基本实现原理有三：

基于Trie树结构实现高效的词图扫描，生成句子中汉字所有可能成词情况所构成的有向无环图(DAG)

采用了动态规划查找最大概率路径,找出基于词频的最大切分组合

对于未登录词，采用了基于汉字成词能力的HMM模型，使用了Viterbi算法

二、安装及使用(Linux)

1.下载工具包，解压后进入目录下，运行：pythonsetup.pyinstall

Hint：a.一个良好的习惯是，对于下载下来的软件，先看readme，再进行操作。(没有阅读readme，直接尝试+百度，会走很多弯路);

b.当时运行安装命令时，出现错误：nopermission!(有些人可能会遇见这种问题，这是因为权限不够的。执行：sudo!!其中“!!”表示上一条命令，这里指的就是上面的安装命令)，使用sudo后便可正常运行。

2.在使用结巴做分词的时候，一定会用的函数是：jieba.cut(arg1，arg2);这是用于分词的函数，我们只需要了解以下三点，便可使用

a.cut方法接受两个输入参数：第一个参数(arg1)为需要进行分词的字符串，arg2参数用来控制分词模式。

分词模式分为两类：默认模式，试图将句子最精确地切开，适合文本分析;全模式，把句子中所有的可以成词的词语都扫描出来，适合搜索引擎

b.待分词的字符串可以是gbk字符串、utf-8字符串或者unicode

使用Python的人要注意编码问题，Python是基于ASCII码来处理字符的，当出现不属于ASCII的字符时(比如在代码中使用汉字)，会出现错误信息：“ASCIIcodeccan'tencodecharacter”，解决方案是在文件顶部加入语句：#!-*-coding:utf-8-*-来告诉Python的编译器：“我这个文件是用utf-8进行编码的，你要进行解码的时候，请用utf-8”。(这里记住，这个命令一定要加在文件的最顶部，如果不在最顶部，编码问题就依然存在，得不到解决)关于编码的转换，可以参考博文(ps：个人理解“importsysreload(sys)sys.setdefaultencoding('utf-8')”这几句话与“#!-*-coding:utf-8-*-”等价)

c.jieba.cut返回的结构是一个可迭代的generator，可以使用for循环来获得分词后得到的每一个词语(unicode)，也可以用list(jieba.cut(...))转化为list

3.以下举例jieba中提供的一个使用方法作为说明：

#!-*-coding:utf-8-*-

importjieba

seg_list=jieba.cut("我来到北京清华大学",cut_all=True)

print"FullMode:",''.join(seg_list)

seg_list=jieba.cut("我来到北京清华大学")

print"DefaultMode:",''.join(seg_list)

使用python进行汉语分词

输出结果为：

FullMode:我/来/来到/到/北/北京/京/清/清华/清华大学/华/华大/大/大学/学

DefaultMode:我/来到/北京/清华大学

三、结巴中文分词的其他功能

1、添加或管理自定义词典

结巴的所有字典内容存放在dict.txt，你可以不断的完善dict.txt中的内容。

2、关键词抽取

通过计算分词后的关键词的TF/IDF权重，来抽取重点关键词。

以上内容为大家介绍了使用python进行汉语分词，希望对大家有所帮助，如果想要了解更多Python相关知识，请关注IT培训机构:开发教育。http://www.baikegou.com/

鹏仔微信 15129739599 鹏仔QQ344225443 鹏仔前端 pjxi.com 共享博客 sharedbk.com

免责声明：我们致力于保护作者版权，注重分享，当前被刊用文章因无法核实真实出处，未能及时与作者取得联系，或有版权异议的，请联系管理员，我们会立即处理! 部分文章是来自自研大数据AI进行生成,内容摘自(百度百科,百度知道,头条百科,中国民法典,刑法,牛津词典,新华词典,汉语词典,国家院校,科普平台)等数据,内容仅供学习参考,不准确地方联系删除处理!邮箱：344225443@qq.com)

图片声明：本站部分配图来自网络。本站只作为美观性配图使用,无任何非法侵犯第三方意图,一切解释权归图片著作权方,本站不承担任何责任。如有恶意碰瓷者,必当奉陪到底严惩不贷!

内容声明：本文中引用的各种信息及资料（包括但不限于文字、数据、图表及超链接等）均来源于该信息及资料的相关主体（包括但不限于公司、媒体、协会等机构）的官方网站或公开发表的信息。部分内容参考包括:(百度百科,百度知道,头条百科,中国民法典,刑法,牛津词典,新华词典,汉语词典,国家院校,科普平台)等数据,内容仅供参考使用,不准确地方联系删除处理！本站为非盈利性质站点,本着为中国教育事业出一份力,发布内容不收取任何费用也不接任何广告!)