
正文
结巴分词java代码 java 结巴分词
提示:扫一扫查出行【扫一扫了解最新限行尾号】
复制提示
怎么是用python 语言 使用结巴分词 呢
Python代码
#encoding=utf-8
import jieba
seg_list = jieba.cut("结巴分词java代码我来到北京清华大学",cut_all=True)
print "Full Mode:", "/ ".join(seg_list) #全模式
seg_list = jieba.cut("我来到北京清华大学",cut_all=False)
print "Default Mode:", "/ ".join(seg_list) #默认模式
seg_list = jieba.cut("结巴分词java代码他来到了网易杭研大厦")
print ", ".join(seg_list)
输出结巴分词java代码:
Full Mode: 我/ 来/ 来到/ 到/ 北/ 北京/ 京/ 清/ 清华/ 清华大学/ 华/ 华大/ 大/ 大学/ 学
Default Mode: 我/ 来到/ 北京/ 清华大学
他, 来到, 了, 网易, 杭研, 大厦 (此处结巴分词java代码,“杭研”并没有在词典中结巴分词java代码,但是也被Viterbi算法识别出来了)
相关问答
Q1: 在python 环境下,使用结巴分词,自动导入文本,分词,提取关键词.脚本 大侠给个
# -*- coding: utf-8 -*-
import jieba
import jieba.posseg as pseg
import jieba.analyse
#jieba.load_userdict('userdict.txt')#jieba默认有一个dict.txt词库结巴分词java代码,但可以根据自己需要加入自己结巴分词java代码的词条
str1 = "训练一个可进行N维分类结巴分词java代码的网络结巴分词java代码的常用方法是使用多项式逻辑回归"
str2 = "可以尝试修改网络架构来准确结巴分词java代码的复制全连接模型"
str3 = "模型的目标函数是求交叉熵损失和所有权重衰减项的和,loss()函数的返回值就是这个值"
seg_list = jieba.cut(str1,cut_all =True) #全模式
print("/".join(seg_list))
result = pseg.cut(str1)
result2 = jieba.cut(str2) #精准模式
result3 = jieba.analyse.extract_tags(str3,4) #关键词提取
result4 = jieba.cut_for_search(str3) #搜索引擎模式
for w in result:
print(w.word,w.flag)
print(" ".join(result2))
print(" ".join(result3))
print(" ".join(result4))
Q2: 结巴分词获取关键词时怎么过滤掉一些停用词
是使用extract_tags函数,这个函数会根据TF-IDF算法将特征词提取出来,在提取之前会去掉停用词,可以人工指定停用词字典,代码如下:
jieba.analyse.set_stop_words('D:\\Python27\\stopword.txt')
tags = jieba.analyse.extract_tags(text,20)
Q3: 在线等,比较急!!!我用java版的结巴分词写了一段代码,怎样将它输出到指定的txt文件中?
String str = segmenter.sentenceProcess(s);
System.out.println(str);
BufferedWriter out = new BufferedWriter(new FileWriter("F:\\out.txt"));
out.append(str);
Q4: 以下函数可以实现分词,但是为什么去停用词没有效果呢?问题在哪里?
我觉得可能还是编码不对吧。我也遇到这种情况,所以搜到了这个问题,查了很多东西也没有个结果。
我最开始数据都是用GB2312处理的,后来用结巴分词看文档上说用好用utf-8编码,就写了段代码把文本改成utf-8了,然后停用词文件也是用的utf-8保存的,但是不是用代码保存的,使用Notpad,之后就一直不能停用文件里的词。
后来,在代码中加了几个比较明显的停用词组成的list,当分出来的词不在list里的时候,才输出该词,结果就成功的停用了list里的所有词。
建议楼主再调整一下编码试试吧。
另外,我最开始用的是Python2.7.10,因为停用词没反应,我查到一个网页说他用Python3.4就好了,我又换了Python3.4.3,可是一样不能用,然后向我上面那么做的就好了,Python2.7还没有试,估计问题都差不多了吧...
楼主加油!Python程序猿加油!
Q5: 用结巴分词的Java版本出现空指针异常错误,不知道该怎么解决?为什么别人能运行出来呢?
如果确定是dbHelper非空,目测应该是dbHelper取不到SQLiteDatabase实例,导致db.query抛空。请断点调试检查下。
有问题欢迎提问,有需要帮助可远程,满意请采纳,THX。
关于结巴分词java代码和java 结巴分词的介绍到此就结束了,不知道你从中找到你需要的信息了吗 ?如果你还想了解更多这方面的信息,记得收藏关注本站。







