在信息检索中,为节省存储空间和提高搜索效率,在处理自然语言数据(或文本)之前或之后会自动过滤掉某些字或词,比如“的”、“是”、“而且”、“但是”、”非常“等。这些字或词即被称为Stop Words(停用词)。
Jieba分词支持开发者使用自定定义的词典,所以可以进行自定义停用词
|
楼主: 我是小趴菜
|
630
1
[数据挖掘新闻] 停用词是什么意思?这些词是默认的还是自定义的? |
|
教授 35%
-
|
| ||
|
|
加好友,备注cda京ICP备16021002号-2 京B2-20170662号
京公网安备 11010802022788号
论坛法律顾问:王进律师
知识产权保护声明
免责及隐私声明


