楼主: DL-er
476 0

基于统计分词的中文网页分类 [推广有奖]

  • 0关注
  • 6粉丝

会员

学术权威

74%

还不是VIP/贵宾

-

威望
0
论坛币
15 个
通用积分
1.0435
学术水平
0 点
热心指数
0 点
信用等级
0 点
经验
38540 点
帖子
3853
精华
0
在线时间
813 小时
注册时间
2017-9-5
最后登录
2018-6-30

楼主
DL-er 在职认证  发表于 2018-2-8 12:40:02 |AI写论文

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币
摘要:本文将基于统计的二元分词方法应用于中文网页分类,实现了在事先没有词表的情况下通过统计构造二字词词表,从而根据网页中的文本进行分词,进而进行网页的分类.因特网上不同类型和来源的文本内容用词风格和类型存在相当的差别,新词不断出现,而且易于获得大量的同类型文本作为训练语料.这些都为实现统计分词提供了条件.本文通过试验测试了统计分词构造二字词表用于中文网页分类的效果.试验表明,在统计阈值选择合适的时候,通过构建的词表进行分词进而进行网页分类,能有效地提高网页分类的分类精度.此外,本文还分析了单字和分词对于文本分类的不同影响及其原因.http://www.cqvip.com//QK/96983X/200206/7121395.html

送人玫瑰,手留余香~如您已下载到该资源,可在回帖当中上传与大家共享,欢迎来CDA社区交流学习。(仅供学术交流用。)

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:中文网页 中文网 cqvip HTML 交流学习 中文网页分类 文本分类 统计分词 机器学习 计算机网络

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
jg-xs1
拉您进交流群
GMT+8, 2025-12-31 06:02