作者zero0o0o8279 ()
看板Python
标题[问题] word2Vec 自然语言处理 中文语料库
时间Thu Jul 6 14:50:05 2017
最近在研究sentiment analysis
练习了一下如何使用word2vec
可是大多数范例好像都是用英文的
想试试看中文的效果如何,不知道有没有已处理好的中文语料库可以使用,
还是都要自己先收资料,做好断词等等处理才行呢?
小的刚入门还不太懂,若讲到的词有观念错误或是奇怪的地方还请各位高手多多指教~
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 27.52.41.89
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1499323807.A.B56.html
1F:→ hsnuyi: 中研院有词库 有人把它抓下来整理好 放在github上 断词的 07/06 15:00
2F:→ hsnuyi: 话 以前是都用jieba 现在好像有更好的 07/06 15:00
3F:→ BigBank: 用维基百科去处理 07/06 15:31
4F:→ zero0o0o8279: 有找到中研院的可是连结好像都挂了 再去github看看 07/06 15:42
5F:→ zero0o0o8279: 维基的话 不太懂要怎麽处理那个原始档 可以指点一 07/06 15:42
6F:→ zero0o0o8279: 下方向吗 07/06 15:42
8F:→ minikai: 最近公司也在处理中文断词 真的有比Jieba好用的吗? 07/06 23:50
9F:→ hsnuyi: 我是在p2看到的 可是我最爱很多个 一时找不到... 07/08 01:50
10F:推 dppman: 可以分享一下GitHub 上整理的中研院的资源吗? 07/08 19:18
11F:→ bluecadence: 我记得中研院的词库要收钱了 如果没记错的话 07/08 20:00
12F:推 Shane7: 中文维基百科 再自己断词 07/14 17:33