作者RayShigeno (RayShigeno)
看板Python
标题[问题] 有关语意分析的方向
时间Wed Nov 11 19:16:07 2015
不好意思我目前想学习有关语意分析这块
那我做了些功课後发现,使用python是最简单的
我想问各位,我对语意分析的用法是不是有错
我想实用在抓取关键字
例如去某个网站,利用Python先断词,再把出现的次数最高的依序抓出来,这样就能知道
哪个关键字最热门,进一步做推论
请问我这样的想法有错吗?python可以做到这样吗?感谢各位
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 210.242.90.187
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1447240570.A.6D7.html
1F:→ ccwang002: Python 可以做到。想法也正确。不过实际上复杂很多 11/11 19:18
2F:→ ccwang002: 例如你觉得 Python 这个版断完词之後哪些词最热门? 11/11 19:19
3F:→ ccwang002: 不意外会有 Python,但我想「问题」「错误」也会很热门 11/11 19:19
4F:→ ccwang002: 更 general 一点,中文高词频有你、大家,商品有漂亮 11/11 19:20
5F:→ bibo9901: 想法很OK 但是细节很多 11/11 19:20
6F:→ ccwang002: 这些词次数高,但会是关键字吗?就要进一步要思考 11/11 19:21
7F:推 flarehunter: 楼上说的是TF-IDF吧 11/11 21:39
8F:→ ccwang002: 恩恩,还有 LDA HDP 甚至用 word2vec 做 clustering 11/11 21:48
9F:推 sa0124: 推荐你可以用jieba断词 语意分析好多东西可以玩耶 从你的 11/12 09:40
10F:→ sa0124: 叙述可以先做TF-Idf 11/12 09:40
11F:推 aa000017: sk-learn和gensim这两个套件可以拿来用,之前用来做过to 11/20 17:27
12F:→ aa000017: pic modeling和clustering 11/20 17:27
13F:推 aa000017: scikit-learn,刚才打到简称=x= 11/20 17:31
14F:推 new122851: 这牵涉到超多..我现在在搞text SVM classification 12/05 01:58