作者stupidduck (hanekuriboo)
看板CLUB_KABA
标题Google与词义辨识的人工智能化
时间Sun Mar 20 22:36:36 2005
http://www.sciscape.org/
以Google搜寻不同字词同时出现在同一网页的频率来定义字词间的关联性,人工智
能或许能够开始了解字词的义意。
对文字工作者而言,无论是写作或译述,Google已经是不可或缺的重要工作利器了
,比方说在翻译一个陌生的英文字词时,许多人都会将想要转译的字词google几次
(“to google”已经变成一个动词了),然後从搜寻到的千百笔资料中,研判哪个
中文意思最接近。例如我压根儿不知“fluorescence microscopy”是啥意,於是
把“fluorescence microscopy”丢入Google,google出了好多笔资料都提到萤光
显微镜,而且出现的频率很高,於是很笃定的认为“fluorescence microscopy”
就是萤光显微镜。所以许多人除了以Google搜寻资料之外,亦以Google进行文字意
义的处理与辨识。
一个字词的意义经常能从其他与它并用的字眼而获得,例如"rider"这个英文字,
经常与"horse"以及"saddle"一道出现,所以从horse、saddle、rider此些字眼的
关联性可以推测出rider的意思了,於是八九不离十,rider和马、马鞍有关。当然
企图从上千万的字词关系析出其意义,需要一个庞大、详尽的资料库,否则怎知
rider与horse、saddle一起出现的频率很高,thanks god,我们有一个现成且免费
的Google。
荷兰阿姆斯特丹数学与电脑科学学院的Paul Vitanyi与Rudi Cilibrasi发现Google
搜寻引擎能用来检测两个字词之间的关联性,例如电脑想要知道“hat”为啥,首
先得建立一个字词树状结构,亦即一个足以显现字词之间关联性的资料库,此种树
状结构资料库可以从任两个字词开始,去了解其间的关联性,例如於google键入hat
与head此两个字词,几乎可以搜寻到8,800,000笔资料,不过若键入hat与banana此
两个字词,则仅有576,000笔资料,很明显的,hat与head之间的关联性较hat与
banana为强。
为了要量测其关联性,Vitanyi 与Cilibrasi基於搜寻到的资料笔数发展了一种统
计指标,能显示一对字词之间的逻辑距离,并称之为正常化的Google距离(normalized
Google distance, NGD),NGD越低,两个字词之间的关联性越紧密。对许多的字词
对(pairs of words)重复上述统计过程,即可能建立字词对之间的关联性距离图谱
,显示此些字词之间的关联性,电脑由此即能推测出某个字词的意义。Vitanyi.认
为此即电脑的字词意义萃取机制,能让电脑辨识字词。研究人员根据其在Google搜
寻到的资料笔数与出现频率,已经能利用电脑辨识出颜色、数字与不同宗教等字词
的意义。
Stand on the shoulders of giants~
Google help you to find the journals more quickly!!
http://scholar.google.com/
"Roses are red. Violets are blue. OS X rocks. Homage to you."
Another interesting Google~
http://labs.google.com/googlex/
Reverse Google!!
http://www.alltooflat.com/geeky/elgoog/m/
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 203.203.152.58
※ 编辑: stupidduck 来自: 203.203.152.58 (03/20 22:36)
1F:推 youtien:姑苟万岁。 210.85.0.92 03/21