作者oracledb (oo)
看板java
标题[问题] 有关文字文件编码判断
时间Sun Dec 30 12:49:49 2007
我最近在做一个关於文字档(*.doc, *.txt..etc.)
的编码判断程式,然後我在网路上找到一个package -- jchardet,
按照上面写的范例套进去使用,
在文件打开,读取一部份的位元阵列byte[],
然後丢进这个package某个method,
可是我测试之後发现这个套件的编码判断不是很准确,
好像只有ascii的编码会正确判断出来,
其他包括UTF-8, unicode都会判断失败,
然後列出一长串"可能的编码"。
在这个部分,请问有没有人曾经做过类似的事,
有没有比较好的解法?
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 123.252.85.154