作者uziel (= ̄ω ̄=)
看板java
标题Re: [问题] 简体字串比对问题
时间Tue Jul 5 13:19:46 2011
※ 引述《wolf76er ( =资三连线= wolf)》之铭言:
: 今天碰到一个问题,
: 就是从简体的网页,网页编码GB2312,把整个网页原始码抓下来,
: 然後读外部的TXT档(单字库),也是简体字,
: 如果网页上的句子中有出现字库中的单字,就把该超连结的档案下载下来,
: 我是用回圈+ .indexOf >=0 判断有无符合字库内的单字,
: 不过试了一整天都没办法,System.out.print 出来的某些字会变??
: 不知道是不是因为外部档读进来,需要设定编码?
: 还是网页撷取下来的字要做其他设定?
: 不过我试了几种,不是乱码就是会有??
: 麻烦请高手指导一下,谢谢!
不知道您用什麽方法读取网页,如果使用的类别可以指定编码的话,请手动设定成
和网页一样的编码;单字库也是,如果档案格式是 UTF-8 、 UTF-16LE 之类,读取
的时候请一并指定,例如 InputStreamReader 类别建构子的第二个参数。
另外,在 Windows 的命令提示字元环境下要输出 unicode 字元只有直接调用
WriteConsole() 等 Windows API 才办得到,用 Java 的 System.out.print()
系列函数遇到 unicode 字元只会显示两个问号。
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 223.142.46.124