作者sbrhsieh (sbr)
看板java
标题Re: [J2Se] 有可能分辨UTF8的语系吗?
时间Mon Mar 9 14:08:08 2009
※ 引述《neverfly (neverfly)》之铭言:
: 如果我的系统都是采用UTF8,
: 而使用者可能输入正体、简体中文或纯英文,
: (假设中文部份可能混英文,但正体不会混简体)
: 但三者必须做不同的处理,
: 所以在这之前,我必须先分辨出输入的语系。
: 请问一下,Java有可能做到这样的功能吗?谢谢。
这只是牵涉到数据的处理,没有理由使用 Java 作不到,只有实做上简单与否,
以及实做出来的 runtime 效能是否可接受。
unicode standard 中没有区分简体与繁体,亚洲的象形文字是归为同一类,主要
分布在:(for Unicode Standard 5.0)
CJK Unified Ideographs, 4E00 - 9FBF
CJK Unified Ideographs Extension A, 3400 - 4DBF
CJK Unified Ideographs Extension B, 20000 - 2A6DF
CJK Compatibility Ideographs, F900 - FAFF
CJK Compatibility Ideographs Supplement, 2F800 - 2FA1F
另外跟汉字有相关的:
Kangxi Radicals(部首), 2F00 - 2FDF
Bopomofo(台湾使用的注音), 3100 - 312F
Bopomofo Extended(闽南话与客家话注音), 31A0 - 31BF (跟我看过的台语注音不同)
你可以自行下载上述的文件来研究,以 CJK Unified Ideographs 来说,
U8AD6 是 '论' 字,而 U8BBA 看起来则是 '论' 的简体,自行找出是否每个繁体字
与其对应简体是否有一定的关系在,或是简繁体是否有分开的 range(以言字旁来说
繁体部分似乎是落在 U8A00 - U8B9F,而简体的部分似乎落在 U8BA0 - U8C36)。
网路上可以找到简繁体转换的软体或工具,通常是预先建表,转换时查表去转换,
所以你应该也可以找到别人已经先做好的对照表来使用。
* unicode 没有区分简繁体这说法,是因为有些简体字与日本汉字的外观与繁体
字相去不远,在 unicode 中只以一个字呈现。
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 218.173.132.239
※ 编辑: sbrhsieh 来自: 218.173.132.239 (03/09 14:09)
※ 编辑: sbrhsieh 来自: 218.173.132.239 (03/09 14:12)
※ 编辑: sbrhsieh 来自: 218.173.132.239 (03/09 14:32)
1F:推 neverfly:谢谢你详细的回答,给了我一个明确的方向 03/09 16:40
2F:推 MOONRAKER:Unicode的确把CJK搅在一起做濑尿牛丸,所以以前某前辈 03/09 17:30
3F:→ MOONRAKER:骂这是没文化的人设计的,我认为的确泯灭文化差异性 03/09 17:32
4F:→ sbrhsieh:我也觉得日韩的字实在是不应该称象形文字。 03/09 18:02
5F:→ kene:但话说, 提出"中日韩表意文字"的好像是台湾代表耶 (笑) 03/09 20:00