අන්තර්ජාතික භාෂා සැලසුම් කරන විට බොහෝ නිර්දේශයන් පදනම් කරන්නේ වචන අතර ඉඩ (space) ඇති බවයි. චීන භාෂාව එම සංකල්පය සම්පූර්ණයෙන්ම බිඳදමයි; එක් අක්ෂරයක් පවා බහු-බයිට්, බහු-කෝඩ් පෝයින්ට් වශයෙන් පෙනෙයි. අපේ නාමකරණ පද්ධතිය අක්ෂර ගණන, පංචභූති, ස්වර ආකාරය වැනි ගැඹුරු විශ්ලේෂණ කරන නිසා මේ ගැටළු අපට තදින් වැටෙනවා.
කේත ලේඛනයේ දිග ගණනය – Python 3 හි len() ක්රමය සෑම කෝඩ් පෝයින්ට් එකක්ම ගණනට ගනී, එමනිසා "𠮷田" වැනි අක්ෂර දෙකක් නිවැරදිව 2 ලෙස පෙන්වයි. JavaScript හි .length UTF‑16 සර්ගේට් ජෝඩි ගණන ගනී, ඒ නිසා එක අක්ෂරයක් දෙකක් ලෙස ගනී. මේ නිසා අක්ෂර ගණන මත පදනම්ව කරන සංඛ්යාත්මක ගණනය වැරදි ප්රතිඵල දෙයි.
දත්ත ගබඩා සම්බන්ධ ගැටළු – CJK අක්ෂර වල උසස් කොඩ් පෝයින්ට් (U+20000 ඉහළ) 4‑byte UTF‑8 අකුරු වේ. MySQL හි සාමාන්ය utf8 charset එක 3‑byte පමණක් සහාය දක්වයි, එමනිසා අක්ෂර කපා හැරීම හෝ ප්රතික්ෂේප කිරීම සිදුවේ. විසඳුම වන්නේ utf8mb4 charset හා utf8mb4_bin collation භාවිතා කිරීමයි.
Normalization ප්රතිඵල – බොහෝ සංවර්ධකයින් NFKC භාවිතා කරයි, එය අක්ෂර “පිරිසිදු කිරීම” ලෙස සැලකේ. නමුත් CJK අක්ෂර වලදී එය අකාරාත්මකව වෙනස් කරයි; සම්පූර්ණ‑පළල අක්ෂර (A) ASCII (A) වෙත, පූර්ණ‑පළල විරාමලක (,) සාමාන්ය විරාමලක (,) වෙත පරිවර්තනය වේ. නාමකරණ කොරපස් එකේ මේ වෙනස්කම් තොරතුරු අහිමි කරයි. අපේ නීතිය: ගබඩාවට NFC පමණක් භාවිතා කර, NFKC කිසිදාම නොකරන්න; ඉන්ජෙස්ට් සීමාවේ එක වරක් පමණක් සාමාන්යකරණය කරන්න.
වෙරියෂන් සෙලෙක්ටරස් සහ සම්ප්රේෂණය – Ideographic Variation Sequence (U+E0100+) මූලික අක්ෂරයට විශේෂ ග්ලීෆ් තෝරා ගැනීමට උපකාරී වේ. ඒවා NFC පසුතැවීමේදී පවා ඉවත් නොවේ. අපි හෑෂ් සෙට් එකේ විශේෂ සලකුණු ඉවත් කර, පෙන්වීමේ පෝරමයේ තබා, දෙකේ වෙනම ක්ෂේත්රයක් තබාගත්තා.
සරල‑පාරම්පරික පරිවර්තනය – සරල අක්ෂරයක් බහු පාරම්පරික අක්ෂර වලට සම්බන්ධ විය හැක (උදා: 发 → 發 / 髮). ඒ නිසා සරල‑පාරම්පරික පරිවර්තනය සරල සාරණි පටිගත කිරීමෙන් නොහැක. OpenCC වැනි phrase‑level පරිවර්තක භාවිතා කර, ප්රායෝගික වාක්ය සන්දර්භය අනුව නිවැරදි පාරම්පරික අක්ෂර ලබා ගත හැක.
ශ්රී ලංකාවට ඇති වැදගත්කම
- ශ්රී ලංකාවේ සිසුන් Unicode හා CJK අක්ෂර සම්බන්ධ පදනම් දැනුම ලබා ගනිමින්, ජාත්යන්තර තාක්ෂණ සංග්රහ වලට සූදානම් වෙයි.
- දේශීය සංවර්ධකයින්ට මලටි‑ලින්ගුවේෂන් (multilingual) ඇප්වල නිවැරදි දත්ත ගබඩා හා සත්ය පරිවර්තන ක්රම දැන ගැනීමට අවස්ථාව ලැබේ.
- ව්යාපාරික සමාගම් චීන වෙළඳපල සමඟ සම්බන්ධතා ගොඩනැගීමට, නාමකරණ, බ්රෑන්ඩ් නාම, AI‑වල අක්ෂර‑විශ්ලේෂණය වැනි සේවාවන් නිවැරදිව ක්රියාත්මක කරගත හැක.
අවසානයේ, චීන අක්ෂර වලට සම්බන්ධ සියලු තාක්ෂණික තත්ත්වයන් නිරීක්ෂණය කිරීම, කේත ලේඛනයේ, දත්ත ගබඩාවේ, සහ පරිවර්තන මොඩියුල වල නිරවද්යතාවය තහවුරු කිරීම සඳහා ඉතා වැදගත්. මේ අභියෝග හඳුනාගෙන, නිවැරදි විසඳුම් අනුගමනය කිරීම, ශ්රී ලංකාවේ තාක්ෂණික සමාජයට ජාත්යන්තර මට්ටමේ තරඟකාරීත්වය ලබා දේ.