ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-25, Saturday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

AI ෆුෂා අරාබි හොඳින් තේරුම් ගනී, නමුත් ද්‍රව්‍යභාෂා වල අමාරුකම කුමක්ද?

AI ෆුෂා අරාබි හොඳින් තේරුම් ගනී, නමුත් ද්‍රව්‍යභාෂා වල අමාරුකම කුමක්ද?

ඔබ AI චැට්බොට් එකකට ෆුෂා (ආධිකාරක) අරාබි භාෂාවෙන් ප්‍රශ්නයක් අහුවානම්, එය සුමට පිළිතුරක් දෙයි. ඒත් ගාසා, මිස්‍ර, මොරොක්කෝ වගේ ද්‍රව්‍යභාෂා වලින් අසන්නම්, බොට් එක ගැටලු වලට පත්වෙයි, වැරදි පරිවර්තන හෝ අර්ථය අහිමි කරයි.

මෙම අසමතුලිතතාවය පසුපස ඇති හේතුව මූලිකවම දත්ත ප්‍රමාණයයි. ලොකු භාෂා මාදිලි (LLM) ගොඩනැගීම සඳහා අන්තර්ජාලයේ විශාල පෙළ පිරික්සුම් කරයි. ඉංග්‍රීසි සඳහා එතරම් බොහෝ දත්ත තිබෙනවා, ෆුෂා අරාබි සඳහා පුවත්, පොත්, විකිපීඩියා වැනි ලිඛිත මූලාශ්‍ර තිබේ. නමුත් ද්‍රව්‍යභාෂා සඳහා ලිඛිත දත්ත අඩුවෙයි; ඒවා ප්‍රධාන වශයෙන් කථනය, කෙටි හඬ පණිවුඩ, සහ අනිවාර්ය නොවන සංවාද වල පෙනේ. දත්ත අඩුවීම නිසා AI එම භාෂා වර්ගයන්හි කාර්ය සාධනය අඩු වේ.

අරාබි භාෂාව එකම නොවේ. ෆුෂා යනු සම්මත රූපය, එයට පසු දිනපතා භාවිතා වන ද්‍රව්‍යභාෂා අති විශාල වෙනස්කම් ඇත. ඒවා යුරෝපීය භාෂා කිහිපයක් අතර වෙනස්කම් වඩාත් තරම් වෙනස්. LLM එක බොහෝ විට ෆුෂා මත පුහුණු වන නිසා, ද්‍රව්‍යභාෂාවක් අමුතු විදේශ භාෂාවක් ලෙස ගනී.

තවද, ටෝකනයිසේශන් (tokenization) ප්‍රකාරයද මෙයට හේතු. AI පද්ධති වචනවලට නොබැඳි කොටස් (ටෝකන) ලෙස පෙළ විභජනය කරයි. අරාබි ලිවීමේ සංකීර්ණ ව්‍යුහය, පූර්ව-පසුපස යුගල, සහ ද්‍රව්‍යභාෂා ලිවීමේ නොමැති නියමයන් හේතුවෙන් ටෝකන ගණන වැඩි වෙයි. එමඟින් ගණනයේ බර වැඩිවීමත්, අර්ථය අහිමි වීමත් සිදු වේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ තාක්ෂණික ශිෂ්‍යයන්, සංවර්ධකයන්, සහ ව්‍යාපාරිකයින්ට මේ ගැටළුවෙන් ඉගෙන ගත හැකි දෙයක් ඇත. පළමු වශයෙන්, දත්ත සම්පත් විවිධීකරණය කිරීමේ අවශ්‍යතාවය පෙනේ. අපේ රටේ සිංහල, තමිල්, මැළේ භාෂා සඳහා ලිඛිත දත්ත සකස් කර, ඒවා AI මොඩලයන්ට ලබා දීමෙන්, දේශීය AI නිෂ්පාදනවල ගුණාත්මකභාවය වැඩි වේ.

  • විශ්ව විශ්වවිද්‍යාල සහ තාක්ෂණික ආයතන AI පර්යේෂණයට ද්‍රව්‍යභාෂා දත්ත එකතු කිරීමේ ව්‍යාපෘති ආරම්භ කළ හැක.
  • ස්ථානික සමාගම් විශාල AI මොඩලයන් විශේෂිත සිංහල/තමිල් ව්‍යාපාරික අවශ්‍යතා සඳහා අලුත් කරගත හැක.
  • ඉදිරියේදී AI‑චැට්බොට්, පාරිභෝගික සේවා, සහ අධ්‍යාපනික මෙවලම් දේශීය භාෂා වලින්ම ඉතා හොඳින් ක්‍රියාත්මක වනු ඇත.

අවසානයේ, AI තාක්ෂණය ලොව පුරා ඉදිරියට ගමන් කරන අතර, අපේ දේශීය භාෂා හා සංස්කෘතිය ඒගොල්ලට අනුගත කර ගැනීම අපේ අනාගතයට අත්‍යවශ්‍යය.

දැනටමත් විවෘත AI මොඩලයන් ප්‍රසිද්ධියට පත්වෙමින්, ඒවාට අපේම දත්ත එක් කර, පළපුරුදු සංවර්ධකයන්ට තාක්ෂණික ස්වාධීනත්වය ලබා දීමට අවස්ථාව ලැබේ.

💡 දේෂීය AI දත්ත සම්පත් සකස් කර, තාක්ෂණික ස්වාධීනත්වය ගොඩනගමු!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#AI #Arabic #Dialect #Data #Sri Lanka