ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

ගුජරාටි AI සඳහා 23,000 කට වැඩි විවෘත දත්ත කට්ටලය සකස් කරයි

ගුජරාටි AI සඳහා 23,000 කට වැඩි විවෘත දත්ත කට්ටලය සකස් කරයි

ලොකු භාෂා ආදර්ශ (LLM) තාක්ෂණය ඉදිරියට ගමන් කරමින්, ගුජරාටි භාෂාවෙන් පරිගණකවලට ප්‍රශ්න කළාම බොහෝ විට අසම්මත පිළිතුරු හෝ ඉංග්‍රීසි‑හින්දි වලට පැන යනවා. එය භාෂා‑අඩු ප්‍රජාවන්ට AI සේවාවන් ලබා දීමේ ගැටලුවක් බවට පත්වේ.

මෙම අවශ්‍යතාවය ගවේෂණය කරමින්, සංවර්ධකයෙක් GGJI v1 (Gujarati General‑Purpose Instruction Dataset) නමින් 23,181 නියෝග‑පිළිතුරු යුගලයක්, 18 වර්ගවලට බෙදා, හග්ගින් ෆේස් වෙත මුදලින් නොගෙවී විවෘත කළා. ඒවා අතර ප්‍රශ්න‑පිළිතුරු, බහු‑පියවර තර්ක, සංක්ෂේපණ, දෙභාෂා පරිවර්තනය, ව්‍යාකරණ නිවැරදි කිරීම, පරාෆ්‍රේසි, කතා, කවිය, සංවාද සහ කේත විවරණය වැනි විවිධ කාර්යයන් අඩංගු වේ.

මෙම දත්ත කට්ටලය නිර්මාණය කිරීමේ ප්‍රධාන අරමුණ වන්නේ, ගුජරාටි‑කෙරෙන AI ආදර්ශයන්ට විවිධ ආකාරයේ නියෝග අත්හදා බැලීමට හැකි වීමයි. මීට පෙර ඉංග්‍රීසිය සඳහා නූතන දත්ත කට්ටල ගණනාවක් තිබුණත්, 60 මිලියනකට අධික ගුජරාටි කථිකයන්ට අදාළ වඩාත් සාර්ථක මූලාශ්‍රයක් නොතිබුණි. මේ නිසා මොඩලයන්ට භාෂා‑නිශ්චිත අවශ්‍යතා හඳුනා ගන්න, කාර්ය‑විෂය පරිවර්තනය කරන්න, සහ මිනිසුන් වැනි ස්වභාවික පිළිතුරු ලබා දීමට හැකි වේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ තාක්ෂණික පරිසරය ඉතාමත් බහුභාෂාමය; සිංහල, දෙමළ, ඉංග්‍රීසි යන භාෂා අතර AI විසඳුම් බෙදා හරින අවශ්‍යතාවය වැඩි වෙමින් තිබේ. ගුජරාටි දත්ත කට්ටලය විවෘත වීම, ලෝකයේ අඩු සම්පත් භාෂා සඳහා AI සැලසුම් කිරීමේ නව ආකාරයක් ලෙස ශ්‍රී ලංකාවේ සංවර්ධකයින්ට ආදර්ශයක් වේ.

  • සිංහල‑දෙමළ‑ඉංග්‍රීසි‑ගුජරාටි මට්ටමේ බහු‑භාෂා මොඩල පුහුණු කිරීමේ පදනමක් සපයයි.
  • දේශීය විශ්වවිද්‍යාල හා පර්යේෂණ ආයතනවලට අඩු‑සම්පත් AI පර්යේෂණ ව්‍යාපෘති සඳහා දත්ත මූලධර්මයක් ලබා දේ.
  • ව්‍යාපාරික සමාගම්ට ගුජරාටි‑කථික ගනුදෙනුකරුවන් සමඟ සංවාද AI, පාරිභෝගික සේවා, සහ අන්තර්ජාල වෙළෙඳපලේ ප්‍රවේශය වර්ධනය කිරීමට අවස්ථාව ලැබේ.

ඉදිරියේදී මෙම දත්ත කට්ටලය භාවිතා කර, ශ්‍රී ලංකාවේ AI සංවර්ධකයන්ට බහු‑භාෂා අන්තර්ජාල සේවා නිර්මාණය කිරීම, නව නිෂ්පාදන නිර්මාණය, සහ AI‑කේන්ද්‍රිත පරිගණක පාඨමාලා සැලසුම් කිරීමේ හැකියාවන් වැඩිදියුණු කර ගත හැක.

මෙම ව්‍යාපෘතිය තවත් භාෂා සඳහා දත්ත කට්ටල සංවර්ධනයේ ආරම්භයක් බවට පත්වෙයි. සංවර්ධකයන්, පර්යේෂකයන්, සහ AI උනන්දුවක් ඇති ඕනෑම කෙනෙකුට මෙය භාවිතා කර, අඩු‑සම්පත් භාෂා සඳහා තාක්ෂණික ගැලවීම් සොයාගැනීමට කැඳවීමක් වේ.

අනාගතයේදී දත්ත කට්ටලය තවත් උපභාෂා, උදාහරණ ලෙස කාතියාවාඩි, සූර්ති වැනි ප්‍රදේශීය රූපකයන් ඇතුළත් කර, තවත් සවිස්තරාත්මක වීමට සැලසුම් කර ඇත. ඔබටත් මෙහි දායක වීමට, අදහස් ලබා දීමට, හෝ දත්ත වර්ධනයේ සහාය වීමට අවශ්‍ය නම්, GitHub / Hugging Face වෙත පිවිසෙන්න.

💡 ඔබේ AI ව්‍යාපෘතියේ අලුත් මාර්ගය මෙයින් අරඹන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#AI #Dataset #OpenSource #Gujarati #SriLankaTech