ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

MuRIL මූලිකව භාවිතා කර ඉන්දියාවේ පුරවැසි පැමිණිලි වර්ගීකරණය 87% නිවැරදිත්වයෙන්

MuRIL මූලිකව භාවිතා කර ඉන්දියාවේ පුරවැසි පැමිණිලි වර්ගීකරණය 87% නිවැරදිත්වයෙන්

ඉන්දියාවේ පුරවැසි පණිවුඩයන් හෝ පැමිණිලි බහුභාෂා (හින්දි, ඉංග්‍රීසි, හින්ග්ලිෂ්) මිශ්‍රව ලියැවෙයි. එවැනි දත්ත තේරුම් ගැනීමට සාම්ප්‍රදායික TF‑IDF ආකෘති ගැටළුවකට මුහුණ දුන්නේය, කාරණය වන්නේ "पानी" සහ "paani" වචන එකිනෙකට සම්බන්ධ නොවීමයි.

ඉතිහාසයෙහි පළමු උත්සාහයේ, TF‑IDF + එන්සෙම්බ්ලය (NB, LogReg, SVM, RandomForest, XGBoost) භාවිතා කර 100% නිරවද්‍යතාවයක් ලැබුණා. නමුත් ඒක ව්‍යාජය – පුහුණු‑පරීක්ෂණ වගුවේ එකම වාක්‍ය රටාවන් දෙපාර්ශවයෙන් පැමිණියේය. නව පරීක්ෂණ සෙට් එකක් සකස් කිරීමෙන් නිවැරදිව 20‑31% නිරවද්‍යතාවයක් පෙනී සිටියේය.

මෙම ගැටළුව විසඳීමට, Google‍ගේ MuRIL (google/muril-base-cased) මොඩලය භාවිතා කරන ලදී. MuRIL ඉන්දියානු 17 භාෂා සහ ඒවායේ ට්‍රාන්ස්ලිතරේෂන් මත පූර්ව‑පුහුණු කර ඇති නිසා "पानी" සහ "paani" වචන එකම වෙක්ටර් ස්ථානයේ නගාගෙන, බහුභාෂා පාඨ වර්ගීකරණයට සුදුසු වේ.

පුහුණු ක්‍රියාවලියෙහිදී හතරක් වැදගත් දෝෂ හමුවුණි:

  • Bug #1 – වැරදි ඇගයීම: ටෙම්ප්ලේට් එකම පරීක්ෂණ සහ පුහුණු දත්ත සෙට් වලට ඇතුළත් වූ නිසා අධික නිරවද්‍යතාවයක් ලැබුණි. නව පරීක්ෂණ සෙට් එකක් සකස් කිරීමෙන් සත්‍ය නිරවද්‍යතාවය බිඳ වැටුණි.
  • Bug #2 – RNG හුවමාරු: ගෝලීය රැඳී ඇති RNG එක ප්‍රතිඵල අස්ථිර්ය කර තිබුණි. ප්‍රत्यේක කාණ්ඩයට ස්වයං පූර්ව‑සිඩ් RNG එකක් භාවිතා කිරීමෙන් ප්‍රතිචාරය ස්ථායි විය.
  • Bug #3 – වචන මාරු: සැනිටේෂන් කාණ්ඩයේ "paani" වචනය ජල සැපයුම කාණ්ඩයට ආකාරයක් දුන්හ. පදයන් වෙනස් කිරීමෙන් දෙකේම F1 1.00 කට පත් විය.
  • Bug #4 – Kaggle ඩිස්ක් සීමා: සුරක්ෂිත කිරීමේ සැකසුම epoch‑wise සකස් කර තිබීමෙන් 20 GB ඩිස්ක් පිරී ගියේය. save_total_limit=1 හා load_best_model_at_end=True යොදා ගෙන මෙය විසඳා ඇත.

අවසන් පරීක්ෂණයේ, 14 රජයේ අංශ කාණ්ඩ වලට 87.3% නිරවද්‍යතාවය සහ 0.869 macro F1 ලැබුණි. ජල සැපයුම, සැනිටේෂන්, සෞඛ්‍ය සේවා, ඉඩම් ලේඛන වැනි කාණ්ඩවල F1 0.98 කට අධික විය. නමුත් දූෂණ හා ලංසුකම් කාණ්ඩයේ F1 0.40 පමණක් වූ අතර, එය අඩු පරිභාෂාව නිසා වේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

මෙම තාක්ෂණය ශ්‍රී ලංකාවේ පුරවැසි සේවාවන්, නගර සැලසුම් හා අධිකරණ පද්ධති වලට අධික වටිනාකමක් ගෙන එයි. සිසුන්ට බහුභාෂා NLP මූලධර්ම ඉගෙන ගැනීමට සජීවී උදාහරණයක්, සංවර්ධකයන්ට MuRIL වැනි ප්‍රාදේශීය මොඩල භාවිතා කර ප්‍රාදේශීය භාෂා සඳහා AI යෙදුම් සෑදීමට මඟ පෙන්වයි. ව්‍යාපාරිකයන්ට පාරිභෝගික පැමිණිලි, සමාජ මාධ්‍ය අදහස් වැනි බහුභාෂා දත්ත වර්ගීකරණයෙන් සේවා ගුණාත්මකභාවය වැඩි කර ගැනීමට අවස්ථාව ලැබේ.

මෙම සාර්ථකත්වය මඟින් ශ්‍රී ලංකාවේ AI පර්යේෂණය හා ප්‍රාදේශීය භාෂා තාක්ෂණය ඉදිරියට ගෙන යාමට නව මාර්ගයක් විවෘත කරයි.

💡 ඔබේ AI මොඩලය අලුත් තාක්ෂණයෙන් බලන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#AI #MachineLearning #TextClassification #Multilingual #DataScience