ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

LLM පරීක්ෂණ පයිප්පලයක් සකස් කරමු: 92% හලුසිනාශන් අත්හරින තාක්ෂණය

LLM පරීක්ෂණ පයිප්පලයක් සකස් කරමු: 92% හලුසිනාශන් අත්හරින තාක්ෂණය

AI තාක්ෂණයේ අලුත්ම ප්‍රවණතාවක් වන LLM (Large Language Model) පරීක්ෂණ පද්ධති, දැන් නිෂ්පාදන මට්ටමේ විශ්වාසනීයත්වය ලබාගැනීමට නව පියවරක් ගෙන එයි. අපේ කණ්ඩායම පසුගිය මාස තුනේ RAG (Retrieval‑Augmented Generation) පදනම් වූ පාරිභෝගික සහයෝගීකරු එකතුව කර තිබුණා. පරීක්ෂණ මට්ටමේ “looks good to me” යන අන්දමෙන් පමණක් පරීක්ෂා කර, නිෂ්පාදනයට ගෙන එද්දී පාරිභෝගිකයින්ට වැරදි තොරතුරු (hallucinations) පෙන්වූ බව අනාවරණය වුණා.

උදාහරණයක් ලෙස, බිල්පත් චක්‍රය ගැන අසන පාරිභෝගිකයෙකුට, පද්ධතිය අතින් නොතිබූ ප්‍රතිපත්තියක් උපුටා දුන්නේය. තවත් අයෙක් API අනුපාතික සීමා ගැන අසන විට, තරගකරුගේ ලේඛනවලින් අංක ගණනක් ලබා දුන්නේය. මේ සියල්ල 500 කට වැඩි පරිශීලකයින්ට පෙන්වී, නිෂ්පාදනයේ විශ්වාසනීයතාවයට ගැටළු ඇති වුණා.

මෙම අසාර්ථකතාවට ප්‍රධාන හේතුව වන්නේ, පරීක්ෂණ ක්‍රියාවලිය සම්පූර්ණයෙන්ම අතුරුදන්වීමයි. “පරීක්ෂණ 5 ප්‍රශ්න, පිළිතුරු කියවලා, thumbs up” යන පරිදි මිනිස් පරීක්ෂාවක් පමණක් භාවිතා කර තිබුණා. එමනිසා, නිෂ්පාදනයේදී පාවිච්චි කරන ලද domain‑specific judges, වේගවත් CI/CD සමඟ ඒකාබද්ධ කිරීම, සහ පූර්ව‑ඇගයීම් මත රෙග්‍රෙෂන් හඳුනා ගැනීම වැනි අවශ්‍යතා අඩු වුණා.

අදාල පද්ධතියේ නව සැලසුම, Test Cases (Golden Set) → LLM → Judge Ensemble → Metrics → Dashboard/PR Comments යන පියවරවලින් යුක්ත වේ. Judge Ensemble එක, Faithfulness, Instruction Following, JSON Schema, Safety, Domain Expert වැනි බහු‑මාන පරීක්ෂකයන්ගෙන් සමන්විතයි. එක් එක් Judge එක, LLM (gpt‑4o‑mini) මත පදනම්ව, තත්ත්වය, නිවැරදිභාවය, සහ ආරක්ෂාව වැනි මානවීය පරීක්ෂණ කරයි.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලාංකීය තාක්ෂණික ශිෂ්‍යයින්, සංවර්ධකයින්, සහ ව්‍යාපාර සඳහා මේ පයිප්පලය විශාල අවස්ථාවක්. පළමු වශයෙන්, නිෂ්පාදන‑මට්ටමේ LLM පරීක්ෂණය, දේශීය AI නිෂ්පාදනවල ගුණාත්මකභාවය ඉහළ නැංවීමට උපකාරී වේ. දෙවනුව, CI/CD සමඟ ඒකාබද්ධ කිරීම, කේත නවීකරණය වේගවත් කර, දෝෂ හඳුනා ගැනීම තත්කාලිකව සිදු කරයි. තෙවනුව, Domain‑Specific Judge එකක් සකස් කිරීම, සිංහල භාෂාව, නීති, වාණිජ ආර්ථිකය වැනි දේශීය අවශ්‍යතාට අනුගතව, පාරිභෝගික‑මූලික AI සේවාවන් ගොඩනැගීමට මාර්ගය සලසයි.

ඉතා ඉක්මනින්, ශ්‍රී ලංකාවේ ස්ටාර්ට්‑අප්ස්, ගුවන් තොරතුරු, මූල්‍ය සේවා වැනි ක්ෂේත්‍රවල LLM භාවිතය, වැරදි තොරතුරු හේතුවෙන් ඇතිවන නීතිමය හා ආර්ථික අවදානම් අවම කරයි. එමඟින්, දේශීය තාක්ෂණික ආර්ථිකය තදින් වර්ධනය වෙමින්, ගෝලීය AI ප්‍රවණතා සමඟ සම්බන්ධ වෙයි.

අවසන් වශයෙන්, පරීක්ෂණ පයිප්පලය නිර්මාණය කිරීම, “vibe check” වලින් “metric‑driven” පද්ධතියකට පරිවර්තනය කිරීමයි. මෙය AI ව්‍යාපාරිකයන්ට, නිෂ්පාදන ගුණාත්මකභාවය 92% දක්වා අඩුකර, පාරිභෝගික විශ්වාසය වැඩි කරයි. එබැවින්, ශ්‍රී ලංකාවේ AI සංවර්ධනයට නව දොරටුවක් විවර වෙයි.

💡 ඔබේ AI පද්ධතියේ විශ්වාසය වැඩි කිරීමට අදම පරීක්ෂණ පයිප්පලය අරඹන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#LLM #Evaluation #Automation #SriLankaTech #AI