ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-22, Wednesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

LLM ඇගයුම් පරීක්ෂණයට 'Mutation Testing' – muteval නව මෙවලම

LLM ඇගයුම් පරීක්ෂණයට 'Mutation Testing' – muteval නව මෙවලම

AI මෝඩලවල ප්‍රදර්ශන පරීක්ෂා (eval) ලියන කාලයේ, එම පරීක්ෂා පසුබැසීමක් නොමැති බවට විශ්වාස කරලා ඉදිරියට යනවා. නමුත්, මෝඩලය හදිසි ලෙස දුර්වල වුණොත් ඒ පරීක්ෂා සාර්ථකව පවත්නාද කියලා අපිට කියන්න බැහැ. මේ ගැටලුවට විසඳුමක් ලෙස, Ashwin Ugale විසින් muteval කියන Python මෙවලම නිකුත් කරලා.

muteval, සොෆ්ට්වෙයා ඉංජිනේරු ක්ෂේත්‍රයේ “mutation testing” සංකල්පය LLM ඇගයුම් වලට ගෙන එනවා. මෙහිදී, පද්ධතියේ කුඩා දෝෂයක් (mutation) හෝ අඩුපාඩුවක් හඳුන්වා දී, පරීක්ෂා සෙට් එක ඒ දෝෂය හඳුනා ගන්නේද කියලා පරීක්ෂා කරනවා. උදාහරණයක් ලෙස, “must” කියන වචනය “should” ලෙස මෘදු කරලා, හෝ ලබාගත් ලේඛනයක් අස්ථානගත කරලා, හෝ අඩු ගුණාත්මක මෝඩලයක් භාවිතා කරලා පරීක්ෂා කරනවා.

මෙම මෙවලම 18 ක් පමණ mutation එකක් සපයන අතර, එක් එක් mutation එකට පසු පරීක්ෂා සෙට් එක නැවත ක්‍රියාත්මක කරයි. පරීක්ෂා සෙට් එක එම අඩුපාඩුව හඳුනා ගත්නම් “catch” කරයි, නැතිනම් “coverage gap” ලෙස ලැයිස්තුගත කරයි. අගයන “mutation score” 0% සිට 100% දක්වා වර්ගීකරණය කරයි. Vectara හි open‑rag‑eval සමඟ පරීක්ෂා කළ විට, muteval citation check එකෙන් මූලික දෝෂ හඳුනා ගත්තා, නමුත් “I don’t know” නියමය අඩු කළ විට එය නොදුටු බව පෙන්වා දුන්නා.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ AI ශිෂ්‍ය, සංවර්ධක, ව්‍යාපාරිකයින්ට muteval ගැඹුරු වාසි ලබා දෙයි:

  • ඇගයුම් ගුණාත්මකභාවය වැඩිදියුණු කිරීම – පරීක්ෂා සෙට් එකේ අඩුපාඩු හඳුනා ගනිමින්, නිවැරදි මෝඩල සංවර්ධනයට මඟ පෙන්වයි.
  • විකාශකයන්ට වේගවත් ප්‍රතිචාර – Python‑හි සරල ස්ථාපනය (pip install muteval) නිසා, CI pipeline එකට පහසුවෙන් එකතු කරගත හැක.
  • ව්‍යාපාරික රිස්ක් කළමනාකරණය – මෝඩලයක් හදිසි ලෙස දුර්වල වුනාම පාරිභෝගික තොරතුරු හෝ සේවා ගුණාත්මකභාවය අඩු වීමක් ඇති වීම වැළැක්වීමට උපකාරී.
  • දේශීය AI පර්යේෂණය – ශ්‍රී ලංකාවේ විශ්වවිද්‍යාල හා පර්යේෂණ ආයතනවලට, LLM ඇගයුම් පද්ධති නිර්මාණය හා අගයනයේ නව ප්‍රවණතා අධ්‍යයනයට මාර්ගයක්.

muteval, deepeval, RAGAS, promptfoo වැනි ජනප්‍රිය මූලධර්ම සමඟ සම්පූර්ණව අනුකූල වන අතර, නව පරීක්ෂා එකතු කිරීමේදී “suggested eval” ලෙස නිර්දේශ ලබා දේ. ඉදිරියේදී, මෙය ඇගයුම් සෙට් එකේ බහු‑කෝණීය වාර්තා සහිත “rating tool” බවට පත්වීමට අපේක්ෂා කරයි.

LLM තාක්ෂණය දිගටම වර්ධනය වෙමින්, ඒ සඳහා නිවැරදි ඇගයුම් පද්ධතියක් නොමැතිව ඉදිරියට යාම අභියෝගයක්. muteval, ඒ අභියෝගයට නව විසඳුමක් ලබා දී, ශ්‍රී ලංකාවේ AI පරිසරය තවත් ශක්තිමත් කරයි.

💡 ඔබේ LLM ඇගයුම් තවත් ශක්තිමත් කරගන්න muteval අත්හදා බලන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#LLM #Evaluation #MutationTesting #Python #AI