ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

Sentry මගින් හෙළිවූ scoreboard වැරදි – මොඩලය නොව, ලේයරය බිඳී

Sentry මගින් හෙළිවූ scoreboard වැරදි – මොඩලය නොව, ලේයරය බිඳී

Dev.to හි Summer Bug Smash තරඟයේදී, Sentry භාවිතා කරමින් කළ සමාලෝචනයකින් පෙන්වාදුන් ගැටළුවක් තවත් පරීක්ෂකයින්ගේ අවධානයට ගෙන ආවේ. මුල් වරට scoreboard එකේ “malformed” යන ලේබලය ත්‍රිවිධ අසත්‍ය සිදුවීම් එකට එකතු කර තිබුණි. එය මොඩලයක් අසමත් වීමක් නොව, වාර්තා මට්ටමේ දෝෂ තුනක් බව සනාථ වුණි.

පළමු පරීක්ෂණයේ, ලෝකල llama3.2 (Ollama) සහ Anthropic Sonnet යන දෙකම 6/6, 5/6 වැනි “malformed” ලෙස ලේඛනය වුණා. එය “මොඩලය අසාර්ථකයි” යන නිගමනයට පත් කළා. නමුත් raw output විශ්ලේෂණය කළ පසු, ඒ “malformed” යන වචනය තුනක් වෙනස් සිදුවීම් නිරූපණය කරන්නේ කියා හඳුනා ගන්නා ලදී.

දෝෂ 1 – CLI subprocess වල ANSI control code : Ollama CLI එකෙන් stdout ලබා ගතදී, spinner, cursor reposition වැනි ANSI අක්ෂර හෝ control bytes (උදා: \x1b[K, \x1b[7D) ඇතුළත් විය. එම bytes JSON අන්තර්ගතයේ ඇතුළත් වූ නිසා parser එකේ parsing දෝෂයක් ඇති වුණා. ඒ නිසා 5/6 අවස්ථාව “malformed” ලෙස වාර්තා වුණා.

දෝෂ 2 – Markdown fences තුළ JSON : Anthropic Sonnet විසින් JSON පිළිතුර markdown fences (```json) තුළ සපයා ඇත. අපගේ parser එක ඒ fences ඉවත් නොකර නිසා, JSON වලින් පටන් ගන්නා ලද පිළිතුර අසත්‍ය ලෙස හඳුනා ගත්තා.

මෙම දෙකම එකම scoreboard ලේබලය “malformed” යනුවෙන් පෙන්වුවත්, ඒවා මොඩලයේ ගැටළුවක් නොව, capture layer හෝ parsing layer වල දෝෂයන් බව පැහැදිළි වුණා. Sentry දැන් මේ ලේයරයන් අඩංගු වශයෙන්, කොහේ දෝෂය ඇතිවී තිබේද යන්න තේරුම් ගත හැකි වන පරිදි instrumentation එකක් එක් කර ඇත.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ AI සංවර්ධකයින්, පර්යේෂකයින්, ව්‍යාපාරිකයින් සඳහා මෙම ගැටළුවේ වැදගත්කම පහත පරිදි සාරාංශ කළ හැකිය:

  • උපකරණ හා API භාවිතයේ සත්‍යතාවය පරීක්ෂා කිරීමේ වැදගත්කම තේරුම් ගත හැකිය.
  • scoreboard එකේ “summary” මත අධික විශ්වාසය තැබීමේ අවදානම අවධාරණය කරයි – raw data පරීක්ෂා කිරීම අත්‍යවශ්‍ය වේ.
  • Sentry වැනි observability tool එකක් භාවිතයෙන්, ලේයර පදනම් ගැටළුව හඳුනා ගැනීමේ කාර්යක්ෂමතාව වැඩිවේ, එය ලෝකල AI ව්‍යාපාරික පද්ධති නිර්මාණයට ප්‍රයෝජනවත් වේ.
  • ශ්‍රී ලංකාවේ AI ආරම්භකයන්ට, open‑source eval harness හා memory‑authority‑auditor වැනි ව්‍යාපෘතිවලින් ඉගෙන ගත හැකි නව best practice එකක් මෙය වේ.

අවසානයේ, scoreboard එක “කඩවා” යැයි කියා පෙනුනේ, එය දත්ත මත පදනම් වූ වගුවක් නොව, තොරතුරු සංග්‍රහයේ අඩුපාඩු හේතුවෙන් පවතින බවයි. මේ නිසා පර්යේෂකයින් “මොඩලය අසාර්ථකයි” කියා නොසලකා, “කොයි ලේයරය වැරදිද?” යන ප්‍රශ්නයට මුහුණ දිය යුතුය.

ඉදිරිපත් කර ඇති නිවැරදි capture, parser, හා Sentry instrumentation මඟින් AI eval ක්‍රියාකාරකම්වල පාරදෘශ්‍යතාවය වැඩි කරයි. මෙය ශ්‍රී ලංකාවේ AI පරිසරය වඩා ශක්තිමත් කරගැනීමට නව මාර්ගයක් වේ.

💡 ඔබේ AI eval ක්‍රියාවලිය දැන් Sentry සමඟ තවත් නිවැරදි කරගන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#Sentry #AI #Eval #BugFix #LLM