ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-25, Saturday
💻 ක්‍රමලේඛනය · 🕒 කියවීමට විනාඩි 2 · 👁 1

බේස්ලයින් 0.000? ප්‍රතිඵල නොව, හාර්නස් දෝෂයයි – පරීක්ෂා ලැයිස්තුව

බේස්ලයින් 0.000? ප්‍රතිඵල නොව, හාර්නස් දෝෂයයි – පරීක්ෂා ලැයිස්තුව

ඔබේ AI මොඩලය බේස්ලයින් එක ලෙස 0.000 ලකුණු ලබා ගත්තා නම්, එය ප්‍රතිඵලයක් නොව, පරීක්ෂණ හාර්නස් (harness) ගැටළුවක් බව සැලකිය යුතුය. මෙවැනි අංකයක් දැක්කාම පළමුව පරීක්ෂා කරන ලැයිස්තුවක් නැරඹීම වැදගත්.

ඊයේ Reddit හි r/Rag ප්‍රජාවක එක් නිර්මාණකරු, තමමගේ මතක (memory) පුස්තකාලය RAG (Retrieval‑Augmented Generation) සමඟ සසඳමින්, k=20 වාක්‍ය‑මට්ටමේ හොඳ ප්‍රතිඵලයක් බලාපොරොත්තු විය. නමුත් එහි ප්‍රතිඵල තුනම null වීමත්, ඒක අඩු බේස්ලයින් එකක් ලෙස ප්‍රකාශ කිරීමත් වුනා. ඒ අතර, ඔහුගේ පරීක්ෂණය තුළ ඇති වූ දෙකේදීම අති සාමාන්‍ය බග් (bug) දෙකක් හඳුනා ගැනීමේ අවස්ථාව ලැබුණි.

බග් 1 – වෙනස් Context Budget පළමු පරීක්ෂණයේ, මතක අතුරුදන්වීමේ (memory arm) k=20 වාක්‍ය‑මට්ටමේ ප්‍රතිඵලය, BM25 අතුරුදන්වීමේ (BM25 arm) සම්පූර්ණ සැසියක (session) පදයක් (characters) 1.3k හා 11.9k ලෙස වෙනස් වුණා. "Top‑k" එකම වුවත්, ප්‍රතිඵලයේ අඩංගු පරිමාණය (budget) 10 ගුණයක් වෙනස් වූ නිසා BM25 එක අති විශාල ලෙස හොඳට පෙනුනේය. Budget එක සමාන කළ පසු, මතක අතුරුදන්වීමේ නිවැරදිත්වය 0.28 සිට 0.59 දක්වා වැඩි විය. මෙය පෙන්වන්නේ, සමාන "top‑k" එකක් පවා, context size එක නොගැලපේ නම්, ප්‍රතිඵල අර්ථවත් නොවන බවයි.

බග් 2 – 0.000 බේස්ලයින් සහ Clean Logs දෙවන ගැටළුවේදී, තවත් මතක මෙවලමක් බේස්ලයින් ලෙස භාවිතා කරමින් 0.000 ලකුණු ලැබුණා. ඉදිරියට extraction model එක දියුණු කරත්, නැතහොත් API පරාමිතිය top_k= වෙනුවට limit= ලෙස යොදා ගැනීමත්, සෑම විටම logs පිරිසිදු වුණා. මෙය පෙන්වන්නේ, සැසිය 6,000 පද වලට කපා දැමීම (truncation) හා API පරාමිතීන් අමතක කිරීම (swallowed kwargs) නිසා හාර්නස් වැරදි බවයි. ඒ නිසා, පරාමිතීන් වෙනස් කළ විට ප්‍රතිඵලයත් වෙනස් විය යුතුය – එය නොවී නම්, හාර්නස් බිඳී ඇත.

මෙම දෙකේ ගැටළුව සලකා බලමින්, ලේඛකයා තුනක් වන “ගේට්” (gate) එකක් නිර්මාණය කරයි, ඒවා:

  • **Positive Control per arm** – සෑම අතුරුදන්වීමකම (arm) එකක් සඳහා, corpus එකේම ground truth එකක් භාවිතා කරමින් අඩුම සීමාවක් (threshold) පරීක්ෂා කිරීම. එය පසුබැසීම (dead harness) හඳුනාගැනීමට උපකාරී.
  • **Evidence‑in‑Context Ceiling** – ලබාගත් context එක තුළ gold evidence එක ඇතුළත්දැයි පරීක්ෂා කිරීම. එය recall ceiling එක ලෙස වාර්තා කරයි. මෙය 3.5% වැනි අඩු අගයක් නම්, කිසිදු රැංකරය (reranker) හෝ prompt වෙනස් කිරීමත් ප්‍රතිඵලය අඩු නොකරයි.
  • **Parameter‑Efficacy Assertion** – වෙනස් කරන සෑම පරාමිතියක් (knob) සඳහාම, ඒ වෙනස්කමක් observable behavior එකට බලපාන බව තහවුරු කිරීම. මෙය swallowed‑kwargs වැනි ගැටළු හඳුනාගැනීමට අත්‍යවශ්‍යයි.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ AI, RAG, සහ මතක‑ඇඩ්වන්ස් කරන සංවර්ධකයින්ට මෙම පරීක්ෂණ ගේට් මාර්ගෝපදේශය පහත පරිදි ප්‍රයෝජනවත් වේ:

  • විශ්වාසනීය benchmark එකක් සකස් කිරීමෙන්, ආකෘති (model) තේරීම් වඩා නිවැරදිව සිදු වේ.
  • දෝෂ හඳුනා ගැනීමේ ක්‍රියාවලිය සරල කර, සංවර්ධන කාලය හා වියදම අඩු කරයි.
  • ශ්‍රී ලංකාවේ startup සහ IT සමාගම්, නිශ්පාදන ගුණාත්මකභාවය වැඩි කර, ග්ලෝබල් වෙළඳපොලේ තරඟකාරීත්වය වැඩි කර ගත හැක.

අවසානයේ, බේස්ලයින් එක 0.000 ලැබුනොත්, එය “ඵලයක්” නොව “හාර්නස් ගැටළුවක්” බව පිළිගැනීම, සියලු AI පරීක්ෂණවල නිවැරදිත්වය රැකගැනීමට මුල් පියවරයි.

💡 ඔබේ AI පරීක්ෂණය දැන්ම නිවැරදි කරගන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#Benchmark #AI #RAG #Dev #API