ඔක්තෝබර් මාසයේදී මම දෙකක් වෙනස් ප්රොම්ප්ට් සත්ය පරීක්ෂා කරලා, A ප්රොම්ප්ට් එක 4 ලකුණු ඉදිරියට දිනාගත්තා. එහෙමත් නැවත පරීක්ෂා කළාට, B ප්රොම්ප්ට් එක දිනාගත්තා. ඒ දෙකම එකම LLM‑judge, එකම මොඩලය, එකම ටෙස්ට් සෙට්, වෙනස් වූ එකම දෙය වන්නේ පිළිතුරු දෙකේ අනුක්රමයයි.
මෙය සරල ‘ගැලපීම’ නොවේ; එය ස්ථාන පක්ෂපාතය (position bias) ලෙස හැඳින්වේ. 2023 නේයුරිප්ස් සමුළුවේ Lianmin Zheng සහ ඔහුගේ කණ්ඩායම “Judging LLM-as-a-Judge with MT‑Bench and Chatbot Arena” පර්යේෂණයේ මේ වගේ පක්ෂපාත තුනක් (ස්ථානය, දිග්රහණය, ස්වයං‑ප්රියතාව) හඳුනාගෙන තිබුණා.
ඉතිහාසය පෙන්වන්නේ, GPT‑4 වගේ ශක්තිමත් LLM‑judge එකක් මිනිසුන්ගේ කැමැත්ත 80% කට වැඩියෙන් අනුගත කරනවා. නමුත් එහි පක්ෂපාතය නොසලකා හරිනවා නම්, ඔබේ මොඩලයේ ගුණාත්මකභාවය වෙනුවට judge එකේ අස්ථිරතාවය වාර්තා කරන්නේය.
පක්ෂපාතය රහස්ය නොවේ – එය සම්භාව්ය දෝෂයක් නොව, පද්ධතිමය වක්රතාවයක්. ඔබ judge එකට රූපවාහිනියක් දෙකම “දිගු” පිළිතුර B ස්ලොට් එකට දීලා 1,000 වරක් පරීක්ෂා කළාම, දිගු පිළිතුර නිතරම අඩු වශයෙන් ජයග්රහණය කරයි. ඒ නිසා නියමිත අගය (expected value) වැරදිව, නියමිත අගය (variance) නොව, තවදුරටත් නිශ්චිතව පෙන්වයි.
ශ්රී ලංකාවට ඇති වැදගත්කම
- ඉගැන්වීමේ පදනම: විශ්වවිද්යාල හා පාඨමාලා නිර්මාණකරුවන්ට AI‑judge භාවිතය අධ්යයන වශයෙන් පරීක්ෂා කළ හැකිය. පක්ෂපාතය හඳුනාගෙන නිවැරදි මූලධර්මයන් ගොඩනඟා ගත හැක.
- විකසකයින්ගේ වැඩ: LLM‑judge භාවිතයෙන් API, prompt optimisation වැනි වැඩ සලසන විකසකයින්ට අධික පරීක්ෂණයක් අවශ්ය වේ. පක්ෂපාතය දැන ගැනීමෙන්, ඔවුන්ගේ නිෂ්පාදන වඩා විශ්වාසනීය වේ.
- ව්යාපාරික තීරණ: ගනුදෙනුකරුවන්ට AI‑driven decision‑making භාවිතා කරන සමාගම්, judge‑bias හඳුනාගෙන නිවැරදි metric එකක් තෝරාගත හැක. එය සේවාවන්ගේ ගුණාත්මකභාවය, ගනුදෙනුකරුවන්ගේ සතුට වැඩි කරයි.
ඉදිරිපත් කළ ප්රතිපත්ති අනුව, බොහෝ eval tools (DeepEval, RAGAS, OpenAI Evals, Langfuse, promptfoo වැනි) LLM‑judge එකක් අඩංගු කරගෙන ඇත, නමුත් ඒවායේ bias‑analysis නොකළේ නම්, අසත්ය ප්රතිඵල වෙයි. පක්ෂපාතය හඳුනාගෙන, එය අඩු කිරීම හෝ වෙනත් deterministic scorer එකක් සමඟ සමතලා කිරීම අවශ්යය.
ඉතින්, AI‑judge එකක් “මිනිසුන්ගේ මතය” පරිමාණයක් වශයෙන් නොගනිය යුතුය; එය අලංකාර instrument එකක්, එහි අඩුපාඩු හඳුනාගෙන නිවැරදිව භාවිත කළොත්, ශ්රී ලංකාවේ තාක්ෂණික ප්රවණතා වැඩිදියුණු කරගත හැක.