AI සංවර්ධන කණ්ඩායම් බොහෝ වෙලාවේ ප්රෝම්ප්ට් හෝ මොඩෙල් වෙනස්කම් පරීක්ෂා නොකර නව සංස්කරණ නිකුත් කරනවා. ඒත් සොෆ්ට්වේර් ලෝකයේ පසුබිම් කණ්ඩායමක් PR එකක් පරීක්ෂා පත්රය (test suite) අසමත් වුවාම ඒක එකතුව නොකරයි. මේක AI ක්ෂේත්රයටත් අදාළ කරගන්න “Eval‑Gated” පද්ධතියක් හඳුන්වා දෙනවා.
ආටලස් (Atlas) කියන RAG (Retrieval‑Augmented Generation) කෝපිලට් ව්යාපෘතියේ අත්දැකීම් අනුව, සෑම PR එකක්ම offline, GPU‑free, deterministic evaluation gate එකක් හරහා යනවා. මේ gate එකේ මූලික අරමුණ වන්නේ metric baselines, floor policies, regression bands, සහ cost‑gate එකක් භාවිතා කරමින් ගුණාත්මක හෝ පිරිවැය පසුබැසීමක් ඇති වුවහොත් merge එක අවහිර කරනවා.
මූලික සැලැස්ම
- Floor + regression band: පූර්ණ perfection එකක් ඉලක්ක නොකර, නියමිත floor එකක් (උදා: faithfulness ≥ 0.656) සහ පසුගිය baseline එකට සසඳා regression band (0.05) තබයි. මෙය code coverage එක ratchet කිරීම වගේ.
- Deterministic, GPU‑free CI: live‑model evaluation එකේ වේගය, වියදම, flaky බව නිසා, Atlas පසුගිය cassette (recorded model interaction) පදනම් කරයි. මොඩෙල් වෙනස් වුවත් ඒ වෙනස cassette diff එකක් ලෙස සලකා review කරයි.
- Cost gate: prompt එකක token usage දෙගුණයක් වුණාමත් quality එක හොඳින් පවතිනවා නම්, cost regression එකක් ලෙස build එක අසාර්ථක කරයි. p95 latency budget එක backend සේවාවකට තියෙන පරිදි.
මෙම පද්ධතියේ ප්රතිඵල ඉතා පැහැදිලි. QLoRA adapter එකක් citation formatting සඳහා fine‑tune කළ විට, citation validity 0.00 සිට 0.955 දක්වා ඉහළ ගියේය, සේවා පිරිවැය 79% කින් අඩු වුණා, faithfulness 0.10 කින් අඩු වුනත් floor එක ඉක්මවා පවතිනවා. ඒ නිසා promotion gate එක data‑driven තීරණයක් ලබා දුන්නා.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ AI සංවර්ධකයින්, විද්යාල/විශ්වවිද්යාල සිසුන්, සහ තාක්ෂණික ව්යාපාර සඳහා මේ පද්ධතියේ වැදගත්කම අති විශාලයි.
- ඉගෙනුම් ආකාරය: golden questions හා adversarial prompts 20‑30ක් සකස් කර CI job එකක් හරහා පරීක්ෂා කිරීම, prompt එකක් code එකක් වගේම සැලකීමට ඉඩ සලසයි.
- ව්යාපාරික පිරිවැය: cost‑gate එක නිසා token usage පාලනය කර, GPU වියදම අඩු කර, මූල්යමය ආකාරයෙන් ප්රතිලාභ ලබා ගත හැක.
- ගුණාත්මකභාවය: Retrieval accuracy, citation correctness, faithfulness වැනි metric ගණනාවක් automated test suite එකකින් පරීක්ෂා කර, පාරිභෝගික විශ්වාසය ඉහළ ගත හැක.
ඉදිරියේදී, RAGAS වැනි සංකීර්ණ metric එකක් නොමැතිවත්, සරල golden set එකක් පමණක් ආරම්භක පියවරක් ලෙස ගත හැක. එය සංස්කරණය, model swap, prompt optimisation වැනි සියලු වෙනස්කම් review‑driven කරයි. AI සංවර්ධනයේ පරණ testing සංකල්පය නැවත යොදා ගැනීම, ශ්රී ලංකාවේ තාක්ෂණික ප්රගතියට නව මාර්ගයක් අරඹයි.
ඉදිරි පියවර ලෙස, ඔබේ AI පද්ධතියට මේ evaluation gate එක එක්කර, data‑driven තීරණයක් ගැනීමට ආරම්භ කරන්න. එවිට “අපට අඩු වුණාද?” කියන ප්රශ්නයට ස්පෂ්ට පිළිතුරක් ලැබේ.