ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-23, Thursday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

AI තීරණවල “divergence” මැට්‍රික්ස් අසාර්ථකයි: නව “tripwire” ක්‍රම 4ක් පරීක්ෂා

AI තීරණවල “divergence” මැට්‍රික්ස් අසාර්ථකයි: නව “tripwire” ක්‍රම 4ක් පරීක්ෂා

AI මොඩලයක පදනම්ව කරන තීරණයන්හි වගකීම තහවුරු කිරීම සඳහා භාවිතා කරන divergence මැට්‍රික්ස්, නව පරීක්ෂණයකින් වැරදි ජනගහනයකට යොමු කරන බව හෙළිවී ඇත. මේ පර්යේෂණය Dev.to වෙබ් අඩවියේ ‘Agent Determinism Illusions’ කතා මාලාවේ Part 7 ලෙස ප්‍රකාශිතයි.

Part 6 දක්වා, මොඩලයන්ගේ බහු‑දෘෂ්ටි ඡන්ද (L2) එකඟතාව (unanimous) හෝ විරෝධතාව (divergence) අනුව auto‑pass හෝ human escalation යන ක්‍රියාමාර්ග ගන්නා රූපරේඛාවක් සකස් කර තිබුණි. එහිදී ‘divergence’ යනු අසපසුතාවය මැනීමක් වන අතර, ඒකමත (unanimous) තීරණයන්හි පද්ධතික පක්ෂපාතය (systematic bias) හඳුනාගත නොහැකි බව දැනුම් දී තිබුණි.

ඇලෙක්සී ස්පිනොව් (Alexey Spinov) විසින් පෙන්වා දුන් කරුණ වන්නේ, අසමත් වීමට ඉඩ ඇති උසස්‑විශ්වාස (high‑confidence) තීරණයන් බහු‑දෘෂ්ටි ඡන්දයක් සමඟ එකඟවීම නිසා divergence‑to‑human මාර්ගය වැරදි ජනගහනයකට (wrong population) යොමු වීමයි. එබැවින් ඔහු T1 (known‑reversal class‑based escalation) සහ T2 (unanimous + high‑confidence + reversal class) යන සරල විකල්ප දෙකක් යෝජනා කළේය.

පරීක්ෂණ A – offline proxy

DF v2 මොඩලයේ 96 ක් “MISS” වාර්තා වූ නමුත් 95.8% ක් 0.9 හෝ ඉහළ විශ්වාසය (confidence) දක්වා තිබුණි. ඒ අනුව, විශ්වාසය ≥ 0.9 වන ඡන්දය unanimous‑channel proxy ලෙස සැලකීය. ප්‍රතිඵලවලින් 97.9% “MISS” තීරණයන් auto‑pass වීමට පෙරළී, 2.1% පමණක් escalation වෙයි. මෙය T2 (reversal class + high‑confidence) සහ D (divergence‑only) සම්මුඛව බැලූ විට D + T2 එකතුව 100% “MISS” අල්ලයි යැයි පෙන්වයි.

පරීක්ෂණ B – නියමිත Strict/Balanced/Lenient සැකසීම්

එකම 20 DF v2 දෘශ්‍යයන්හි, ත්‍රි‑පාර්ශ්වික (persona) ප්‍රතිචාර 60 ක් ලබා ගෙන, D, T1, T2, D+T2 යන escalation නීති පරීක්ෂා කළා. වැඩිම තත්ත්වයේ “bad” සිදුවීම් සියල්ලම එකඟව “reject” විය. එහිදී “dangerous accept” (unanimous PASS on bad) කිසිදු සිදුවීමක් නොපෙනුණි. ඒ නිසා D (divergence‑only) ක්‍රමය තනිව භාවිතා කළහොත් ප්‍රයෝජනවත් නොවේ යැයි තීරණය කරන ලදී.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

  • ඩිවෙලපර්ලා – AI මොඩලයන්ගේ විශ්වාස මට්ටමට පදනම්ව escalation නීති සැකසීමේ නව ආකෘති ඉගෙනගත හැකිය.
  • ඉගෙනුම් ආයතන – “high‑confidence + reversal class” යන මූලධර්මය AI ethics පාඨමාලා වලට ප්‍රායෝගික උදාහරණයක් වනු ඇත.
  • ව්‍යාපාර – AI‑driven automation හි වැරදි තීරණවලින් සිදුවිය හැකි නුසුදුසු ප්‍රතිඵල වැළැක්වීමට, නව tripwire ක්‍රමයන් ඉතා ප්‍රයෝජනවත් වේ.

අවසන් වශයෙන්, “divergence” එකක් පමණක් විශ්වාසය මැනීමට යොදා ගැනීමේ අඩුපාඩු දැක්වීමෙන්, AI පද්ධතිවල නිරපේක්ෂ හා ආරක්ෂිත තීරණ ගත කිරීමේ නව මාර්ගෝපදේශයක් සකස් වීමට පදනමක් සපයා ඇත.

ඉදිරියේදී AI ආධාරිත සේවා සැලසුම් කරන ඕනෑම කෙනෙකුට, මෙම පර්යේෂණයේ ඉගෙනුම් අත්‍යවශ්‍ය වේ. ඒ අනුව, මොඩලයන්ගේ “high‑confidence” තීරණයන්ට අමතරව “reversal class” පරීක්ෂාවක් එක් කිරීමෙන්, වැරදි අනුමත කිරීම් අවම කර ගත හැක.

💡 AI මොඩලයේ ආරක්ෂිත තීරණ ගැන වැඩිදුර කියවන්න.
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#AI #Machine Learning #Model Evaluation #Tech Research #Sri Lanka