ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-22, Wednesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 2

MUD පදනම් AI පරීක්ෂණය – $99 කින් LLM ගුණාත්මකත්වය මැනුම

MUD පදනම් AI පරීක්ෂණය – $99 කින් LLM ගුණාත්මකත්වය මැනුම

කෘතීම බුද්ධිය (AI) ක්ෂේත්‍රයේ නව පරීක්ෂණයක් අද ලොව ගමන් කරයි. CrucibleBench නමැති පර්යේෂණ කණ්ඩායම, $99.59 ක පිරිසින් MUD (Multi‑User Dungeon) පදනම් වූ AI‑agent benchmark එකක් නිකුත් කර ඇත. මෙය ලේඛන‑පදනම් ලෝකයක, NPC (Non‑Player Character) කණ්ඩායම් විශ්වාසය සහ සැකය ගොඩනඟා, ක්‍රියා‑පසුබැසීමේ තොරතුරු සුරක්ෂිත කරගෙන, 50 පියවර තුළ මොඩලයන්ගේ හැසිරීම් මැනේ.

පළමු අදියරේදී 13 වර්ගයේ LLM (Large Language Model) 650 ක්‍රියාත්මක කරමින්, සෑම රන්ගත සංකේතයක් (transcript) එකක්ම ප්‍රකාශයට පත් කරන ලදී. උදාහරණයක් ලෙස, GPT‑5.4 මොඩලයක් බරක්කයේ සයිනට් රින්ග් එක සොයා, එය කේප්ටන්ට ආපසු දෙයි, විශ්වාසය 75 දක්වා ගොඩනඟා, 14 වන පියවරේදී Watch එකට සම්බන්ධ වීමට සහාය ලැබේ. මෙම පරීක්ෂණය, “ලැටරල් තින්කින්” (Lateral thinking) නාමයෙන්, පරණ, අඩු පිරිවැය තාක්ෂණයක් නව ආකාරයකින් භාවිතා කිරීමේ උදාහරණයක් වේ.

ඇයි MUD? පැරණි අන්තර්ජාලයේ පදනම් වූ MUD එක, සීමිත අදේශ (command) ස්ථානය, සෘජු සමාජ ප්‍රතිචාර, සහ ක්‍රියා‑පසුබැසීමේ ස්ථායිත්වය මඟින් AI‑agents ගුණාත්මකත්වය නිරීක්ෂණය කිරීමට සුදුසු වේ. ක්‍රියා‑අංක 7, කාමර 12, භාණ්ඩ 14 යන සීමා තුළ, අසත්‍ය ක්‍රියා හඳුනා ගැනීමට පහසුය. NPC 4 දෙනෙකුගේ විශ්වාස‑සැක තත්ත්වය (0‑100) සංවාදයට අනුව වෙනස් වේ, එය මොඩලයකට අභ්‍යාස‑පසු ප්‍රතිචාර ලබා දේ.

ප්‍රධාන සොයාගැනීම් මත පදනම්ව, LLM‑judge එකක් ලීඩර්බෝඩ් එකේ රැංකු 6 ක් පමණ වෙනස් කළා, නමුත් සමස්ථ විශ්වාසනීයතාව අංක (κ) 0.04 ලෙස අඩුයි. එමනිසා, LLM‑judge භාවිතා කරන benchmark‌වල, එක්‑මොඩල එකඟතාව සහ රැංකු ස්ථායිත්වය වාර්තා කිරීම අත්‍යවශ්‍ය බව අවධාරණය කරයි.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ AI ශිෂ්‍යයන්, සංවර්ධකයන්, ව්‍යාපාරිකයින්ට මෙම benchmark එක විශාල අවස්ථාවක් වේ.

  • විද්‍යාත්මක පර්යේෂණය – පිරිවැය අඩු, සරල පරිසරයක් තුළ LLM‑ගුණාත්මකත්වය අගය කිරීමෙන්, විශ්වවිද්‍යාල පර්යේෂණය වඩාත් ප්‍රායෝගික වේ.
  • දැනුම වර්ධනය – සිසුන්ට සමාජ‑අන්තර්ක්‍රියා, විශ්වාස‑ගොඩනැගීම, සහ පසුබැසීමේ තොරතුරු කළමනාකරණය වැනි නව AI හැකියාවන් අත්හදා බැලීමට හැකියාව ලැබේ.
  • ව්‍යාපාරික ප්‍රයෝජන – ශ්‍රී ලංකාවේ සමාගම්, LLM තේරීම්, ගුණාත්මකත්වය, සහ නියෝජිත‑ආදර්ශන පරීක්ෂා කිරීමේදී, $99 පමණක් වැය කරමින් ඉක්මනින් තීරණ ගැනීමට ඉඩ සලසයි.

අනාගතයේ Phase 2 තැනීමට, වැඩිදුර පරිසර සැකසුම්, කැලිබ්‍රේෂන්, සහ අධික මුදල් නියෝජනයක් ඇතුළත් කරමින්, මෙම benchmark එක තවත් නිරවද්‍ය හා ප්‍රයෝජනවත් වනු ඇත.

ඉදිරියේදී AI‑agents කෙරෙහි විශ්වාසය, සමාජ‑අන්තර්ක්‍රියා, සහ පසුබැසීමේ තොරතුරු කළමනාකරණය මැනීමට, MUD පදනම් පරීක්ෂණය නව මාර්ගයක් ලෙස සැලකේ. ඔබත් මේ අවස්ථාවෙන් ලාභ ලබන්න.

💡 ඔබේ AI පරීක්ෂණය අදම අරඹන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Hacker News Frontpage ↗
#AI #LLM #Benchmark #MUD #TechNews