OpenAI විසින් නවතම විශ්ලේෂණයක් ප්රකාශ කර, AI කේත නිර්මාණ මූලයයන්ගේ ප්රදර්ශන තරඟයක් වන SWE‑Bench Pro හි ගැටළු හෙළි කර ඇත. මෙය AI මොඩලයන්ගේ කේත ලිවීමේ හැකියාව මැනීමට භාවිතා වන ප්රසිද්ධ benchmark එකක් වන අතර, එහි දෝෂ හඳුනා ගැනීම මගින් පර්යේෂකයන් සහ සංවර්ධකයින්ගේ විශ්වාසය කඩා වැටෙනු ඇත.
OpenAI කණ්ඩායම කළ පරීක්ෂණයේ අනුව, SWE‑Bench Pro හි දත්ත සංග්රහය, ප්රශ්න සැකසීම, හා ප්රතිඵල ඇගයීමේ ක්රමවේදයන්හි සංකීර්ණ ගැටළු ඇත. විශේෂයෙන්ම, පරීක්ෂණ දත්ත සෙට් එකේ කොටස් කිහිපයක් AI මොඩලයන්ට පෙර දැනුම් දී තිබීම හෝ අදාළ ප්රශ්නවලට අධික සමානත්වයක් පවතින බව සොයාගත්තා. ඒ නිසා, මොඩලයක් හොඳ ප්රතිඵලයක් ලබා දුන්නාම, එය සැබෑ කේත හැකියාවක් නොව, benchmark එකේ අඩුපාඩු හේතුවෙන් ලැබූ වාසියක් විය හැකිය.
මෙම තොරතුරු AI කේත නිර්මාණ ක්ෂේත්රයට ගැඹුරු බලපෑමක් ඇති කරයි. කේත benchmark එකක් විශ්වාසනීය නොවන්නේ නම්, පර්යේෂකයන් නව මොඩලයන්ගේ සැලසුම් තීරණ ගැන වැරදි තීරණ ගත හැකිය. ව්යාපාරිකයන් AI‑මූලික coding assistants ගැන ආයෝජනය කිරීමට පෙර, එම benchmark එකේ පරීක්ෂණ ප්රතිඵලයන් පිළිබඳ අවධානයෙන් යුතු විය යුතුය.
ශ්රී ලංකාවට ඇති වැදගත්කම
- විශ්ව විද්යාල සිසුන් – AI coding benchmark ගැන නිවැරදි අවබෝධයක් ඇතිව, පර්යේෂණ ව්යාපෘති හෝ තරඟ සඳහා නිවැරදි මාර්ගෝපදේශ ලබා ගත හැකිය.
- දේශීය සංවර්ධකයින් – AI‑සහාය ලේඛන නිර්මාණ මෙවලම් තේරීමේදී, benchmark එකේ ගුණාත්මකභාවය පරීක්ෂා කර, වඩා හොඳ උපකරණ තෝරා ගත හැකිය.
- ව්යාපාරික ආයෝජකයින් – AI‑කේත automation තාක්ෂණයට මුදල් වෙන් කිරීමේදී, වැරදි benchmark එකක් මත වැරදි තීරණ ගැනීමේ අවදානම අඩු කර ගත හැකිය.
OpenAI විසින් මෙම ගැටළු හෙළි කිරීම, AI coding benchmark පද්ධති සවිස්තරාත්මක විශ්ලේෂණයක් අවශ්ය බව තහවුරු කරයි. එම නිසා, ශ්රී ලංකාවේ තාක්ෂණික පරිසරය තුළ, AI මොඩලයන්ගේ සැලසුම් හා පරික්ෂණ ක්රමවේදයන් පිළිබඳ විවේචනාත්මක සිතුවිලි ගත යුතුය.
අනාගතයේ AI‑කේත තාක්ෂණය වඩාත් විශ්වාසනීය වන පරිදි, benchmark පද්ධති නවීකරණය කිරීම, පර්යේෂකයන්, සංවර්ධකයින් සහ ව්යාපාරිකයින්ගේ හොඳම තීරණ ගැනීමට මූලික වේ.