AI ඒජන්ට් පරීක්ෂණ ක්ෂේත්රයේ නව පියවරක් දැක්කා. දැන් පරීක්ෂණ කණ්ඩායම් සත්ය තොග තොරතුරු (real traffic) තුළ ඇති වාර්ථා (trace) එකක් පදනම් කරගෙන, ඒ වාර්ථාවේ දෝෂය නිකුත් කරමින් පරීක්ෂණයක් ආරම්භ කරයි. මෙයින් තිරස්ථ (snapshot) හෝ Slack සංවාදයක් නොව, සත්ය අත්දැකීමක් මත පදනම් වූ test case එකක් ලැබේ.
LangChain නව Eval Engineering Skill හරහා, රිපොසිටරි කියවීම, ඒජන්ට් ප්රතිඵල විශ්ලේෂණය, වාර්ථා (trace) කියවීම, එම කාර්යය කළ පුද්ගලයා සමඟ සාකච්ඡා කිරීම, සහ Harbor evals නිකුත් කිරීම යන පියවර සියල්ල ස්වයංක්රියව සිදු වේ. ඒජන්ට් තනිව වැඩ කරනවාට පමණක් සීමා නොව, ඊළඟ කාර්යය සඳහා එහි එන්ජින් (engine) වැඩිදියුණු කිරීමේ සහායකයෙකු ලෙසද ක්රියා කරයි.
මෙම ප්රවණතාවය පරණ "benchmark score" මත අධික වශයෙන් රැඳී සිටීමේ ගැටලුව දුරලයි. සත්ය තොගයේ ඇති දෝෂයන් – උදාහරණයක් ලෙස, වැරදි මෙවලමක් තෝරා ගැනීම, පරණ ප්රතිපත්තියක් ලබා දීම, හෝ මනුෂ්යයාගේ අතුරුදන් වීම – එම දෝෂය සෘජුවම ticket එකකට පරිවර්තනය කරයි. එම ticket එකට සම්බන්ධිත eval එකක් ක්රියාත්මක කළ හැකි නිසා, ඉදිරියේදී ඒ දෝෂය පරීක්ෂණ කට්ටලයට (test suite) එක් කර ගැනීම සරල වේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ සංවර්ධකයින්, DevOps කණ්ඩායම්, සහ තාක්ෂණ ව්යාපාරිකයින්ට මේ ප්රවණතාවය විශාල වාසියක් ලබා දෙයි. සත්ය වාර්ථා මත පදනම් වූ පරීක්ෂණයක් නිසා, නිෂ්පාදන පරිසරයේ සිදුවන ගැටලු ඉක්මණින් හඳුනාගෙන, ඒ සඳහා ස්වයංක්රිය ticket එකක් නිර්මාණය කර, කාර්ය මණ්ඩලය ඒකම තැනින්ම විසඳුම් ගොඩනඟා ගත හැකිය. මෙයින් ඉදිරිපත් වන විශාල වාසියන්:
- ඉගෙනුම් වේගය වැඩිවීම: සිසුන් සහ නව සංවර්ධකයින්ට වාර්ථා විශ්ලේෂණය, ticket ලේඛනය, සහ eval සැකසීමේ ක්රියාවලිය අත්හදා බැලීමට අවස්ථාව ලැබේ.
- ව්යාපාරික විශ්වාසය: සත්ය තොගයේ ඇති දෝෂයන් ඉක්මණින් නිවැරදි කර, සේවා නිරන්තරතාවය සහ පාරිභෝගික විශ්වාසය වැඩි කරයි.
- සම්පත් ඉතිරි කිරීම: benchmark පරීක්ෂණ වල අධික වෙලාවක් ගත නොකර, දෝෂය මතු වුනාම ඒකට සෘජු ප්රතිචාරයක් ලබා ගත හැකිය.
අවසානයේ, AI ඒජන්ට් පරීක්ෂණය වාර්ථා තොරතුරු මත පදනම් කර ගැනීම, ශ්රී ලංකාවේ තාක්ෂණික පරිසරය තවත් ඵලදායී, නිරවද්ය, සහ නවෝත්පාදනශීලී කරයි.