කෘතිම බුද්ධිය (AI) ක්ෂේත්රයේ නවතම පර්යේෂණයක්, දිගු කාලීන කාර්යයන් සඳහා රීඨින්ෆෝර්ස්මෙන්ට් ලර්නින්ග් (RL) මොඩලයන් පඩිවෙන තැන තවත් ගැටළුවක් හඳුනා ගනී. ගවේෂකයන් පෙන්වා දුන්නේ, කාර්යය දිගු වන විට පුහුණු කිරීම අතිශය අඩු වෙමින්, නියමිත ප්රතිඵලයක් ලබා ගැනීමට ඉතා දුර්ලභ බවයි.
මෙම ගැටලුව සවිස්තරාත්මකව විශ්ලේෂණය කර, Zhejiang University (ZJU-REAL) කණ්ඩායම BEACON නමින් නව ක්රමයක් හඳුන්වා දී ඇත. BEACON, "Milestone‑Guided Policy Learning" යන නාමයෙන් ද හැඳින්වේ, එය දිගු කාලීන පරිසරයන්හි RL පුහුණු කිරීමේ අඩුපාඩු දෙක හඳුනා ගනිමින්, ඒවා විසඳීමට තත්ත්ව‑මට්ටමේ සම්භාව්ය පියවර ගනී.
ගැටළුවේ මුලික හේතු
- විරුද්ධ gradient – සාමාන්ය RL ආකෘතියේ (GRPO වැනි) එක් පථයක් පූර්ණ අගයක් ලබා දෙන අතර, එකම ක්රියාව දෙකක් වෙනස් ප්රතිඵලයක් ලබා දෙන විට, ඒ ක්රියාවට සකස් කරන gradient එක අන්තර්ගතව විරෝධී වේ. පර්යේෂකයන් CAR (Contradictory Action Ratio) නමින් මෙම ප්රතිශතය ගණනය කර, 40% ඉක්මවා යන බව සොයා ගත්ති.
- සම්පූර්ණ නොවන සාර්ථකතා – පුහුණු දත්ත තුළ 39‑47% පථයන් අර්ධ‑සාර්ථක (කොටස් කාර්යයක් කරයි, නමුත් මුළු කාර්යය අසමත්) වන අතර, ඒවාට 0 සම්පූර්ණ ප්රතිඵලයක් ලබා දේ. එම නිසා 73% ද්රව්යයට කිසිදු ඉගෙනුම් සංඥාවක් නොලැබේ.
දිගු කාලීන කාර්යයන්හි අසාර්ථකතා මෙම දෙකම එකට වැඩිවීම නිසා සිදුවේ. උදාහරණයක් ලෙස ALFWorld පරිසරයේ, කෙටි කාර්යයන්හි සාර්ථකතා 76.7% වන අතර, දිගු කාර්යයන්හි එය 53.5% දක්වා අඩුවේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
BEACON ක්රමය ශ්රී ලංකාවේ තොරතුරු තාක්ෂණ ශිෂ්යයන්, සංවර්ධකයන් සහ ව්යාපාරිකයන්ට විශාල අවස්ථා ලබා දේ.
- වෙනත් පරිසරයන්හි (උදා. e‑commerce, ගෙවීම් පද්ධති) දිගු‑කාලීන AI අයදුම්පත් නිර්මාණය කිරීමේදී ඉගෙනුම් කාලය 4‑ගුණයකට අඩු කරයි.
- ශ්රී ලංකාවේ ආරම්භක සමාගම් සඳහා, අඩු සම්පූර්ණ දත්ත සමඟත් අධික නිරවද්යතා ලබා ගත හැකිවීම, පූර්ව‑ආයෝජන අවශ්යතාවය අඩු කරයි.
- විශ්වවිද්යාල හා පර්යේෂණ ආයතනවල AI පාඨමාලාන්විතයන්හි, Milestone‑based learning මොඩලයක් ලෙස BEACON ඇතුළත් කිරීම, සිසුන්ට නවතම RL තත්ත්වයන් අත්හදා බැලීමට අවස්ථාව සලසයි.
BEACON ක්රමය, පාරිභෝගික අත්දැකීම්, රොබෝට් පද්ධති, සහ සමාජ සේවා වැනි විවිධ ක්ෂේත්ර වලදී, දිගු‑කාලීන අභියෝග හසුරවීමට නව මාර්ගයක් සපයයි. එම නිසා ශ්රී ලංකාවේ තාක්ෂණික නවෝත්පාදනයේ තරඟශීලීත්වය ඉහළ යාමට මෙය වැදගත් වේ.
අනාගතයේදී, BEACON වැනි ක්රමයන් RL ආකෘතිවල දීර්ඝ‑කාලීන කාර්යයන්හි විශ්වාසය නැවත ගොඩනඟා, AI පද්ධතිවල නිරවද්යතාවය වැඩි කරයි. ඒ නිසා, තාක්ෂණික පර්යේෂකයින්, සංවර්ධකයින්, සහ ව්යාපාරිකයින්ට මෙය අනිවාර්යයෙන්ම නිරීක්ෂණය කළ යුතු නව ගමනක් වේ.