කියන්නෙ, ඔබේ AI ඇජන්ට් එකට රැයක් පුරා ස්වයංක්රීයව නඩත්තු කරන්න ටයිමරයක් දුන්නාම, එයා 136 මිලියන ටෝකන් වියදම් කරලා ඉඳලා, වැඩේ කිසිම ප්රගතියක් නොකරන තත්ත්වයක් ඇති වෙලා.
ඉතින්, එක් සංවර්ධකයෙක් තම AI‑agent ප්රොජෙක්ට් එක අඩුවෙන් පවත්වා ගැනීමට, එයට එක් එක් මිනිත්තු කිහිපයකට එක් වරක් ‘ඇවිල’ කියලා පණිවුඩයක් යවන ස්කෙජුලර් එකක් සකස් කරලා. ඒක තවදුරටත් රෑ පුරා ක්රියාත්මක වුණා. පහලින්ම, ඒ සෙෂන් එක 136M ටෝකන් පරිභෝජනය කළා. ඒ අතර, එයා අනෙකුත් ඇජන්ට්ලා අත්හිටුවා, සබ්ස්ක්රිප්ෂන් ගිණුමේ 5‑පැය ටෝකන් සීමාව ගිහින්, අනිවාර්යයෙන්ම වෙනත් සේවාවන්ට පවා සම්පත් අඩු කරලා.
කොහොම වෙලාද කියලා බලනවානම්, වඩාත් වැදගත් කරුණ 97.7% ටෝකන් ගණන තමයි ඇජන්ට් එක තමන්ගේ පසුගිය සංවාද ඉතිහාසය නැවත කියවීමට යොදාගෙන තිබුණේ. 508M ටෝකන් පසුබැසීම, නව වැඩ 11.9M ටෝකන් පමණයි – 1,297 වාරයක් පුරා 20‑පැය දිගු ත්රෙඩ් එකක. එනම්, ඇජන්ට් එක වැඩක් නොකර, තම ඉතිහාසය කියවන්නම ගාණාගාණී විය.
කාරණය කුමක්ද?
මේ වගේ සිදුවීම තුනක් එකට එකතු වීමෙන් උදාවෙයි:
- API stateless – මොඩලය කතාබහක් මතක තබා නොගනී; සෑම වාරයකම පූර්ණ ත්රෙඩ් එක (system prompt, පූර්ව පණිවුඩ, tool call, result) යවලා ප්රොසෙස් කරයි.
- Prompt cache කාලය කෙටි – Claude වැනි සේවාදායකයන් cache එක 5 මිනිත්තු පමණක් රඳා සිටී. ටයිමරේ පරතරය ඒ කාලයට වඩා වැඩි නම්, සෑම වාරයකම cache එක කඩා, මුලින්ම ගාණාගාණී input ගාණාව ගෙවීමට සිදු වේ.
- තෘඩය දිගු වෙයි – සෑම “wake‑up” එකක්ම එකම session එකට අමතර කරයි. පළමු වාරයේ තෘඩය කුඩා, පස්වන වාරයේ අති විශාල, ඒ නිසා ගාණාගාණී වියදම දිගටම වැඩෙයි.
මෙම තුන්ම කරුණු එක්කම, සමාන්ය සැකසුමක් රැගෙන, ඔබට රැයක් පුරා ඉහළ වියදමක් අතිරේකයක් ලෙස ගෙවන්න සිදු වේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තාක්ෂණික ශිෂ්යයින්, සංවර්ධකයින්, ව්යාපාරිකයින්ට මේ කතාව ඉතාම වැදගත්. පළමුව, AI‑agent හෝ automation වැඩ සකස් කරන විට, වියදම් කළමනාකරණය ගැන අවධානයෙන් සිටිය යුතු බව පෙනේ. ඉහළ‑මට්ටමේ මොඩලයන් (Claude, GPT‑4) දිගු session එකක භාවිතා කිරීමේදී, token consumption ඉක්මනින් ඉහළ යයි. දෙවනුව, session කාලය කෙටි කිරීම සහ state එක file‑system එකේ සුරකිමින්, නව session එකක් ආරම්භ කිරීමෙන් cache වියදම අඩු කළ හැකිය. තෙවනුව, cheap model + local worker සංයෝගය භාවිතා කර, අධික AI මොඩලය අවශ්ය වන විට පමණක් කැඳවීමෙන්, ව්යාපාරික පිරිවැය අඩු කරයි. මේවා සියල්ලම, ශ්රී ලංකාවේ startups සහ IT සේවා සපයන්නන්ට අඩු පිරිවැයෙන් AI‑automation ගොඩනැගීමට මාර්ගයක් සපයයි.
අවසන් වශයෙන්, token burn වැනි අතුරුදන් වීමක් වැළැක්වීමට hard cap සකස් කිරීම, burn metrics නිරීක්ෂණය කිරීම, සහ logging tool (npx ccusage, tokenscope) භාවිතා කිරීම අත්යවශ්යයි.