Google සොෆ්ට්වෙයා ඉංජිනේරුවන්, Cloud TPU එකක් මැදින් නවත්වලාත් තත්පර දෙකකට අඩු කාලයකින් පුනරුත්ථාපනය කළ හැකි බව පෙන්වා දුන්නා. එය Elastic Training කියන නව ක්රමයක් භාවිතා කරමින්, MaxText, PathwayS, Orbax වැනි උපාංග සමඟ කරපු පරීක්ෂණයකි.
ඇත්තේ, GKE (Google Kubernetes Engine) මත බහු-TPU චිප් වල LLM (Large Language Model) පුහුණු කිරීමේදී, උදව්වක් ලෙස එක් වර්කර් එකක් උදාර ලෙස නවත්වලා. ඒ අනතුරුව, ඒ වර්කර් එකේ පෝඩ් එක Kubernetes විසින් නව පෝඩ් එකක් ලෙස පුරවා දුන්නා, ඉතිරි වර්කර් මැදින් අඩු කාලයකින් ඊළඟ පුහුණු පියවරට පත් වුණා. සමස්ත නතර කාලය දෙමිනිත්තු අඩුවක් පමණ, ඒ අතර වැඩි කොටස Kubernetes පෝඩ් නවීකරණය සඳහා ගත වුණා.
සාමාන්යයෙන් බහු-නෝඩ් පුහුණුවේ එක වර්කර් නතර වුනොත්, all‑reduce ක්රියාවලිය අසාර්ථක වෙයි, සෑම නෝඩ් එකම කාලය අවසන් කර ඉවත් වෙයි. එවිට පූර්ණ ජොබ් එක නැවත ආරම්භ කර, අවසන් චෙක්පොයින්ට් සිට පදනම් කර ගත යුතුයි – මෙය කාලය, සම්පත්, හා ධනය අහිමි කරන ප්රතිඵලයක්. Elastic Training, පසුබැසීමක් සිදු වුනොත්, ඒ අසාර්ථක වර්කර් එක හඳුනාගෙන, නව වර්කර් එකක් එක් කර, ඒම Python ප්රොසෙස් එකේම ඉදිරියට යාමට ඉඩ සලසයි.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ AI සහ ML අධ්යාපනය ලබන විද්යාර්ථීන්, සමාගම්, සහ ආරම්භකයන්ට මේ තාක්ෂණය විශාල වාසි ලබා දේ.
- ඉගෙනුම් වේගය: විශාල මොඩල පුහුණු කිරීමේදී නතර නොවී, කාලය බෙහෙවින් ඉතිරි කරගත හැක.
- වියදම් අඩු කිරීම: නව පෝඩ් එකක් ආරම්භ කිරීමේදී ගණනාවක සම්පත් නැවත ගත නොකොට, පවතින පරිසරයම භාවිතා කරයි.
- ස්ථානයේ පරිසරය: Cloud TPU සහ Kubernetes පදනම්ව, ශ්රී ලංකාවේ දත්ත මධ්යස්ථාන වලින් සෘජුවම සම්බන්ධ වීමට හැකියාව ඇත.
- ව්යවසාය නවෝත්පාදනය: AI‑මූලික සේවා, චැට්බොට්, සහ භාෂා මෝඩල සංවර්ධනයේදී, විශ්වාසනීය පුහුණුවක් ලබා දේ.
ඉදිරියට, මෙම Elastic Training තාක්ෂණය, ශ්රී ලංකාවේ තොරතුරු තාක්ෂණය පාඨමාලා, සමාගම්ගේ AI ප්රොජෙක්ට්, සහ පාරිභෝගික‑මූලික සේවා වැනි ක්ෂේත්රවල අධික ප්රයෝජන ලබා දීමට නියමිතය.
අවසන් වශයෙන්, Google‑ගේ නව පරීක්ෂණය, බහු‑TPU පුහුණුවේ නතර‑නැවත‑ආරම්භ කිරීමේ ගැටලුව සරලව විසඳා, AI සංවර්ධනයේ නව මාවතක් විවෘත කරයි. මේ තාක්ෂණය, අපේ දේශීය AI පරිසරයටත් විශාල සුවිශේෂී අවස්ථාවක් වේ.