Meta සහ AMD එක්ව PyTorch Monarch නවතම සංස්කරණය AMD Instinct GPU සහ ROCm පද්ධතියට ගෙන ඇත. මේ නිසා, එක් Python කේතයෙන් සියලු GPU කුළකය පාලනය කරමින්, විශාල පරාසයේ AI මොඩල පුහුණුව අඩු බාධක සහිතව සිදු කළ හැකිය.
බහුසෙට් GPU පරිසරයන්හි පුහුණුවේ විශාල ප්රමාණය (බිලියන පරාමිතීන්) ඇති LLMs සඳහා, නියමිත ගැටලුව වන්නේ දෝෂ හෝ අකර්මණ්යතා. සාම්ප්රදායික ක්රමවේදය වන නිතර checkpoint කිරීම, ගබඩා I/O බර වැඩි කිරීම, පසුගිය දත්ත අහිමි වීම සහ සම්පූර්ණ කුළකය නවත්වීම වැනි අඩුපාඩු ඇති කරයි.
Monarch නව actor‑based runtime සහ process mesh සංකල්පය භාවිතා කර, එක් Python API එකෙන් සියලු GPU ක්රියාකාරකම් කළමනාකරණය කරයි. Rust (Tokio) runtime මගින් ඉහළ කාර්ය සාධනය සහ මතක ආරක්ෂාව ලබා දී, RDMA, RCCL/NCCL, SLURM, Kubernetes වැනි පදනම් පද්ධති සමඟ සරලව ඒකාබද්ධ වේ.
මෙම පද්ධතියේ විශේෂත්වය වන්නේ fault‑tolerant හැකියාවයි. ගැටලුවක් සිදුවූ node එකක් අස්ථානගත වූ විට, අනෙකුත් node ගතවූ පරිසරය ක්රියාත්මක වීමේදි පවතින තත්ත්වය අඩු නොවේ; අදාළ node එකක් තත්කාලිකව නැවත ආරම්භ කර, කුලකය නැවත පූර්ණයෙන් නැවත ආරම්භ නොකළත්, පුහුණුව දිගටම පවත්වා ගත හැකිය. මෙය කාලය, සම්පත්, වියදම සියල්ලම ඉතිරි කරයි.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ AI පර්යේෂකයින්, උපාධි ශිෂ්යයින් සහ තාක්ෂණික ව්යාපාර සඳහා මෙම නවීනකරණය විශාල අවස්ථා සපයයි:
- ඉතා සාර්ථක GPU වියදම – AMD Instinct GPU මිලකින් CUDA‑GPU වලට වඩා අඩු, එමනිසා පර්යේෂණ හා නිර්මාණ ව්යාපාර වලට ප්රවේශය පහසු වේ.
- දේශීය AI පද්ධති – විශාල LLMs පුහුණුවේදී දෝෂ හෝ node අස්ථානගත වීමෙන් පසු පද්ධතිය නැවත ආරම්භ නොකළත්, කාලය හා සම්පත් බේරා ගත හැකිය.
- කොඩින් හා DevOps කුසලතාව – Python API එකක් මගින් සරලව distributed training සකස් කළ හැකි බැවින්, තාක්ෂණික කණ්ඩායම්ගේ ඉගෙනුම් වක්රය කෙටි වේ.
- ආරම්භක ව්යාපාර සඳහා අවස්ථා – GPU ක්ලස්ටර් සේවා වියදම අඩු වීම නිසා, ස්ථානීය startups ලා AI‑driven සේවා ඉදිරිපත් කිරීම පහසු වේ.
ඉදිරියේදී, AMD GPU සහ ROCm පදනම් වූ පද්ධතිය තවත් පරිසරයන්ට (කලාව, රොබෝටික්ස්) සමග ඒකාබද්ධ වනු ඇත, එමඟින් ශ්රී ලංකාවේ තාක්ෂණික නවෝත්පාදනය තවත් වර්ධනය වනු ඇත.
කෙටි වශයෙන්, PyTorch Monarch නව ROCm සහාය සමඟ AI පුහුණුවේ විශ්වාසනීයත්වය, කාර්යක්ෂමතාව, සහ ප්රවේශය ඉහළ දර්ශනීය කරයි – එය අපේ රටේ තාක්ෂණික වර්ධනයට නව පියවරක් වේ.