Apple Silicon පදනම් වූ මැක් එකක LLM (Large Language Model) ක්රියාත්මක කිරීමේ නව පියවරක් දැක්කා. ExecuTorch නව MLX delegate භාවිතා කර Qwen3-0.6B මොඩලය පරීක්ෂා කළ විට, M1 Max GPU එකේ ඉතා ඉක්මනින් ක්රියා කරන බව සනාථ වුණා.
මෙම පරීක්ෂණය සඳහා ExecuTorch 1.3.1, PyTorch MPS (Metal Performance Shaders) සහ MLX delegate (BF16 සහ INT4) යන තුනේම ක්රම භාවිතා කරා. ප්රතිඵල අනුව, PyTorch MPS BF16 මාර්ගයෙන් 41.8 token/s වේගයක් ලැබුණා, MLX BF16 134.8 token/s, එත් MLX INT4 188.9 token/s දක්වා පැමිණි අතර, INT4 මාර්ගය 4.52 වාරයක් වේගවත් වූවා. එමෙන්ම, INT4 ගොනුව BF16 ගොනුවේ 71.8% ක පමණ කුඩා විය.
කෙසේ වෙතත්, INT4 කුඩා කිරීමේදී තේරුම් ගැනීමේ ගුණාත්මකත්වය දෙකේම ප්රශ්න උදා වුණා; ත්රිත්ව ප්රශ්න තුනෙන් දෙකක උත්තර වෙනස් වුණා. එමනිසා, වේගය වැඩි වුවත්, නිරවද්යතාවය සලකන විට සැලකිල්ලෙන් යොදා ගත යුතුය.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තාක්ෂණික පරිසරය දියුණුවට පත් වීමට මේ වගේ පර්යේෂණයන් විශාල ආධාරයක් වේ.
- සිසුන්: AI මෝඩලයන්ට Apple Silicon GPU භාවිතා කර ඉක්මනින් පරික්ෂා කිරීමෙන්, පරිගණක විද්යා අධ්යාපනයේ නව පරිකථනයක් ලැබේ.
- සංවර්ධකයින්: ExecuTorch MLX delegate මඟින් PyTorch මොඩලයන් සෘජුවම macOS GPU වලට පවරා, දත්ත ප්රමාණය කුඩා කර ගත හැකි බැවින්, ව්යාපෘති සංවර්ධනය වේගවත් වේ.
- ව්යාපාර: මෝඩලයේ ගතිකත්වය (speed) හා ගොනු ප්රමාණය (size) අඩු කිරීමෙන්, AI-චලිත සේවා පරිසරය වඩාත් කාර්යක්ෂම හා පිරිවැය අඩු කර ගත හැකිය.
කෙසේ වෙතත්, quantization (INT4) භාවිතා කරන විට නිරවද්යතාවය පරීක්ෂා කර, අවශ්ය නම් BF16 වැනි උසස් නිරවද්යතාවයක් තබා ගැනීම වැදගත්.
ඉදිරියට, ExecuTorch MLX delegate හි API සහාය වැඩි වීම, තවත් මොඩලයන්ටත් යෙදවිය හැකි බවක් පෙනේ. ශ්රී ලංකාවේ AI සංවර්ධනයට නව මාර්ගයක් මෙම තාක්ෂණය සපයයි.