Neutrino-1 8B යනු 8.19 බිලියන් පරාමිතීන්ගෙන් සමන්විත, decoder‑only transformer මාදිලියකි. මෙය 3.88 GB ගොනුවක් ලෙස බාගත කරගත හැකි අතර, සියලු 252 linear පදනම් ternary‑family බර ආකාරයෙන් සංග්රහ කර ඇති නිසා fp16 වර්ගයට වඩා 8 ගුණයක් කුඩා වේ.
මෙම තාක්ෂණය නිසා බර පදනම් මතකයේ bit‑packed තත්ත්වයෙන් රඳා පවතී. ඕනෑම ගණනය කිරීමේ අවස්ථාවේ එය matrix kernel තුළම විග්රහ කරයි, එවිට fp16 හෝ fp32 බර භාවිතා නොවේ. එම නිසා 8 GB GPU එකක් හෝ 16 GB ලැප්ටොප් එකක් පමණක් තිබුණාම පවා, සම්පූර්ණ මොඩලය KV cache සමඟ එකතුවී ක්රියාත්මක කළ හැකිය.
කාර්ය සාධනය පැහැදිලිවයි: 3.88 GB වැඩ කරන සෙට් එකක්, 16 GB fp16 ගොනුවක් සමාන මතක පද්ධතියකින් වඩා ඉක්මනින් ටෝකන් එකක් ප්රතිදානය කරයි. ඒ නිසා එකලස් ප්රවාහය (single‑stream decode) සඳහා බයිට් ගමන් ප්රමාණය සීමාකාරී වන අතර, මෙහි සුළු බර නිසා එම සීමාව ඉතා පහසුවෙන් ඉක්මවා යයි.
Neutrino-1 8B හි grouped‑query attention යෙදීමෙන් KV cache එක query පළලේ ¼ ක් පමණට අඩු වේ. fp16 හි 144 KiB පර් ටෝකන්, 4k ටෝකන් සැසියකට 0.60 GB cache අවශ්ය වේ. මෙය 8 GB GPU එකේ තවත් බර නැතිව සම්පූර්ණයෙන්ම ගත හැකිය.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ සිසුන්, සංවර්ධකයින් සහ ව්යාපාරිකයින්ට මෙම මොඩලය විශාල අවස්ථාවක් සපයයි:
- අඩු පරිසරය – 8 GB GPU හෝ 16 GB ලැප්ටොප් එකක් පමණක් තිබුණාම AI පර්යේෂණය හෝ ඇප්ලිකේෂන් සංවර්ධනය කළ හැකිය.
- ඉක්මන් ප්රතිචාර – තොරතුරු විග්රහය ඉතා වේගවත් වන නිසා රියල්‑ටයිම් chat‑bot, ලේඛන සාරාංශකරණය වැනි සේවාවන් ස්ථානීයව ලබා දිය හැක.
- වියදම් අඩු කිරීම – බර අඩු කිරීම මත මෘදුකාංග සම්පත් අවශ්යතා අඩු වන බැවින් කලාපීය කලාපී පරිගණක සේවා (cloud) පාවිච්චියෙන් අඩු වියදමක් ලැබේ.
- ඉගෙනීමේ හැකියාව – නවතම AI තාක්ෂණය සිංහලෙන්ම පරීක්ෂා කර, පාඨමාලා, වැඩමුළු හා පර්යේෂණ ව්යාපෘති සකස් කළ හැක.
Neutrino-1 8B හි කේතගත බර ආකාරය Apache‑2.0 බලපත්රයක් යටතේ නිදහස්ව ලබා ගත හැකි බැවින්, ශ්රී ලංකාවේ තොරතුරු තාක්ෂණ ප්රජාවට විවෘත ප්රවේශයක් ලැබේ.
ඉදිරි කාලයේ, මෙම මොඩලය භාවිතා කරමින් දේශීය AI ආරම්භකයන්ට ස්කේලබල්, කාර්යක්ෂම, හා ආර්ථික වශයෙන් සුළු පරිසරයක් තුළ නව නිෂ්පාදන සෑදීමට අවස්ථාව ලැබෙනු ඇත.
අවසන් වශයෙන්, Neutrino-1 8B තාක්ෂණය, AI ක්ෂේත්රයේ පරිගණක සම්පත් අවශ්යතා අඩු කරමින්, ශ්රී ලංකාවේ නවෝත්පාදන පසුබැසීමේ තරඟකාරිත්වය ඉහළ නැංවීමට උපකාරී වේ.