ඔබේ AI මොඩල සඳහා දත්ත සැකසීමේ වේගය ගණනාවක් අඩුයි කියලා හිතනවාද? GitHub හි නවතම ව්යාපෘතිය Gigatoken, පාරම්පරික HuggingFace Tokenizers වගේම Tiktoken වගේම, පමණක් 1000 ගුණයක් වේගයෙන් ටෝකනයිසේෂන් කරයි. මෙය Rust භාෂාවෙන් ලියලා, බහු-කෝර CPU වලට සරිලන ලෙස සකස් කරලා, GB/s වේගයෙන් ලිපි ගණනාවක් පරිවර්තනය කළ හැකිය.
Gigatoken එකේ ප්රධාන විශේෂතාවය, පාරම්පරික ටෝකනයිසර්වලට සමාන API එකක් (Compatibility Mode) ලබා දීමටත්, ඒත් ඉතාම වේගවත් Gigatoken API (Fastest Mode) භාවිතා කරන විට, දත්ත පූර්ණයෙන් Rust පරිසරයෙන් කියවීමෙන්, Python-ආධාරිත පාරිභෝගික පිරිවැය අඩු කරයි. මෙය SIMD, කෑෂ් කළ ප්රී-ටෝකන මැප්පින් සහ ත්රෙඩ් අඩු කිරීම වැනි තාක්ෂණික උපාය මගින් ඉතා ඉහළ ප්රතිඵල ලබා දෙයි.
දැනට පරීක්ෂා කර ඇති CPU ගොඩනැගීම් (උදා: Apple M4 Max, AMD EPYC 72‑Core) වලදී, Gigatoken, HuggingFace Tokenizers ට සාපේක්ෂව 900‑1300 ගුණයක් වේගයෙන් ක්රියා කරයි. EPYC CPU එකේ, 130 ට්රිලියන් ටෝකන (Common Crawl) පමණක් 6.5 පැයක් තුළම සැකසිය හැකි බව සලකුණු කර ඇත. මේ තරම් වේගය, විශාල දත්ත කට්ටල සමඟ වැඩ කරන සංවිධාන, පර්යේෂකයින් සහ AI ආරම්භකයන්ට විශාල ප්රතිලාභයක් වේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ AI පර්යේෂණ සහ NLP ව්යාපෘති ඉතාම තරුණයි. Gigatoken භාවිතා කිරීමෙන්:
- විශ්ව විද්යාල සිසුන් – වඩාත් වේගවත් දත්ත සැකසීමෙන්, මොඩල පුහුණුවීමේ කාලය කෙටි කර, ප්රායෝගික ව්යාපෘති කාලය කෙටි කරයි.
- ව්යාපාරික සංවර්ධකයින් – ලොකු පෙළ දත්ත (customer reviews, chat logs) ඉක්මනින් ටෝකනයිසර් කර, real‑time analytics සහ chat‑bots වල කාර්ය සාධනය වැඩි කරයි.
- ස්ටාර්ට්‑අප් – පරිගණක සම්පත් සීමා ඇති ආරම්භකයන්ට, මිල අඩු hardware මතම AI සේවාවන් නඩත්තු කිරීමේ හැකියාව ලැබේ.
තවද, Gigatoken එකේ Compatibility Mode මඟින් පවතින HuggingFace කෝඩ් පදනම වෙනස් කිරීම අවශ්ය නැති බැවින්, ශ්රී ලංකාවේ පවතින වැඩසටහන් වලට අඩු පාරිභෝගික පිරිවැයක් ඇතිව ඒකීකෘත කළ හැකිය.
මෙම නවතම ටෝකනයිසර්, දත්ත විශ්ලේෂණයේ වේගය ඉහළ නැංවීමේ නව මාර්ගයක් පෙන්වා දෙයි. ඔබත් ඔබේ AI ව්යාපෘතිවල Gigatoken අත්හදා බැලීමට, GitHub පිටුවේ gigatoken වෙත පිවිසෙන්න.