Google Cloud හි නවතම TPU v6e චිප් එකේ Gemma‑4 E2B මොඩලය සාර්ථකව සේවාවට ගෙන ආ තොරතුරු ලොව පුරා තාක්ෂණවේදින්ගේ අවධානය දිනා ඇත.
vLLM 0.23.1rc1 සමඟ GCE flex‑start VM (ct6e‑standard‑1t) භාවිතා කරමින්, 32 GB HBM මත 2 බිලියනයේ පරාමිතීන් ඇති Gemma‑4 E2B (plain) එකක් එක් චිප් එකේම 213 token/s වේගයෙන්, පළමු token එක 16 ms කාලයක් තුළ ලබා දුන්නා. ඒ සමඟම 1,024‑token ප්රශ්න‑පිළිතුරු සැසියක 2,200 token/s පමණ ප්රතිදානයක් ලබා දී, එකවර බහු පරිශීලක සැසියන්ටත් කාර්ය සාධනය අඩු නොවීය.
මෙම මොඩලය OpenAI‑ශෛලිය API‑කලින් function calling, සමකාලීන ඇමතුම්, සහ hallucination‑නොවන ආකාරයෙන් ප්රතිචාර ලබා දීම වැනි විශේෂතාද සමඟ 200 ms පමණ කාලයකින් සරල දෘශ්ය ප්රශ්නවලට පිළිතුරු දුන්නා. ඒත් QAT (Quantization‑Aware Training) සංස්කරණයන් int4 සහ bf16 ආකාරයෙන් බර පිරිසිදු කිරීමේදී, ලෝඩ් කිරීමේ දෝෂයක් හෝ පාරමිතීන් අස්ථානගත වීම නිසා සාර්ථක නොවීය.
ශ්රී ලංකාවට ඇති වැදගත්කම
මෙම පර්යේෂණය ශ්රී ලංකාවේ AI සංවර්ධකයින්, විද්යාල සිසුන්, සහ ව්යාපාරිකයින්ට පහත ආකාරයෙන් ප්රයෝජන ගෙන දේ:
- අඩු වියදමින් ඉහළ කාර්යක්ෂමතාව: එක් TPU චිප් එකක් පමණක් භාවිතා කරමින්, අඩු මූල්ය වැයයෙන් විශාල මොඩලයක් සේවාවට ගෙන යා හැක.
- දේශීය AI පුහුණුව: සිසුන්ට ප්රායෝගික AI inference ක්රමවේද අධ්යයනයට අවස්ථාව ලැබේ, Google Cloud හා vLLM වැනි නවතම මෙවලම් භාවිතා කරමින්.
- ව්යාපාරික නවෝත්පාදන: ස්ථානයක AI සේවාවක් ක්රියාත්මක කිරීමේ හැකියාව, චැට්බොට්, දත්ත විශ්ලේෂණ, සහ රූප‑පෙළ විශ්ලේෂණ සේවාවන් වැනි ව්යාපාරික යෙදුම් සඳහා පදනමක් සපයයි.
QAT සංස්කරණයන් තවදුරටත් නිවැරදි කිරීමේ වැඩපිළිවෙළේ සිටින අතර, ඉදිරියේදී තවත් මතක ඉතිරි කිරීමේ ප්රතිලාභ ලබා ගත හැකිය.
සාරාංශයෙන්, Gemma‑4 E2B එකක් එක් TPU v6e චිප් එකේ ක්රියාත්මක කිරීම, AI සේවා සැපයුම් ක්ෂේත්රයට නව මාර්ගයක් විවර කරයි. ශ්රී ලංකාවේ තාක්ෂණික පරිසරයට මේ තොරතුරු අනාගතයේ වැඩි පරිමාණ AI යෙදුම් නිර්මාණයට මාර්ගෝපදේශයක් වනු ඇත.