RTX 4070 GPU එකක 12 GB VRAM පමණක් තිබුණාමත්, Qwen 35B වැනි විශාල LLM එකක් සාර්ථකව ධාවනය කිරීම අමාරුයි. පසුගිය ලිපියේ CPU‑MoE (Mixture‑of‑Experts) ප්රතිකාරය භාවිතා කරලා මොඩලයේ MoE කොටස් CPU වෙත බාර දී, GPU‑ේ පවතින මතකය ප්රධාන වශයෙන් attention weights සහ KV cache සඳහා පමණක් වෙන් කරගත්තා.
කෙසේ වෙතත්, සාමාන්යයෙන් -c 4096 ලෙස සකස් කරන context window එක, Claude‑Code වැනි කාර්ය‑ඇජන්ට් එකකට 12 000 ට වැඩි token අවශ්ය වීමෙන් පසු පරාජයට පත් වුනා. 8 ගුණයක් වැඩි -c 32768 වෙත යාමට, KV cache‑ය 8 පාරක් විශාල විය යුතුය, එයින් GPU‑ේ ඉඩ 600 MiB පමණ ඉතිරිව තිබුණා.
මෙම ගැටලුවට විසඳුමක් ලෙස KV cache quantization භාවිතා කළා. llama.cpp හි -ctk (Key cache) සහ -ctv (Value cache) පරාමිතීන්ට q8_0 (8‑bit) සකස් කිරීමෙන්, cache‑යේ ප්රමාණය පමණක් 50 % කින් අඩු වුණා. එවිට 12 GB VRAM එකේ ඉඩ තවමත් 600 MiB ඉතිරිව තිබුණා, ඒත් 8× දිගු context එකක් ධාවනය කළ හැකි වුණා.
ප්රයෝගික පරීක්ෂණේදී, f16 (default 16‑bit) සහ q8_0 (8‑bit) අතර token‑per‑second (TPS) ගණනේ වෙනස අතිශය සුළුය. perplexity අගයත් 0.1 % කට අඩු වෙනසක් පමණක්. ඒ නිසා, වේගය හා ගුණාත්මකත්වය අතර සන්සුන්වූ සම්බන්ධයක් නොමැති බව තහවුරු වුණා.
ශ්රී ලංකාවට ඇති වැදගත්කම
මෙම තාක්ෂණික සාර්ථකත්වය ශ්රී ලංකාවේ AI සංවර්ධකයින්, අධ්යාපන ආයතන, සහ ව්යාපාරිකයින්ට විශාල වාසියක් ගෙන එයි.
- ඉගෙනුම් පරිසරය: විශ්වවිද්යාල සහ පළපුරුදු පාඨමාලා වලදී, විශාල context සමඟ LLM භාවිතා කරමින් නවතම code‑generation, tool‑calling ආදී කාර්යයන් අධ්යයනය කළ හැකිය.
- ව්යාපාරික AI‑ඇප්ලිකේෂන්: සීමිත GPU සම්පත් ඇති ස්ථානවලද, 12 GB GPU එකක් භාවිතා කරමින් මිනිස්‑සමාන tool‑calling agents නිර්මාණය කළ හැකිවීම, ගණනාවක් තාක්ෂණික ගනුදෙනු කාර්යක්ෂම කරයි.
- ඉදිරිපත් කිරීමේ වියදම් අඩු කිරීම: MoE‑වල CPU offload සහ KV cache quantization එකතුවෙන්, මිල අඩු GPU (RTX 4070) භාවිතා කරමින්ත්, උසස් AI සේවාවන් ලබාගත හැකිවීම, ස්ථානයේ AI පදනම් ව්යාපාරවලට ආරම්භක පියවරක් වේ.
සාරාංශයෙන්, 12 GB GPU එකක් පමණක් ඇති පරිසරයකද, --cpu-moe -ctk q8_0 -ctv q8_0 යන ත්රි‑පරාමිතීන් සමඟ Qwen 35B මොඩලය 8× දිගු context සමඟ, වේගය අඩු නොවී, ගුණාත්මකත්වය තවත් අඩු නොවී භාවිතා කළ හැකිය. මෙය ශ්රී ලංකාවේ AI‑ඇප්ලිකේෂන් සංවර්ධනයේ නව මාවතක් විවෘත කරයි.