ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-24, Friday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

Gemma 4 මොඩලය සඳහා සුදුසු Quantization තේරීම: VRAM බාධා හඳුනාගැනීම සහ කාර්යක්ෂම ක්‍රම

Gemma 4 මොඩලය සඳහා සුදුසු Quantization තේරීම: VRAM බාධා හඳුනාගැනීම සහ කාර්යක්ෂම ක්‍රම

ඔබ මෝඩලයක් ස්ථානයේ ධාවනය කිරීමට යනවානම්, බොහෝ මාර්ගදර්ශකවල “Q4 GGUF ගන්න” කියලා පවසනවා. එය කෙටි ප්‍රොම්ප්ට් වලට හොඳයි, නමුත් දිගු‑කොන්ටෙක්ස්ට් එකක් භාවිතා කරන විට RAM හෝ VRAM පිරිමැසුමට ගැටළුවක් උදාවෙයි. මේ ලිපියෙන් Gemma 4 මොඩලයේ Quantization, KV cache, සහ ප්‍රායෝගික සැකසුම් ගැන සරළව පැහැදිලි කරමු.

Quantization එකේ මූලික ගණිතය සරළයි: මොඩලයේ පරාමිතීන් (params) ගුණය බිට් ගණනෙන් (bits) බෙදා 8 න් බෙදීමෙන් බර (weight) ගණනය වේ. උදාහරණයක් ලෙස, Q8_0 (8‑bit) සම්පූර්ණයෙන්ම 12.8 GB RAM ගත කරයි, Q4_K_M (4‑bit) සම්මතව 7.2 GB, Q3_K_M (3‑bit) 5.9 GB වැනි පරිමාණයන් ඇත. Q4 ට අඩු කරන විට ගුණාත්මක අඩුවක් පැහැදිලිව දැනෙයි, විශේෂයෙන් නියෝග‑අනුගමනය (instruction‑following) හැකියාව අඩු වේ.

කෙසේ වෙතත්, KV cache (Key‑Value cache) යනු මොඩලයේ තවත් වැදගත් මතක කොටසක්. එය කොන්ටෙක්ස්ට් දිගට සෘජුවම අනුපාතයෙන් වැඩිවේ, සහ සාමාන්‍යයෙන් quantize නොකරයි. සූත්‍රය පෙන්වන්නේ:
kv_bytes ≈ 2 × layers × kv_heads × head_dim × seq_len × dtype_bytes.
ඒ නිසා 7 GB යටතේ ලෝඩ් වන මොඩලයක්, 32 K ටෝකන් කොන්ටෙක්ස්ට් එකක් භාවිතා කරන විට 15 GB‑ට වැඩි මතකයක් අවශ්‍ය වෙයි.

ප්‍රායෝගික උපදෙස් දෙකක් මතක තබාගන්න:

  • --ctx-size පරාමිතිය ඔබේ සැබෑ ප්‍රොම්ප්ට් දිගට සකසන්න. 128K ආකාරයක් නියම කරන්නේ ඔබට එය භාවිතා නොවේ නම්, අතිරේක මතකයක් විය හැක.
  • KV cache quantization (උදා: q8_0 for K/V) භාවිතා කිරීමෙන් cache මතකය අඩු පමණක් නොව, ගුණාත්මක අඩුවක් අතිශය සුළු වේ.

ඉතා සුදුසු ක්‍රමය මෙසේ:

  • පළමුව Q4_K_M භාවිතා කරලා මොඩලය ලෝඩ් කරන්න.
  • ඔබේ සැබෑ කොන්ටෙක්ස්ට් දිගට --ctx-size සකසන්න.
  • තවමත් මතකය අඩු නම්, KV cache‑ය quantize කරන්න.
  • අවශ්‍ය නම් පසුව Q6/Q8 තලයට යන්න, ඒත් ඒක අවසාන පියවරයි.

මෙම ක්‍රමය ඔබට මොඩලයේ ගුණාත්මකතාව අඩුවක් නොකර, අවශ්‍ය කොන්ටෙක්ස්ට් දිග ලබා ගැනීමට උපකාරී වේ. සැමවිටම ඔබේ පද්ධතියේ මතක භාවිතය මැනලා, Apple Silicon වගේ විශේෂිත පරිසරයන්හි වෙනස් හැසිරීම් පරීක්ෂා කරන්න.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ අධ්‍යාපනික හා තාක්ෂණික සමාජයට Gemma 4 වැනි විශාල මොඩලයන් ගත කළ හැකි බව දැකගැනීම, AI‑පදනම්කරණ පාඨමාලා, පර්යේෂණ, සහ ව්‍යාපාරික නිර්මාණ සඳහා නව අවස්ථා සලසයි. Quantization තේරීමේ නිවැරදි ක්‍රමය මඟින් සිසුන්ට පරිගණක මතක සීමා තුළම උසස් AI මොඩලයන් අත්හදා බැලීමට, ස්ථානික සොෆ්ට්වෙයා සංවර්ධකයින්ට පිරිවැය අඩු කරමින් නිෂ්පාදන‑පදනම්කරණ සේවාවන් සපයීමට, සහ කුඩා ව්‍යාපාරවලට AI‑ආශ්‍රිත විශ්ලේෂණය හා අන්තර්ක‍්‍රියාකාරී යෙදුම් හඳුන්වා දීමට ඉඩ සලසයි.

ඉදිරියේදී, මෙවැනි තාක්ෂණික අවබෝධය ශ්‍රී ලංකාවේ AI පර්යේෂණය, දත්ත විශ්ලේෂණය, සහ ස්මාර්ට් සේවා නිර්මාණය වඩාත් තරඟකාරී කරවනු ඇත.

ඔබේ පරිඝණකයෙහි මතක සීමා ගැන සැලකිල්ලෙන්, Gemma 4 මොඩලය සාර්ථකව ධාවනය කරගැනීමට අදාල උපදෙස් අනුගමනය කරන්න.

💡 ඔබේ AI මොඩලය කාර්යක්ෂමව ධාවනය කර ගැනීමට අදම උපදෙස් අනුගමනය කරන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#Gemma4 #Quantization #VRAM #AI #Developers