LLM (Large Language Model) ගොඩනැගීමේදී, සමාගම් වල අයිතිකාරක දත්ත භාවිතා කිරීමේ ප්රධාන දෙකේ ක්රමය RAG සහ Fine‑tuning වේ. නමුත් නව පර්යේෂණයක් හයිපර්නෙට්වර්ක්ස් (HyperNetwork) මගින් දත්ත ඇතුළත් කිරීමේ තවත් මාර්ගයක් ඉදිරිපත් කරයි, එය පළමු වරට පද්ධතිමය ස්කේලින් නීති සමඟ සනාථ කරයි.
RAG කියන්නේ inference වේලාවේ ප්රශ්නයට අදාල කැබැල්ලක් ලබා ගැනීම, Fine‑tuning කියන්නේ මාදිලියේ බර (weights) වෙනස් කර නව දැනුම ඇතුළත් කිරීම. දෙකම ව්යාපාරිකව භාවිතා වුවත්, catastrophic forgetting (පෙර දැනුම අමතක වීම), OOD (Out‑of‑Distribution) අසමත්භාවය, හා ස්කේලින් මට්ටමේ අස්ථිරතාව වැනි ගැටලු පවතියි.
ආශ්රිත පර්යේෂණ කණ්ඩායම HyperNetwork‑වලින් LoRA adapters (ΔW) සෑදීමේ නව ක්රමයක් යෝජනා කරයි. මෙහිදී මූලික LLM එක කිසිදා වෙනස් නොවෙයි; ඒ වෙනුවට තවත් නෙට්වර්ක් එකක් තොරතුරු කණ්ඩායමකට අනුව adapters සකස් කර, inference වේලාවේම ඒවා ඇතුළත් කරයි. මෙයින් Fine‑tuning හි ඇති forgetting ගැටලුව පූර්ණයෙන්ම ඉවත් වේ.
කොන්සෙප්ට් ව්යුහය මෙසේය: තොරතුරු කණ්ඩායම Transformer encoder (causal mask නොමැති, Post‑LayerNorm, RoPE) හරහා ගලා, mean‑pooling කර, ලිනියර් පාර්ශ්වයක් මගින් LoRA rank‑4, α=8 adapters (ΔW) නිර්මාණය කරයි. මේ adapters LLM හි ඉහළ පළලේ පළමු පළලේ ලේයර් වලට යොදයි. HyperNetwork එක පමණක් පුහුණු කරයි; මූලික මාදිලිය සදා Frozen තත්වයෙන් පවතිනවා.
ඉදිරි පර්යේෂණය MegaWikiQA නමින් 10 මිලියනයට අධික multi‑hop QA යුගල, 4.6M සත්යයන්, 822 සම්බන්ධතා, 39 ක්ෂේත්ර, 1‑4 hops, OOD split සහිතව සකස් කරයි. HyperNetwork වර්ග 167M සිට 2.8B පරාමිතීන් දක්වා පරීක්ෂා කරන ලදී. ප්රධාන සොයාගැනීම්:
- සියලුම මට්ටමේ loss, accuracy, OOD generalization එකම power‑law නියමයන් පසුපසින් පවත්නා බව.
- LLM එකේ ප්රමාණය වැඩි කිරීම HyperNetwork එක වැඩි කිරීමට වඩා හොඳ ප්රතිඵල දෙන බව.
- HyperNetwork ග්රැඩුය් (depth) ≈ පළල (width) ලෙස සකස් කිරීම, පරාමිතීන් වියදමට සමාන වර්ධනය ලබා දේ.
- Scale වර්ධනයත් සමඟ LoRA fine‑tuning කෙරෙහි OOD අසමත්භාවය වැඩි වන අතර, HyperNetwork ඒක තරමට වඩා හොඳ OOD generalization පෙන්වයි.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තාක්ෂණික සමාගම්, විශ්වවිද්යාල සිසුන්, සහ සංවර්ධකයින්ට මෙය ගෙනෙන ප්රතිලාභ මෙසේය:
- දත්ත රහස්යතාවය – මූලික LLM එක වෙනස් නොකළ නිසා, සංවිධානයේ ගුප්ත දත්ත සෘජු ලෙස මාදිලියේ ගොඩනැගීම අවශ්ය නොවේ.
- ඉක්මන් නවීකරණය – HyperNetwork එක පමණක් නැවත පුහුණු කර නව නීති හෝ නීතිමය දත්ත ඇතුළත් කළ හැක, එමෙන්ම LLM එකේ ප්රදර්ශනයම තබා ගත හැක.
- වියදම් අඩුවීම – LoRA adapters භාවිතයෙන් පරිගණක සම්පත් අවශ්යතා අඩු වන අතර, HyperNetwork මගින් ඒවා ස්කේලබල් වේ.
- ව්යවසායක අවස්ථා – රෙගුලාසි, පාරිභෝගික FAQ, හෝ තාක්ෂණික දැනුම වැනි තොරතුරු කඩිනම්ව ඇතුළත් කර, AI chat‑bot හෝ අභ්යන්තර analytics වලට ප්රයෝජනවත් වේ.
අවසන් වශයෙන්, HyperNetwork‑වලින් AI දත්ත ඇතුළත් කිරීමේ නව මාර්ගයක් සපයන අතර, ස්කේලින් නීතිවලින් පසුබැසී ඉදිරියේදී ශ්රී ලංකාවේ AI පද්ධති ඉදිරිපත් කිරීමේ වේගය හා ගුණාත්මකතාව වැඩි කිරීමට ඉඩ සලසයි.