ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-25, Saturday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

Speculative Decoding වේගය: හාර්ඩ්වේයාර් ගැටලුවද? මොඩලයෙහි අභ්‍යන්තරය හෙළිවෙයි

Speculative Decoding වේගය: හාර්ඩ්වේයාර් ගැටලුවද? මොඩලයෙහි අභ්‍යන්තරය හෙළිවෙයි

LLM (Large Language Model) ඉන්ෆරෙන්ස් ක්ෂේත්‍රයේ නවතම පරීක්ෂණයක් පෙන්වන්නේ, speculative decoding නමැති තාක්ෂණය අතුරුගත වේග වැඩිවීමේ හේතුව හාර්ඩ්වේයාර්ද, නැතහොත් මොඩලයෙහි සැලසුමද යන්නයි. Dev.to වෙතින් ප්‍රකාශිත ලිපිය අනුව, පසුගිය පර්යේෂණ කාලයේ මෙම ක්‍රමය බොහෝ පේපර් වල සඳහන් වූ 2×‑3× වේගයක් ලබාදීමට නොහැකි වීම හේතුව සොයාගැනීමට විවිධ පරීක්ෂණයක් කරා.

ආරම්භක පරීක්ෂණයේ, 250 token ප‍්‍රශ්නයකට විවිධ gamma (γ) අගයන් (4, 7) භාවිතා කරමින්, verifier‑only හා speculative දෙකම මැනීමෙන්, speculative ක්‍රමය 0.86×‑0.66× පමණ වේගය අඩු බව පෙන්වුණා. මෙය මොඩලයේ අග්‍රාහක‑ප්‍රතික්ෂේප (accept/reject) ගණනය නිවැරදි බව තහවුරු කර තිබුණත්, නියමිත වේග වැඩිවීම නොලැබීමේ හේතුව සොයා ගැනීමට මූලික හිතැතිකම් ගෙන ගියේය.

ප්‍රථම හිතැතිකම MPS (Metal Performance Shaders) dispatch overhead එකක් බවට පත් විය. Apple Silicon හි MPS පසුබැසීම එක් මොඩලය කෝල් එකකට ස්ථාවර ගාස්තුවක් ගෙවීමට හේතු වන අතර, එය කුඩා draft මොඩලයක් භාවිතා කරන විටත් එම ගාස්තුව අඩු නොවීමෙන් වේගය අඩුවෙයි කියා සැලැස්විය. FLOPs‑මූලික සූත්‍රයක් (Leviathan et al.) භාවිතා කර, hardware‑ගත බලපෑම නොගැලපෙන theoretical speedup ගණනය කළාත්, 1.0× ඉක්මවා යාම නොහැකි බව පෙනී ආවේ.

දෙවැනි හිතැතිකම, draft මොඩලයේ ප්‍රමාණය වැඩි කරලා බලන්න යන්න. 0.5B‑කින් 1.5B වෙත මාරු කිරීමෙන් cost ratio (c) අඩුවේ, නමුත් acceptance rate (γ) ඉහළ යාමට අවශ්‍ය ප්‍රතිශතය 69‑84% අතර තිබීම නිසා, ප්‍රායෝගිකව එය අසාර්ථක වීමේ හැකියාව වැඩි බව තේරුම් ගත්තා. පරීක්ෂණයකදී, එක් run එකක් 1.37× වේගය ලබාදුන්නාට, අනෙකුත් run 0.31×‑0.72× අතර පමණ පෙනී ආයේ. මෙය acceptance rate එකේ විචලනය, content‑dependent බව පෙන්වයි.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ AI සංවර්ධකයින්, විශ්වවිද්‍යාල සිසුන්, තාක්ෂණ ව්‍යාපාරිකයින් සඳහා මෙම පර්යේෂණයේ ප්‍රතිඵලයන් අතිශය වැදගත් වේ. පළමු වශයෙන්, speculative decoding සාර්ථකව ක්‍රියාත්මක කළ හැකි නම්, LLM‑වල ඉන්ෆරෙන්ස් කාලය අඩු කර, කලාපීය සර්වර් පාවිච්චිය හා බලශක්ති පරිභෝජනය අඩු කර ගත හැකිය. දෙවනුව, හාර්ඩ්වේයාර්‑මූලික bottleneck එක තේරුම් ගැනීමෙන්, අපේ දේශීය data‑center හෝ edge‑computing සැලසුම් වලට සුදුසු GPU/CPU තේරීමේ මාර්ගෝපදේශයක් ලැබේ. තුන්වැනි වශයෙන්, මොඩලයේ acceptance rate අධික ලෙස content‑dependent බව හඳුනා ගැනීම, නිර්මාණකරුවන්ට තමන්ගේ AI API හෝ chat‑bot සේවාවන්ට අදාළ prompt‑design, temperature, top‑k වැනි පරාමිතීන් සැකසීමට මාර්ගයක් සලසයි. එමඟින් ශ්‍රී ලංකාවේ startups කීපයකට AI‑driven solution ගත හැකි වේගවත්, පිරිවැය‑අඩු සේවාවන් සපයන්න පුළුවන්.

අවසන් වශයෙන්, මෙම පරීක්ෂණය hardware‑model සම්බන්ධිත ගැටලු තවත් ගැඹුරු කරුණු ඉදිරිපත් කරයි. ඒ අනුව, ඉදිරියේදී hybrid‑approach (hardware optimisation + model‑level fine‑tuning) අනුගමනය කර, speculative decoding‑වල උපරිම වේගය ලබා ගැනීමට අවශ්‍යය. ශ්‍රී ලංකාවේ AI පර්යේෂකයින්ට මේ අත්දැකීමෙන් ලැබෙන දැනුම, දේශීය තාක්ෂණික පරිසරය වඩාත් සාර්ථක කර ගැනීමට උපකාරී වනු ඇත.

💡 ඔබේ AI ව්‍යාපාරයට වේගවත් විසඳුම් ගන්න, මේ පර්යේෂණයෙන් ඉගෙන ගන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#SpeculativeDecoding #AI #LLM #Hardware #SriLankaTech