ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
💻 ක්‍රමලේඛනය · 🕒 කියවීමට විනාඩි 2 · 👁 1

PyTorch 2.13 FlexAttention M1 Max හි Sparse Attention වේගය 7.83 ගුණයකින් වැඩි

PyTorch 2.13 FlexAttention M1 Max හි Sparse Attention වේගය 7.83 ගුණයකින් වැඩි

AI මොඩලයකට වැඩි වචන දෙන විට attention ගණනාවක් ඉක්මනින් බරපතල වේ. මේ අවස්ථාවේ Apple Silicon GPU එකක් භාවිතා කරලා, අවශ්‍ය තැනටම පමණක් token ගනනක් බලන්න හැකි නම් ගණනයේ වේගය වැඩි වෙයිද? PyTorch 2.13 නවතම FlexAttention ක්‍රමය M1 Max හි පරීක්ෂා කරලා, එය සාමාන්‍ය SDPA (Standard Dense Attention) සමඟ තරඟ කරලා ලැබූ ප්‍රතිඵල ඉතා ආකර්ෂණීය.

පරීක්ෂණයෙහි 32,768 token දිගු පෙළක්, 256-token පළාතක් (local window) යොදාගෙන, FlexAttention ක්‍රමය 75.27 ms කාලයක් ගතවූ අතර, ඒ සඳහා SDPA 589.05 ms ගතවීය. ඒ කියන්නේ FlexAttention 7.83 ගුණයක් වේගවත්යි. නමුත් සාමාන්‍ය causal attention (සියලු token අතර සම්බන්ධය) සඳහා SDPA 19 ගුණයක් වේගවත් බව පෙනී යයි. එබැවින් FlexAttention සෑම අවස්ථාවකම වේගවත් නොවෙයි; එය දිගු, ඉතා sparse attention රීති වලදී පමණක් ප්‍රයෝජනවත්.

FlexAttention පළමු වරට PyTorch 2.5 (Oct 2024) හි prototype ලෙස හඳුන්වා දෙන ලදී. එය Python function එකක් ලෙස attention රීතිය නිරූපණය කර, torch.compile මගින් Metal/MPS kernel එකකට පරිවර්තනය කරයි. PyTorch 2.13 (Jul 8, 2026) හි Apple Silicon සඳහා MPS kernel එකක් එක් කර ඇත, එමඟින් sparse pattern වලදී SDPA කුඩා 12 ගුණයක් වඩා වැඩි වේගයක් ලබා දේ. මෙම පරීක්ෂණය සූදානම් කරන ලද්දේ random query, key, value tensors දෙකම එකම ආකාරයෙන් භාවිතා කර, forward pass පමණක් මැනීමයි; mask නිර්මාණය හා compilation කාලය ගණනයට ගැනෙන්නේ නැත.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

  • විකසිතයන් – FlexAttention භාවිතා කරලා, ද්‍රව්‍යමය GPU කාර්යක්ෂමතාවය උපරිම කරගත හැක. මෙය මොඩල පුහුණු කිරීමේ කාලය අඩු කර, පරිසර හිතකාමී AI විසඳුම් නිර්මාණයට මඟ පෙන්වයි.
  • සැලසුම්කරුවන් – Apple Silicon පදනම් පරිගණකවල (MacBook, Mac mini) AI වැඩපිළිවෙළක් නිර්මාණය කිරීම දැන් වඩාත් ප්‍රායෝගික වේ. ලෝක පරිමාණයේ GPU කුලය අවශ්‍ය නොවී, දේශීය ව්‍යාපාරික ආයෝජනය අඩු වේ.
  • ඉගෙනුම්කරුවන් – පරිගණක විද්‍යාව, දත්ත විද්‍යාව පාඨමාලා වල FlexAttention වැනි නව තාක්ෂණික උදාහරණ එක් කිරීමෙන්, සිසුන්ට නවතම AI ක්‍රමවේද පිළිබඳ 실무 හැකියාව ලැබේ.

අවසන් වශයෙන්, FlexAttention තාක්ෂණය M1 Max GPU වලදී sparse attention කාර්යක්ෂමතාවය වැඩි කරයි, නමුත් සාමාන්‍ය attention සඳහා SDPA තවමත් ඉහළ වේගයක් ලබා දේ. එබැවින් නිර්මාණකරුවන්ට තමන්ගේ පරිසරය හා අවශ්‍යතා අනුව නිවැරදි attention ක්‍රමය තේරීම අත්‍යවශ්‍ය වේ.

💡 ඔබේ AI ප්‍රොජෙක්ට් එකේ වේගය වැඩි කිරීමට FlexAttention පරීක්ෂා කරන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#PyTorch #FlexAttention #M1 Max #Apple Silicon #AI