ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

LingBot-Map: මොනොකියුලර් වීඩියෝවෙන් 10,000 පසුබැසි ෆ්‍රේම් 3D නකශාකරණය – LiDAR නැතුව

LingBot-Map: මොනොකියුලර් වීඩියෝවෙන් 10,000 පසුබැසි ෆ්‍රේම් 3D නකශාකරණය – LiDAR නැතුව

Ant Group හි Embodied‑AI ඒකකය විසින් නවතම මොනොකියුලර් 3D නැවත-නකශාකරණ මොඩලයක් විවෘත කර ඇත. මෙම මොඩලය, රියල්‑ටයිම් වීඩියෝ ප්‍රවාහයක් තුළම සිද්ධියත්, ලයිඩාර් (LiDAR) යන්ත්‍රයක් අවශ්‍ය නොවී, 10,000 කට වැඩි ෆ්‍රේම් සම්පූර්ණයෙන්ම සැකසුම් නොකඩවා ක්‍රියා කරයි.

LingBot‑Map යනු Feed‑Forward ස්ට්‍රීමින් ආකෘතියක් වන අතර, සාමාන්‍ය RGB වීඩියෝ ප්‍රවාහයක් ලබාදී, සෑම ෆ්‍රේමයකම කැමරාවේ ස්ථානය සහ දෘශ්‍ය රූපයේ ජ්‍යොතික තොරතුරු (geometry) අනුමාන කරයි. මෙය Apache 2.0 ලයිසෙන්සුව යටතේ 2026 අප්‍රේල් 16 දින Robbyant විසින් නිකුත් කර ඇත. 518×378 විභේදනයේ 20 FPS වේගයකින් ක්‍රියා කිරීම, FlashInfer භාවිතා කරන පේජ්‑KV‑Cache මඟින්, 1,000‑ඡායාරූප අනුක්‍රමයක් සඳහා PyTorch හි සම්පූර්ණ‑කැෂ් මොඩලයට වඩා 2 ගුණයක් වේගවත් වේ.

මෙම වේගය ලබා දීමට හේතුව Geometric Context Transformer (GCT) සහ එහි Geometric Context Attention (GCA) යන නවීන මොඩියුලයන්ය. GCA පූර්ණ causal attention පරිසරයක් භාවිතා නොකර, ත්‍රිත්ව “පූල්” (Anchor context, Local pose‑reference window, Compressed trajectory recap) තබා, පරණ ෆ්‍රේම්වල තොරතුරු කුඩා token ලෙස සංග්‍රහ කරයි. එමඟින් සාමාන්‍ය causal attention වලට වඩා 80× කුඩා KV‑cache ප්‍රමාණයක් ලැබෙයි, ඒ නිසා 10,000 ෆ්‍රේම් දක්වා ක්‍රියාත්මක වීමට හැකියාව ලැබේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

මෙම තාක්ෂණය ශ්‍රී ලංකාවේ සිසුන්, සංවර්ධකයන් සහ ව්‍යාපාරිකයන්ට විශාල අවස්ථා සපයයි.

  • විද්‍යා හා ඉංජිනේරු අධ්‍යයන: ලයිඩාර් නැතිව 3D නකශාකරණය සිදු කළ හැකි බැවින්, පර්යේෂණ කාර්යාලවල හෝ පාඨමාලා ගතවල පරිසර-අවකාශ මොඩල කිරීම පහසු වේ.
  • ස්ථානීය සංවර්ධකයන්: රියල්‑ටයිම් AR/VR යෙදුම්, නගර සැලසුම්, ගොඩනැගිලි නිරීක්ෂණ වැනි ක්ෂේත්‍රවල පරිගණක සම්පත් අඩු වෙලාවේදීම වැඩි ප්‍රයෝජන ලබා ගත හැකිය.
  • ව්‍යාපාරික නවෝත්පාදන: ඩ්‍රෝන‑විඩියෝ, ගොඩනැගිලි නිරීක්ෂණ, ගෙවීම් පද්ධති වැනි ක්ෂේත්‍රවල කුඩා පරිමාණ AI විසඳුම් ඉක්මනින් නිර්මාණය කළ හැකිය.

ඉදිරියේදී, LingBot‑Map හි විශාල දත්ත සමුදායන් සඳහා පරිගණක සම්පත් අවශ්‍ය නොවීම, ශ්‍රී ලංකාවේ තාක්ෂණික ආරම්භකයන්ට ගෝලීය තරඟකාරිත්වයක් ලබා දීමට මඟ පෙන්වයි.

මෙම මොඩලය භාවිතා කිරීමට, Python 3.10, PyTorch 2.8.0, CUDA 12.8 හා FlashInfer (අවශ්‍ය නම්) ස්ථාපනය කළ යුතුය. GitHub රිපොසිටරියෙන් කෝඩ් ලබාගෙන, pip install -e .[vis,render] ලෙස ස්ථාපනය කළ පසු, demo.py හරහා වීඩියෝ හෝ ඡායාරූප ෆෝල්ඩරයක් සපයා ක්‍රියාත්මක කළ හැකිය. දිගු වීඩියෝ සඳහා --keyframe_interval, --mode windowed වැනි විකල්පයන් භාවිතා කර තත්ත්වය රැකගත හැක.

ඉදිරියේදී LingBot‑Map හි වැඩිදුර නවීකරණ, දිගු‑දෘශ්‍ය පරිසරයන් සඳහා අලුත් checkpoint ව්‍යාපෘති සහ Open3D, NVIDIA Kaolin වැනි පර්යේෂණ මෙවලම් සමඟ සම්පූර්ණ 3D රෙන්ඩරින් අත්දැකීම් ලබා දීමට සැලසුම් කර ඇත.

💡 LingBot-Map සමඟ ඔබේ 3D පර්යේෂණ අදම අරඹන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#AI #3D mapping #monocular #Sri Lanka #developers