ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

RAG පද්ධතිවල දත්ත ඇතුළත් කිරීමේ රහස්: අසලින් නොදැන ගත යුතු ගැටළු

RAG පද්ධතිවල දත්ත ඇතුළත් කිරීමේ රහස්: අසලින් නොදැන ගත යුතු ගැටළු

RAG (Retrieval‑Augmented Generation) ව්‍යාපෘති බොහොමයක් තිරසාර ව්‍යාපාරික අදහසක් වගේ පෙනෙන්නෙත්, නමුත් ඒකේ හදාරන ලද දත්ත ඇතුළත් කිරීමේ (ingestion) අදියරේ ගැටළු බොහොමයක් අගුළු වැසී තිබෙනවා.

පළමු වරට ලේඛන රැස් කර, ඒවා කොටස් (chunks) කර, embeddings ගණනය කර, vector database එකකට තබා, LLM එකකට සම්බන්ධ කරන ක්‍රියාවලිය සරලයි. නමුත් මෙම පියවර එක වරක් කරලා ඉවරයි කියලා සිතන්න එපා. නවීන ව්‍යාපාරික පරිසරයෙදි පිටුපසින් දත්ත නිතරම වෙනස් වෙනවා – පිටු යාවත්කාලීන, මකාදැමීම, නව ලේඛන එකතු කිරීම, JavaScript මගින් අර්ධ‑ලෝඩ් වීම වගේ බොහෝ අඩුපාඩු පවතිනවා.

ඉන්ගෙෂ්න් පළමු වරට සාර්ථක වුණත්, ඒක පද්ධතියේ විශ්වාසනීයත්වය පෙන්වන්නේ නැහැ. කුඩා දත්ත සමුදායක් සමඟ පරීක්ෂා කළ විට ප්‍රතිඵල හොඳට පෙනෙන්න පුළුවන්, නමුත් නියමිතව වැඩ කරන පද්ධතියක් නිර්මාණය කිරීම සඳහා තවත් බොහෝ කරුණු සැලකිල්ලට ගත යුතුයි.

වැඩිම වැරදි අඩුපාඩු අතර, crawling සහ ingestion එකම දෙයක් ලෙස ගැලපීම. crawler එක තවත් දස දහසක් පිටු රැස් කරලා දීලා, ඒවායේ කොපමන කොපමන තොරතුරු වැදගත්, කොපමන අනුපිටපත්, කොපමන අතීත තොරතුරු යනවා කියලා තේරුම් ගත නොහැක. නිසි තොරතුරු තෝරා ගැනීම, අනුපිටපත් ඉවත් කිරීම, පේජ් ලේඛන ව්‍යුහය අනුව chunking කිරීම – මේවා නැතිව පද්ධතියේ ප්‍රතිචාර අසත්‍ය, පරණ හෝ අසම්පූර්ණ තොරතුරු මත පදනම්ව පෙනේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ AI සංවර්ධකයන්, විශ්වවිද්‍යාල සිසුන්, සහ තාක්ෂණික ව්‍යාපාරිකයන්ට මේ ගැටළු අවබෝධ කර ගැනීම ඉතා වැදගත්.

  • සියලුම තොරතුරු නවීනව තබා ගැනීම – රජයේ දත්ත, පෞද්ගලික සමාගම්ගේ API, හෝ වෙබ් අඩවි වල නවීන ප්‍රකාශන පද්ධතියක් ගොඩනැගීමට අවශ්‍යයි.
  • අනුපිටපත් හා අඩු‑ගුණාත්මක තොරතුරු ඉවත් කිරීම – මෙය පද්ධතියේ ප්‍රතිචාර වේගය හා නිරවද්‍යතාව වැඩි කරයි, එවිට ව්‍යාපාරික තීරණ තක්සේරු කිරීම පහසු වේ.
  • වෙබ් පිටු ව්‍යුහය අනුව chunking කිරීම – සිසුන්ට AI‑පදනම් පාඨමාලා නිර්මාණය කරන විට, නිවැරදි ප්‍රශ්න‑පිළිතුරු මොඩලයක් සාදා ගැනීමට මෙය අත්‍යවශ්‍යයි.

එසේම, ස්ථානයේ පදනම් වූ නීති, පෞද්ගලිකත්ව නීති, සහ පරිශීලක අවසරයන්ට ගැළපෙන ලෙස දත්ත සැකසීම, ශ්‍රී ලංකාවේ සයිබර් ආරක්ෂණ නීතිවලට අනුකූලව ව්‍යාපාරික ආරක්ෂාව තහවුරු කරයි.

අවසන් වශයෙන්, RAG පද්ධතියේ සාර්ථකත්වය තෝරාගත් දත්ත ගුණාත්මකභාවය, නවීනත්වය, සහ පද්ධතියේ ස්වයංක්‍රීය නවීකරණ හැකියාව මත පදනම් වේ. එම නිසා, ingestion layer එකේ අඩුපාඩු හඳුනාගෙන, ඒවා නිරාකරණය කිරීම, AI‑අපේක්ෂිත ප්‍රතිඵල ලබා ගැනීමට අත්‍යවශ්‍ය වේ.

💡 RAG පද්ධතිවල සාර්ථක ingestion සඳහා අදම ඔබේ සැලැස්ම සකස් කරන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#RAG #DataIngestion #AI #SriLankaTech #Developers