ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-28, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

RAG AI දැනුම්ගබඩාව 5 පියවරෙන් ලේඛනවලින් සංවාදශීලී මොළයක් සකස් කිරීම

RAG AI දැනුම්ගබඩාව 5 පියවරෙන් ලේඛනවලින් සංවාදශීලී මොළයක් සකස් කිරීම

LLM (Large Language Model) මොළය සෘජුවම ලේඛනයක් තුළට ඇතුළත් කිරීම වියදම වැඩි කරයි, සහිතව “හෝනිය” (hallucination) ඇති වීමට ඉඩ දේ. Retrieval‑Augmented Generation (RAG) නම් තාක්ෂණය, “පළමුව සොයාගැනීම, පසුදා පිළිතුර” යන ක්‍රමයෙන් AI‑ට අවශ්‍ය තොරතුරු පමණක් දෙයි, ඒ නිසා පිළිතුරු ත්‍රැස්තකාරී නොවෙයි.

මෙම ලිපියෙහි විස්තර කර ඇති පියවර 5ක් අනුගමනය කරමින්, ඔබේ ආයතනයේ අභ්‍යන්තර ලේඛන, ගිවිසුම්, නිෂ්පාදන මාර්ගෝපදේශ ආදියන්ගෙන් RAG දැනුම්ගබඩාවක් නිර්මාණය කරගත හැක. මෙය ප්‍රථමයෙන් ලේඛන විශ්ලේෂණය, පසුදා කුඩා කොටස් (chunks) බවට බෙදීම, එම කොටස්වල embedding ලබා ගැනීම, මිශ්‍ර සෙවීම, සහ අවසානයේ පිළිතුරේ මූලාශ්‍රය දැක්වීම යන පියවර වලින් යුක්ත වේ.

පියවර 1 – ලේඛන විශ්ලේෂණය හා පිරිසිදු කිරීම : PDF, Word, Markdown, HTML, TXT, PPT වැනි බහු ආකෘති වලින් පිරිසිදු පෙළ ලබා ගැනීමට එකම API භාවිතා කරයි. ස්කෑන් කළ PDF සඳහා OCR, Word‑හි වගු සඳහා විශේෂ සැකසීම අවශ්‍ය වේ.

පියවර 2 – Chunking (කොටස් කිරීම) : කොටස්වල ප්‍රමාණය සෙවීමේ ගුණාත්මකභාවය තීරණය කරයි. සාමාන්‍යයෙන් 300‑600 token (≈ 500‑800 වචන) 사이 ප්‍රමාණයක් තෝරා, 50 වචන overlap එකක් එක් කරයි. මෙය LLM‑ට පසුබැසීමකින් තොරව තොරතුරු ලබා දීමට උපකාරී වේ.

පියවර 3 – Embedding : සෑම chunk එකක්ම vector බවට පරිවර්තනය කරයි. චීන භාෂාව සඳහා bge‑m3, ඉංග්‍රීසි සඳහා text‑embedding‑3‑large වැනි මොඩල භාවිතා කරයි. batch size 32‑64 අතර තබා API ඇමතුම් ගණන අඩු කරයි.

පියවර 4 – මිශ්‍ර සෙවීම (Hybrid Retrieval) : Vector සෙවීමේ අඩුපාඩු (නාමයන්, නියමිත මාදිලි) පුරනය කිරීම සඳහා BM25 සමඟ RRF (Reciprocal Rank Fusion) එකතු කරයි. PostgreSQL + pgvector + pg_trgm සම්බන්ධයෙන් SQL query එකක් ලියමින් ඉහළ නිරවද්‍යතාවයක් ලබා ගත හැක.

පියවර 5 – මූලාශ්‍ර සළකුණු (Citation) : LLM‑ට "මෙම කොටසෙන් පිළිතුරක් දෙන්න, පසුබැසීමේ තොරතුරේ [^id] ලෙස සලකුණු කරන්න" යන prompt එකක් ලබා දේ. එවිට පරිශීලකයාට පිළිතුරේ මූලාශ්‍රය (ලේඛන නාමය, පිටු අංකය) පෙන්වයි, විශ්වාසය වැඩි වේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

  • ඉගෙනුම් ව්‍යාපාරිකයන් – විශ්වවිද්‍යාල, පුහුණු ආයතන වලින් සෑදෙන පර්යේෂණ ලේඛන, පාඨමාලා සලකුණු ආදියන් RAG මගින් කෙටි ප්‍රශ්න-පිළිතුරු ලෙස ලබා ගත හැක.
  • ඩෙවලපර්ලා – ස්ථානීය API, cloud සේවා සමඟ එකතු කර, පාරිභෝගිකයන්ගේ පෞද්ගලික දත්ත, ගිවිසුම් වැනි ගුප්ත තොරතුරු AI‑ට සුරක්ෂිතව භාවිතා කර ගැනීමට අවකාශය ලැබේ.
  • ව්‍යාපාරිකයන් – අභ්‍යන්තර SOP, නිෂ්පාදන මාර්ගෝපදේශ, නව නිෂ්පාදන තොරතුරු RAG මගින් සජීවී chatbot එකක් ලෙස පාරිභෝගිකයන්ට ලබා දීමෙන් සේවා වේගය සහ ගනුදෙනුකාරකත්වය වැඩි වේ.

RAG තාක්ෂණය මගින් LLM‑වල “හෝනිය” අවදානම අඩු කර, ඔබේ දැනුම්ගබඩාවට ඉක්මන්, විශ්වාසනීය, සහ පාරිභෝගික‑මිතුරු AI‑කථන පද්ධතියක් ගොඩනැගිය හැක.

ඉදිරියේදී Agentic RAG යන නව පියවරේදී, AI‑වලට තවත් සෙවීම්, කීවර්ඩ් වෙනස් කිරීම, හෝ වෙනත් දැනුම්ගබඩාවක් පරික්ෂා කිරීමේ හැකියාව දෙනු ඇත. එය තවදුරටත් නවෝත්පාදන හා නිෂ්පාදන කාර්ය සාධනයේ ප්‍රගතියක් වේ.

💡 ඔබේ ආයතනයේ RAG දැනුම්ගබඩාව අදම සකස් කර බලන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#RAG #AI #Embedding #VectorDB #SriLankaTech