ඔබේ AI සෙවුම් පද්ධතිය ලිපියක සාරාංශයක් ලබා දෙන අතර, නවතම ප්රශ්නයට නිවැරදි වාක්යයක් නොලැබෙයිද? මේක නවතම vector chunking තාක්ෂණය විසින් විසඳන ගැටළුවයි.
ඉතාමත් සුළු උදාහරණයක් ලෙස, සොයාගැනීමේ ක්රමයක් ලිපියේ මුළු වචන ගණනකට එකම වෙක්ටර් එකක් ගනී. එවිට මොඩලය ලිපියේ ප්රධාන මාතෘකාව පමණක් අල්ලා, තදින් වැටෙන විස්තරාත්මක වාක්යය අතහැර දමයි. එම නිසා සෙවුම් පද්ධතිය ‘ඇත්තේ මෙය’ කියා හොඳ ප්රදේශයක් පෙන්වා දෙයි, නමුත් ‘ඇත්තේ මේ වාක්යය’ කියා නොදෙයි.
මෙම ගැටළුව ‘representational collapse’ කියලා හැඳින්වෙයි – එක් embeddings එකක් ලිපිය පුරා අර්ථය සාරාංශ කරන විට, දිගු පාරාග්රාෆ් එකේ වැදගත් තොරතුරු අතුරුදහන් වේ. එම නිසා සෙවුම් ප්රතිඵලය මාතෘකාවට අනුගතව පෙනේ, නමුත් ක්රියාත්මක වශයෙන් අයදුම්කරුට ප්රයෝජනවත් නොවේ.
මෙම ගැටළුවට සරල විසඳුම වන්නේ, ලිපිය එකම කොටසක් ලෙස නොගෙන, චන්ක් (chunk) ලෙස බෙදා ඒකක‑එකක Embedding කිරීමයි. චන්ක් එකක් තරමට කුඩා වුවත්, ඒ තුළින් ලිපියේ එකම අර්ථමය මාදිලිය අල්ලා ගත හැක, එසේම පරිසරය (context) රැකගත හැක. මෙය නිවැරදි cosine similarity ගණනයට ඉඩ සලසයි, ඉන්පසු පරිශීලක ප්රශ්නයට අදාළ චන්ක් එකක් තෝරා ගත හැක.
ශ්රී ලංකාවට ඇති වැදගත්කම
- ඉගෙනුම් වාසි: සිසුන්ට AI සහ NLP පිළිබඳ වඩා ගැඹුරු අධ්යයන අවස්ථා ලැබේ. චන්ක්‑අඩංගු Embedding පද්ධති නිසා ප්රශ්න‑උත්තර පද්ධති, සාරාංශකරණ මෙවලම් ඉතා නිරවද්ය වේ.
- ඩිවෙලොපර්ලාට: කේත කොටස්, API ලේඛන, ගිට්හබ් README වැනි තොරතුරු සෙවීමේදී තනි චන්ක් එකක් ඉලක්ක කර ගැනීමේ හැකියාව, වැඩි දක්ෂතා සහ වේගවත් සංවර්ධනයට දායක වේ.
- ව්යාපාරික පරිසරය: ගනුදෙනුකරුවන්ගේ විමසුමට සෘජුවම පිළිතුරු ලබා දීමෙන් සේවා තත්ත්වය උසස් වේ. කාර්ය සාධනය, ගනුදෙනුකරු තෘප්තිකාරකය, සහ පාරිභෝගික නිරීක්ෂණය ඉහළ යයි.
තවත් වැදගත් කරුණක් නම්, චන්ක් බෙදීමේදී overlap (ආවරණ) භාවිතය. 10‑20% ආවරණයක් තබා, වාක්යයක් චන්ක් සීමාවක් හරහා ගමන් කරන අවස්ථාවට දෙකම සම්බන්ධ වෙයි. මෙය සෙවුම් නිවැරදිභාවය වැඩි කරයි, තැන්පත් අවශ්යතාවයක් නොමැතිව.
අවසන් වශයෙන්, මෙම ක්රමය Pinecone, LangChain වැනි ප්ලැට්ෆෝම් වල දැනටමත් භාවිතා වේ. ඔබේ ව්යාපෘතියේ සෙවුම් නිරවද්යතාවය වැඩි කිරීමට, ලිපි, කේත, හෝ දත්ත ගොනු සියල්ල චන්ක්‑අඩංගු Embedding කරන්න.
ඔබේ AI සෙවුම් පද්ධතිය දැන් තවත් නිරවද්ය, වේගවත්, සහ භාවිතා‑හිතකාමී බවට පත්වේ.