ඔබේ Node.js යෙදුම PDF ලේඛන වලින් පෙළ ලබා ගැනීමට නොමිලේ පුස්තකාලයක් භාවිතා කරන්නේ නම්, මුදල් ගෙවීම් නොමැති බවට විශ්වාස කරගන්නවා වුවත්, එය සැබැවින්ම පිරිවැය අඩු කරනවාද යන්න සැලකිල්ලට ගත යුතුයි.
ලේඛනයක් සාර්ථකව විග්රහ කළ පසු, RAG (Retrieval‑Augmented Generation) පද්ධතියට ප්රශ්න කළාම වැරදි පිළිතුරක් ලැබුණා. මුලින්ම LLM ප්රොම්ප්ට්, embeddings, vector DB වැනි සියලුම අංග පරීක්ෂා කළා. ඒ සියල්ල සරිලනවාද කියලා බලද්දී, ගැටලුව පාර්සරකයේ තිබෙන බව හඳුනාගත්තා. නොමිලේ පාර්සරකය ලේඛනයේ වගුව, තීරු අනුක්රමය, බහු තීරු පිටු ආදිය අස්ථානගත කර, පසුකාලීන පියවරවලට වැරදි chunk එකක් ලබා දුන්නා.
මෙම අවස්ථාවේ වැදගත් කරුණ වන්නේ, ලේඛනය පද්ධතියට ඇතුළත් වන මොහොතේම ගුණාත්මක‑ව‑මිල තීරණයක් ගන්නා බවයි. නොමිලේ පාර්සරකයක් තෝරාගත් විට, ගුණාත්මක දත්ත අඩුවීම නිසා LLM අඩු‑ගුණාත්මක පිළිතුරු ලබා දෙන අතර, ඒ පිළිතුරු නිවැරදි කර ගැනීමට වැඩි token ගණනක්, නැවත‑නැවත LLM ඇමතුම්, සහ පාරිභෝගික අකමැත්තක් වැනි අතිරේක වියදම් ඇතිවෙයි. එම වියදම් “Extraction” පේළියේ නොපෙනෙන නිසා, බිලේ පසුබැසීම LLM පේළියේ පෙනේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තාක්ෂණික සංවර්ධනයේ තරඟකාරීත්වය ඉහළ යාමට, RAG වැනි AI විසඳුම් භාවිතා කිරීම අත්යවශ්ය වේ. නමුත්, සත්ය‑ලෝක ව්යාපාර, විශ්වවිද්යාල, හෝ ආරම්භක සමාගම් සඳහා නොමිලේ පාර්සරක තේරීමේ වැරදි පහත පරිදි බලපායි:
- ඉගෙනුම් ආධාරකයන් සඳහා: සිසුන්ට වැරදි තොරතුරු ලබා දීම, පර්යේෂණ ගුණාත්මකතාව අඩු කරයි.
- ඩිවෙලොපර්ලාට: පද්ධතියේ ධාරිතාව අඩුවීම, වැඩි debugging කාලය, සහ LLM ඇමතුම් ගාස්තුව වැඩිවීම.
- ව්යාපාරිකයන්ට: පාරිභෝගික අකමැත්ත, අධික support tickets, හා අධික operational cost.
ඒ වෙනුවට, සමාගමකින් ලබා දෙන Enterprise‑grade document intelligence සේවාවක් භාවිතා කරන්නේ නම්, වගු, පින්තූර, බහු තීරු පිටු වැනි ලේඛන අංග සම්පූර්ණයෙන්ම සුරැකිවීම නිසා, පළමු LLM ඇමතුමෙන්ම නිවැරදි පිළිතුරු ලැබේ. එමඟින් token ගාස්තුව අඩු වේ, support tickets අඩුවේ, සහ පාරිභෝගික සතුට වැඩි වේ.
සාරාංශයෙන්, “නොමිලේ පාර්සරකයක්” තේරීම මුලික ගාස්තුව අඩු කරන්නේ නමුත්, පසුකාලීන AI පිරිවැය ඉහළ යාමට හේතුවක් වේ. ශ්රී ලංකාවේ තාක්ෂණික ව්යාපාරයන්ට, මුලින්ම ගුණාත්මක document extraction තේරීම අනාගත ගාස්තු ඉතිරි කිරීමේ මුල් පියවරයි.