LioranDB නව පූර්ණ පාඨ සෙවීමේ සැග්මන්ට් ව්යුහය හඳුන්වා දී, සාමාන්ය ද්විතීය ඉන්ඩෙක්ස් වලට නොහැකි වාක්ය‑මට්ටමේ සෙවීම් දැන් සරලව කරගත හැකිය.
සාමාන්ය ද්විතීය ඉන්ඩෙක්ස් එකක් status = "active" වැනි සරල සමානතා පරීක්ෂා කිරීමේදී හොඳයි, නමුත් "distributed database" වැනි වාක්යය අඩංගු ලේඛන සොයා ගැනීමට කාර්යක්ෂම නොවේ.
LioranDB මේ ගැටලුවට පිළිතුරු ලෙස, විශේෂිත text‑segment architecture එකක් ගොඩනඟා ඇත. මෙය ලේඛනවල පාඨය වචන වලට (token) බෙදා, ඒවායේ සෙවුම් කාර්යක්ෂමතාවය වැඩි කරයි.
වචන බෙදීම (tokenization) සදහා පාඨය අකුරු‑අංක නොවන අක්ෂරයන් මත බෙදේ. ඉන්පසු විකල්ප අනුව, සියලු වචන කුඩා අකුරට පරිවර්තනය කර, නවතම stop‑words මකා දමයි. උදාහරණයක් ලෙස “Building Distributed Databases” වචන තුනක් [building, distributed, databases] ලෙස පරිවර්තනය වේ.
එක් සැග්මන්ට් එකේ අඩංගු වන්නේ:
- Term dictionary – වචන ලැයිස්තුව
- Posting lists – වචන සහ ඒවා අඩංගු ලේඛන ID
- Document map – ලේඛන ID ග්ලෝබල් ID වෙත පරිවර්තනය
- Document‑length norms – ලේඛන දිග සම්භාවිතය
- අවශ්යනම් term positions – වචන ලේඛන තුළ ඇති ස්ථානය
- Bloom filter – වචන පවතිනවාදැයි ඉක්මනින් පරීක්ෂා කිරීම
- Segment metadata
Posting list එක වචනයක් සහ ඒ වචනය අඩංගු ලේඛන ID ගණනාවක් සම්බන්ධ කරයි. උදාහරණයක් ලෙස “database” → [doc 2, doc 8, doc 19] ලෙස සටහන් වේ. වචන ස්ථානය (positions) සුරකින්නේ නම්, වාක්ය‑මට්ටමේ සෙවුම් හෝ වචන අනුක්රමය අනුව සෙවීමට ඉඩ සලසයි.
සැග්මන්ට් එකේ ලේඛනවලට ස්ථානීය (local) IDs ලබා දී, ඒවා ග්ලෝබල් IDs වෙත document map එක මඟින් පරිවර්තනය කරයි. මෙය posting list කුඩා කර, සෙවුම් වේගය වැඩි කරයි. Bloom filter එක වචනයක් ඒ සැග්මන්ට් එකේ නැතිනම් පරීක්ෂා කිරීමේදී “නැත” කියා තහවුරු කරයි; “ඇත” කියා ඇත්නම් එම සැග්මන්ට් එකේ තවත් පරීක්ෂා කිරීම අවශ්ය වේ.
සෙවුම් පද්ධතිය AND, OR වැනි ලොජිකල් මෙහෙයුම් සහිතව, ප්රතිඵල වල score, query time, කියවූ postings ගණන, පරීක්ෂා කළ සැග්මන්ට් ගණන වැනි මැට්රික්ස්ද ලබා දේ. මෙය සාමාන්ය ද්විතීය ඉන්ඩෙක්ස් එකක් ලෙස නොසලකා, වෙනම විශේෂිත පූර්ණ පාඨ සෙවුම් ඉන්ඩෙක්ස් එකක් ලෙස සැලකිය යුතුය.
ශ්රී ලංකාවට ඇති වැදගත්කම
- ශ්රී ලංකාවේ තරුණ සංවර්ධකයින්ට ඉතා කාර්යක්ෂම පූර්ණ පාඨ සෙවුම් අත්හදා බැලීමට නව පළපුරුද්දක් ලැබේ.
- ශ්රි ලංකා ආයතනවල දත්ත ගබඩා කිරීමේදී, වචන‑මට්ටමේ සෙවුම් අවශ්යතාවය ඇති ව්යාපාර සඳහා වේගවත්, නිරවද්ධ විසඳුමක් සපයයි.
- වෙනත් ඩේටාබේස් හා API සමඟ ඉක්මන් ඒකාබද්ධ කිරීම සිදු කර, මෘදුකාංග සංවර්ධනයේ කාලය හා වියදම අඩු කරයි.
කෙටියෙන් කියවියහොත්, LioranDB හි පූර්ණ පාඨ සෙවුම් සැග්මන්ට් ව්යුහය, දත්ත සෙවීමේ නව තත්ත්වයක් ගොඩනඟා, ශ්රී ලංකාවේ තාක්ෂණික පරිසරය තුළ නව අභියෝග සහ අවස්ථා නිර්මාණය කරයි.