ගවේශන ලේඛන බොහොමයක් "state‑of‑the‑art" කියලා ප්රකාශ කරනවා, නමුත් ඒකට තක්සේරු පරීක්ෂණ, දත්ත කට්ටල තොරතුරු හෝ කේත ප්රතිපත්ති නොමැතිව. ඒ ගැන කම්පනයෙන් පසු, සංවර්ධකයෙක් raven‑retrieval නමින් 19 retrieval pipelines, BEIR දත්ත කට්ටල, Bonferroni‑corrected bootstrap පරීක්ෂණ සහ සම්පූර්ණ සංඛ්යාත දත්ත එක්කින් අලුත් benchmark එකක් නිර්මාණය කරලා.
මෙම මෙවලම MIT ලයිසෙන්ස් යටතේ විවෘත කේතයක්, ඒ කියන්නේ ඕනෑම කෙනෙකුට එය බාගත කර, තමන්ගේ පරිසරයේ ක්රියාත්මක කර, ප්රතිඵල නැවත පරීක්ෂා කළ හැකිය. මූලික අරමුණ වන්නේ ColBERT‑style late interaction scoring එක RAPTOR hierarchical tree එකේ සෑම මට්ටමකදීම භාවිතා කිරීමේ ප්රයෝජන සත්යය පරීක්ෂා කිරීමයි.
ඒ සඳහා එකම දත්ත කට්ටල, එකම chunking, එකම මැට්රික්ස්, එකම significance test යොදා ගැනීම අත්යවශ්යයි; නැතිනම් ඇපල්‑අපල් තරඟයක් වැනි එකක් වේ. raven‑retrieval සියලු pipelines එකම BEIR දත්ත (SciFact, HotpotQA) මත සමාන පදනමකින් පරීක්ෂා කරයි, චෙරී‑පික් කිරීමක් නැත.
පයිප්ලයින් 19 ක් (සාරාංශය)
- Naive Dense RAG
- Hybrid RAG (BM25+Dense+RRF)
- ColBERT Late Interaction
- RAPTOR+Late Interaction (අලුත් සංයෝගය)
- HyDE, SPLADE, SPLADE+Dense, BM25+Rocchio PRF
- Contextual Retrieval, Contextual Hybrid, Late Chunking
- RAPTOR+Late Traversal, Agentic Multi‑Hop, Reflection Retriever
- Graph Retrieval, Two‑Stage Dense+Reranker, Approximate Late Interaction
- Contextual Dense, Contextual BM25
RAPTOR+Late Interaction යනු RAPTOR හි hierarchical summary tree එක ගොඩනැගෙන පසු, ColBERT MaxSim scoring එක leaf chunks සහ summary nodes දෙකම වෙත යෙදීමයි. මෙය මෙතෙක් කිසිවක් පළ කර නැත.
ප්රධාන ප්රතිඵල
SciFact (100 ප්රශ්න) සඳහා HyDE, Naive Dense, Contextual Hybrid, Hybrid RAG යන 4 pipelines අතර nDCG@10 අගයන් 0.712, 0.696, 0.682, 0.667 ලෙස ලැබුණා. Bonferroni‑corrected පරීක්ෂණ පෙන්වන්නේ මේ 4 ක් එකිනෙකට තරම් වෙනසක් නැති බවයි; BM25+PRF තදින් පසුබැසීමක් පෙනේ. HotpotQA (50 ප්රශ්න) සඳහා Hybrid RAG 0.925, Contextual Hybrid 0.923, Naive Dense 0.906, HyDE 0.892, BM25+PRF 0.869 ලෙස අගයන් වෙනස් වුණා. මෙයින් පෙනෙන්නේ single‑hop කාර්යයන්ට semantic pipelines වඩාත් සුදුසු, multi‑hop කාර්යයන්ට hybrid pipelines වඩාත් ප්රබල බවයි.
v0.3 න් පෙර 13 දෝෂ (6 ක් critical) හඳුනාගෙන නිවැරදි කළා. උදා: PAD token‑වලට MaxSim ඡන්ද ලබාදීම, RAPTOR clustering එකේ embedding space ගැටලුව, BEIR evaluate() හි per‑query ගණනාවක් වැරදි ලෙස ශුන්ය ලෙස ලබාදීම ආදී.
ශ්රී ලංකාවට ඇති වැදගත්කම
මෙම open‑source benchmark එක ශ්රී ලාංකීය AI/ML ශිෂ්යයන්ට, සංවර්ධකයන්ට සහ ව්යාපාරිකයන්ට විශාල වාසියක් ගෙන දෙයි. පළමු වශයෙන්, එකම පදනමකින් 19 pipelines පරීක්ෂා කළ හැකි නිසා ප්රතිපල reproduce කිරීම අතිශය පහසුය. දෙවැනි, RAPTOR+Late Interaction වැනි නව සංයෝගයන් සොයාගැනීමෙන් ලංකාවේ පර්යේෂකයන්ට අන්තර්ජාලයේ නවතම තාක්ෂණය අත්හදා බැලීමට අවස්ථාව ලැබේ. තෙවැනි, MIT ලයිසෙන්ස් යටතේ නිදහස් වීම නිසා සොෆ්ට්වෙයා වියදම අඩු කර, ස්ථානයේම AI‑driven search solutions සංවර්ධනය කර ගත හැකිය. මෙය e‑commerce, දත්ත විශ්ලේෂණ, අධ්යාපන portal වැනි ක්ෂේත්රවල තරඟකාරීත්වය වැඩි කරයි.
අවසන් වශයෙන්, raven‑retrieval වැනි ප්රොජෙක්ට්ස් ශ්රී ලංකාවේ තාක්ෂණික පරිසරය විවෘත, පාරදර්ශී, සහ නවෝත්පාදන‑මූලික බවට පත් කරයි. ඔබත් එකට එක්ව, කේතය fork කර, නව දත්ත කට්ටල එක්කර, ප්රතිඵල extend කර බලන්න.