ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-21, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

දත්ත ග්‍රැෆ් එකේ එකම සිදුවීම පස් වරක් පෙන්වීමේ ගැටලුව සහ නව විසඳුම

දත්ත ග්‍රැෆ් එකේ එකම සිදුවීම පස් වරක් පෙන්වීමේ ගැටලුව සහ නව විසඳුම

ඊශ්‍රාණ්‍ය ආසියාවේ සිදු වන එක් සමාගම් ව්‍යාපාරික සිදුවීමක්, කොරියානු, ජපන්, චීන, ඉංග්‍රීසි වැනි බහු භාෂා මාධ්‍යවලින් වාර්තා වීම නිසා, ඔබේ දත්ත ග්‍රැෆ් එකේ එකම සිදුවීම අනිවාර්යයෙන්ම බහු Event නෝඩ් ලෙස පෙනේ.

උදාහරණයක් ලෙස, එක් මර්ජර් එකක් OpenDART (කොරියානු) තුළ ගොඩනැගී, EDINET (ජපන්) හරහා වාර්තා කර, හොංකොං කොටස් වෙළඳපලේ චීන පුවත් පත්‍රිකාවේ දැක්වෙයි, ඉන් පසු ඉංග්‍රීසි වයිර් සේවාවක සාරාංශයක් ලියයි. එම සිදුවීමේ පත්‍රිකා හතරක්, නමුත් ඔබේ පයිප්ලයින් එක-පත්‍රිකාව-එක් LLM කැඳවුමක් භාවිතා කරයි නම්, ග්‍රැෆ් එකේ චාරිත්‍රිකව වෙන්වූ සිදුවීම් නාමාවලියක් උදා වෙයි.

මෙම ගැටලුවේ වැදගත්කම වන්නේ, පරිශීලකයන්ට එකම මර්ජර් එක ත්‍රිත්වයක් ලෙස පෙනීම, විශ්ලේෂණ වියදම වැඩිවීම, සහ AI මොඩලයන්ට අධික “hallucination” අවදානමක් ඇති වීමය. එම නිසා, සිදුවීම් අතර coreference (එකම සිදුවීමේ හඳුනා ගැනීම) අත්‍යවශ්‍ය වේ, නමුත් එය entity resolution (නාම සමාන කිරීම) වලින් වෙනස් වේ.

ලේඛකයා විසින් ගැටළුවට අදාළව ගත් විසඳුම දෙදසීය ප්‍රවේශයක් වේ. පළමුව, නව “resolver” එකක් නිර්මාණය කර, ග්‍රැෆ් එකේ පවත්නා Event නෝඩ් වලට පූර්ව-පරීක්ෂණයක් කරන ලදී. එය පහත මූලික නීති තුන මත පදනම් වේ:

  • අවම වශයෙන් එක් සමාන canonical entity එකක් හවුලේ තිබීම
  • දිනයේ වෙන්වීම් 72 පැයක් ඇතුළත පවතින බව
  • එකම event type එකක් හෝ Jaccard token‑overlap සීමාව ඉක්මවන සාරාංශය
මෙම පිරික්සුම LLM කෝල් ගණන අඩු කර, ඉහළම සමානතා ලකුණු ඇති යුගල පිරිසක් තෝරා ගනී.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

මෙම තාක්‍ෂණික ප්‍රගතිය ශ්‍රී ලංකාවේ සිසුන්, සංවර්ධකයින්, ව්‍යාපාරිකයින් සඳහා විශාල වාසියක් ලබා දෙයි:

  • සිසුන් – බහුභාෂා දත්ත සමුදා සමඟ වැඩ කිරීමේ නව ක්‍රමවේද ඉගෙන ගැනීමට, AI‑driven knowledge graph නිර්මාණය පිළිබඳ අත්හදා බැලීමට අවස්ථාව ලැබේ.
  • සංවර්ධකයින් – නියමිත rule‑based filter සහ LLM‑based coreference model එකක් භාවිතා කර, ග්‍රැෆ් නිර්මාණයෙහි පරිභෝගික වියදම සහ latency අඩු කර, real‑time analytics වලට සුදුසු පරිසරයක් සකස් කර ගත හැක.
  • ව්‍යාපාරිකයින් – එකම සිදුවීම බහු වරක් පෙන්වීම නිසා ඇති ව්‍යාජ තොරතුරු වලින් වළකිමින්, තීරණ ගැනීමේ නිවැරදිභාවය වැඩි කර, compliance සහ risk management වැඩි දියුණු කර ගත හැක.

දෙදසීය විශ්ලේෂණය කිරීමෙන්, “same”, “related”, “distinct” යන තුන් වර්ගයක් තුළ Event නෝඩ් එකතු කිරීමේ නිශ්චිත ප්‍රතිඵල ලබා ගනිමින්, පද්ධතියේ නිරවද්‍යතාවය සහ විශ්වාසභාවය ඉහළ නැංවෙයි.

අවසන් වශයෙන්, මෙම නව ආකෘතිය මගින් knowledge graph හි සිදුවීම් ගැටලුව විසඳා, AI‑driven data pipelines කුඩා වියදමකින්, වැඩි නිශ්චිතතාවකින් සහ වේගවත් ප්‍රතිචාරයකින් පවත්වා ගත හැකි බව තහවුරු කරයි.

💡 ඔබේ අදහසක් දායක කරමු!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#event-coreference #knowledge-graph #AI #LLM #data-deduplication