ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-25, Saturday
💻 ක්‍රමලේඛනය · 🕒 කියවීමට විනාඩි 2 · 👁 1

PDF, DOCX, HTML ගොනු වලින් පවතින ලේඛන පෙළ නිවැරදිව ලබා ගැනීමේ නව ක්‍රමවේදය

PDF, DOCX, HTML ගොනු වලින් පවතින ලේඛන පෙළ නිවැරදිව ලබා ගැනීමේ නව ක්‍රමවේදය

දත්ත විශ්ලේෂණ, AI සාරාංශකරණ, හෝ පද්ධති සඳහා ලේඛනවලින් පවතින පෙළ නිවැරදිව ගෙන එය පරිගණකයට කියවීම අත්‍යවශ්‍යයි. නමුත් PDF වැනි ගොනු වලින් නිශ්චිත, අනුක්‍රමික පෙළ ලබා ගැනීම සැලකිය යුතු අභියෝගයකි. මෙම ලිපියෙන් එම ගැටලුවට ප්‍රායෝගික විසඳුම් කිහිපයක් ඉදිරිපත් කරයි.

PDF ගොනුවක් යනු ඇස්තමේන්තු (drawing) වැඩසටහනක නිර්මාණයක් වන අතර, එහි අන්තර්ගතය "මෙම ග්ලයිෆ් එක මෙහි සම්මතයකට පසු තබන්න" ලෙස සංග්‍රහ කර ඇත. ඒ නිසා පරාග්‍රාෆ්, පාඨ අනුක්‍රමය, හෝ පාද සටහන් වැනි තොරතුරු අඩංගු නොවේ. බොහෝ පුස්තකාලයන් page.get_text() ලෙස පෙළ ලබා දෙයි, නමුත් එය y-අක්ෂය අනුව සකස් කරයි; දෙකකොළම් ලිපි වල මෙය ගැටළුවක් බවට පත්වේ.

ඉහළ ගුණාත්මක ප්‍රතිඵලයක් සඳහා පළමුව තීරු (column) හඳුනා ගැනීම අත්‍යවශ්‍යයි. ලිපි පළල (page_width) මත සියලුම පාඨ බ්ලොක්ස් වල x-අක්ෂය ව්‍යාප්ත කර, අඩු පිරීම් (gap) පරීක්ෂා කර තීරු සීමා හඳුනාගන්නා කේත උදාහරණයක් මෙහි දැක්වේ. ඒ අනුව, පළමුව තීරු අනුව සකස් කර, පසුව ඉහළ-පහල අනුක්‍රමය අනුව වර්ගීකරණය කරයි.

තවත් වැදගත් කරුණක් වන්නේ පේජ් හි ඇති ශීර්ෂක, පාද සටහන්, DOI, පේජ් අංක වැනි බොයිලර්පේට් (boilerplate) තොරතුරු ඉවත් කිරීම. ඒවා පිටපත් වෙද්දී පෙළ මැද අස්ථානගත වීමෙන් පසු ඒවා ඉවත් කිරීම බරපතල වේ. ඉතා සාර්ථක ක්‍රමයක් ලෙස, බොයිලර්පේට් තොරතුරු පිටු ගණනේ 60% කට වැඩි පරමාර්ථයක් තිබේදැයි ගණනය කර ඉවත් කරයි.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ ඉගෙනුම් ආයතන, මෘදුකාංග සංවර්ධකයින්, ව්‍යාපාරිකයන් සඳහා මෙම තාක්ෂණය විශාල වාසියක් ලබා දෙයි.

  • විශ්වවිද්‍යාල සිසුන් – PDF පත්‍රිකා, පර්යේෂණ ලිපි වලින් නිවැරදි පෙළ ලබාගෙන AI සාරාංශකරණය හෝ පළමු අධ්‍යයන පරික්ෂණ සඳහා භාවිතා කළ හැක.
  • ඩිවෙලොපර්ලා – ලේඛනවලින් තොරතුරු අලලා APIs හරහා සකස් කිරීමේ ක්‍රියාකාරිත්වය වේගවත් කරයි, ඉතිරි කාලය UI/UX වැඩකටයුතු වලට යොදයි.
  • ව්‍යාපාර – නීතිමය ලේඛන, ගිණුම් වාර්තා, ගනුදෙනු ලේඛන වැනි PDF, DOCX ගොනු වලින් පවතින තොරතුරු ස්වයංක්‍රීයව ලබා ගැනීමෙන් දත්ත විශ්ලේෂණය, අනුකූලතා පරීක්ෂණ පහසු කරයි.

අවසානයේ, PDF, DOCX, HTML ගොනු වලින් පවතින අනුක්‍රමික, පිරිසිදු පෙළ ලබා ගැනීම මෘදුකාංග සංවර්ධනයේ මූලික පියවරක් බව පෙනේ. නවතම කේත උදාහරණ හා ක්‍රමවේද භාවිතයෙන්, ශ්‍රී ලංකාවේ තාක්ෂණික ප්‍රගතිය තවත් ඉදිරියට ගෙන යා හැක.

💡 ඔබේ ව්‍යාපාරයට අදම පිරිසිදු ලේඛන පාරිභෝගිකතා එක්කරන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#PDF #DOCX #HTML #Extraction #SriLankaTech