ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-23, Thursday
💻 ක්‍රමලේඛනය · 🕒 කියවීමට විනාඩි 2 · 👁 1

දිනකට මිලියන ගණනේ වෙබ් පිටු පරිගණකයෙන් ගැලවීමේ අභියෝග සහ ප්‍රායෝගික විසඳුම්

දිනකට මිලියන ගණනේ වෙබ් පිටු පරිගණකයෙන් ගැලවීමේ අභියෝග සහ ප්‍රායෝගික විසඳුම්

මා විසින් පවත්වාගෙන යන වෙබ් ස්ක්‍රැපින් වේදිකාව දිනකට මිලියන ගණනේ පිටු ගැලවීමට සමත් විය. සාර්ථක අත්දැකීම 95% ක් පමණයි, එක් පිටුවක් සකස් කිරීමේ කාලය තත්පර 3 ක් පමණය. බොහෝ දෙනා “ස්ක්‍රැපර්” කොඩ් එකක් ලෙස හිතන කොටස කුඩා පරාසයක් පමණක්, එය පූර්ණ පද්ධතියේ 1% ක් පමණයි. ඉතිරි කාලය පද්ධතියේ අවට සියලු කොටස් නිමවා ගත වූවා.

ප්‍රධාන ගැටළු හා ඒවායේ හේතු

1. සීමාවක් නොමැති කට්ටලය (Queue) – සයිට් එකේ සර්වර් එකක් හදිසි ලෙස සියලු URL ගොඩක් එවීමේදී, Redis මතකය දින 2ක් පුරාවට ඉහලට ගියේය. පද්ධතිය එකවර අත්හිටුවා දැමුවා. විසඳුම: කට්ටලයට සීමා තබා, පුරා වූ විට නිෂ්පාදකයින්ට බ්ලොක් හෝ රඳවන්න.

2. නැවත උත්සාහ කිරීමේ (Retry) තදබදය – අඩවි එකක් 500 දෝෂයක් දුන්නාම, ඒ පිටු 40,000ක් එකම 10 තත්පර තුළ නැවත ඉල්ලුම් කරන ලදි. ඒ නිසා WAF එක අධික බරට පත් විය. විසඳුම: jitter‑සහිත backoff සහ domain‑වලට circuit breaker එකක් යෙදීම.

3. ගොඩනැගීමේ පසු දුර්වලතා (Deduplication) – එකම නිෂ්පාදනය විවිධ URL මඟින් ලැබෙයි. ගැලවීමෙන් පසු පමණක් නිශ්චිත කිරීම කරන්නේ නම්, අතිරේක වියදම සහ IP බ්ලොක් අවදානම වැඩි වේ. URL enqueue කිරීමේදී canonicalize කර, TTL හෝ bloom‑filter භාවිතයෙන් set එක කළමනාකරණය කරන්න.

4. පාර්සරය (Parser) මාරු වීම – වෙබ් අඩවියේ මිල තොරතුර DOM node එකෙන් script එකට ගෙන යාම, හෝ attribute නාම වෙනස් වීමෙන්, extraction සාර්ථක වුවත් ක්ෂේත්‍රයක් null වෙයි. ක්ෂේත්‍ර‑පිරිවැය (field fill‑rate) මැනීම, බහු‑extraction strategy (JSON‑LD, microdata, CSS selectors) භාවිතය මඟින් මෙය වැළැක්විය හැක.

5. CPU‑බඳ පාර්සරය – HTML parsing CPU‑බඳ කාර්යයක් වන අතර, single‑threaded event loop එකේ එය බාධා කරයි. එම නිසා network‑level concurrency වැඩි වුවත් throughput අඩු වේ. Parsing කාර්යය multi‑threaded workers හෝ separate process වලට බෙදා හරිනු ලැබේ.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

මෙම පාඩම් ශ්‍රී ලංකාවේ තාක්ෂණික පරිසරයට විශාල ප්‍රයෝජන ගෙන දේ.

  • ඉගැන්වීම් – දේශීය විශ්වවිද්‍යාල හා පාඨමාලා වලට real‑world scaling case study එකක් සැපයෙනවා.
  • ඩිවෙලපර් – queue, retry, deduplication වැනි මූලික concepts ඉගෙනගැනීමෙන්, ස්ථානීය startups ලා වඩා හොඳ architecture එකක් ගොඩනැගීමට හැකියාව ලැබේ.
  • ව්‍යාපාර – data extraction වැඩි ධාරිතාවයෙන්, වෙළඳපල විශ්ලේෂණය, මිල සැකසුම්, SEO automation වැනි සේවා සපයන්න පුළුවන්.

අවසන් වශයෙන්, වෙබ් ස්ක්‍රැපින් වැඩි පරිමාණයෙන් කළහොත්, පද්ධති සැලසුම, සම්පත් කළමනාකරණය, සහ මොනිටරින් යන සියල්ලත් සලකා බලනවාම අත්‍යවශ්‍යයි. මෙම අත්දැකීම් හරහා ඔබේ ව්‍යාපාරය හෝ ව්‍යාපෘතිය තවත් පවතින තත්ත්වයට ගෙන යා හැක.

💡 ඔබේ ව්‍යාපාරයට ඉහළ දත්ත ගැලවීමේ කාර්යක්ෂමතාවක් ලබා ගැනීමට දැන්ම ක්‍රියාත්මක වන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#scraping #performance #devops #SriLanka #data