වෙබ් අඩවියක් සොයාගත හැදියාව පරීක්ෂා කරන විට බොහෝ දෙනා මුලින්ම හෝම්පේජ් එකට GET ඉල්ලීමක් දී HTTP 200 කෝඩ් ලැබෙයි කියලා 'අඩවිය සොයාගත හැක' කියලා තේරුම් ගනී. නමුත් මේ ප්රතිචාර එකම පාරක්, එකම ජාලයක්, එකම user‑agent එකක්, එකම අවස්ථාවක් පමණක් පෙන්වයි.
ඇයි එය ප්රමාණවත් නොවනවා? AI ක්රොලර්, සාමාන්ය බ්රවුසරය, සරල ස්ක්රිප්ට්, හෝ WAF (Web Application Firewall) නීතිය අනුව එකම URL එකට වෙනස් ප්රතිචාර ලබා ගත හැක. CDN එකක් user‑agent අනුව අන්තර්ගතය වෙනස් කරයි, robots.txt නීතියක් එක් බොට්ටුවකට පමණක් පවරා ගත හැක, හෝ challenge පිටුවක් 200 කෝඩ් එකත් සමඟත් සැබැවින්ම ලක්ෂ්ය ලේඛනය නොදෙයි.
උදාහරණයක් ලෙස ඒකම පිටුවට තුනක් වැනි ඉල්ලීම් කළහොත්: සාමාන්ය බ්රවුසරය භාවිතා කරන විට නිෂ්පාදන පිටුව ලැබේ; සාමාන්ය ස්ක්රිප්ට් එකක් භාවිතා කරන විට Cloudflare challenge පිටුව ලැබේ; නියමිත බොට් user‑agent එකක් භාවිතා කරන විට WAF 403 කෝඩ් එක ලැබේ. URL එකම වුවත් ප්රවේශය වෙනස් වනවා.
එබැවින්, curl වැනි එකම කමාන්ඩ් එක AI ක්රොලර් ප්රවේශය තක්සේරු කිරීමට සුදුසු නොවේ. ප්රතිචාරය, user‑agent, අවසන් URL, content‑type, title, canonical URL, robots මාර්ගෝපදේශ, හා අඩවියේ කුඩා fingerprint එකක් වාර්තා කරමින් බහු‑පරීක්ෂණයක් කළ යුතුය. මේවා සමඟින් පරීක්ෂකයාට සොයාගත හැකිය: DNS දෝෂ, timeout, TLS අසාර්ථකත්වය, 429 (rate‑limit), 403, හෝ challenge වැනි මෘදු අසාර්ථකතා.
ශ්රී ලංකාවට ඇති වැදගත්කම
- සිසුන්ට SEO සහ AI ක්රොලර් තාක්ෂණය පිළිබඳ ප්රායෝගික උදාහරණයක් ලැබේ, එමඟින් අන්තර්ජාල අඩවි පරීක්ෂණ කුසලතා වර්ධනය වේ.
- දේශීය සංවර්ධකයින්ට තම වෙබ් අඩවි AI‑බොට් සදහා සාර්ථකව පාරිභෝගිකයන්ට පෙනෙන ආකාරයෙන් සැකසීමට අවශ්ය ක්රමවේදය පැහැදිලිව ඉගෙන ගත හැක.
- ව්යාපාරිකයන්ට AI‑චාලිත සෙවුම් එන්ජින් වලින් අඩවිය වැරදි ලෙස අනුමාන නොවෙයි, එබැවින් ඩිජිටල් වෙළඳපලේ තරඟකාරීත්වය වැඩිවේ.
අවසන් වශයෙන්, 200 කෝඩ් එක “ඇතුළත් විය” කියා කියා නොදෙයි; එය “ඇතුළත් විය, නමුත් කුමක්ද ලැබුණේ?” කියා පරීක්ෂා කළ යුතුය. බොට්, firewall, CDN, හා අන්තර්ගතය වෙන්‑වෙන්ව විශ්ලේෂණය කරමින් පද්ධතියේ සැලැස්ම සකස් කිරීමේදී අඩවිය සත්යයෙන් index‑able ද කියා තීරණය කළ හැකිය.