ආයතනික Data Loss Prevention (DLP) පද්ධතිවල වැඩිම ගැටලුව නිතර අනිසි දත්ත හඳුනා ගැනීමයි. කේත කට්ටල, README හෝ ටෙස්ට් උදාහරණ වල ඇති අක්ෂර පදනම්ව වැරදි ඇලර්ට් ලැබෙයි.
Spidercob නම් DLP විසඳුම සංවර්ධනය කරමින්, අපි පළමුව regex මත පදනම්ව සංකේත හඳුනා ගැනීමට කාලය ගත්තා. නමුත් එම ක්රමය 20-අක්ෂර උඩු-අකුරු පදයක්ද critical ලෙස ලේබල කරනවා වගේ අතුරුදන්වීම් ඇතිවිය.
වෙළඳපොළේ අත්හරින ත්රි-ස්තර ප්රවේශය:
- Validators – regex එකට පසු ආකෘති පරීක්ෂණ. කාඩ්පත් අංක වලට Luhn ඇල්ගොරිතම, SSN වල අංක පරාස පරීක්ෂණ, JWT වල Base64‑Decode කර JSON වල නිවැරදි ක්ෂේත්ර පරීක්ෂණ. මෙයින් කාඩ්පත් වැරදි 90%ක් අඩුවේ.
- Entropy Gating – Shannon entropy මත පදනම්ව පදයක් “රහස්” වන්නේ කෙතරම් අහඹුද කියා මැනීම. 3.5 කට වඩා අඩු entropy ඇති strings, නැවත නැවත පෙනෙන අකුරු, ශබ්දකෝෂ වචන, අනුක්රමික රටාවන් වැනි අමුතු දේවල් ඉවත් කරයි. Sliding window තාක්ෂණය සමඟ අඩු‑entropy පද 8-අක්ෂර කොටසක් පවා ඉවත් කරයි.
- Context Scoring – සොයාගත් string එකේ ±100 අක්ෂර පරිසරය විශ්ලේෂණය කර, "production", "secret" වැනි වචන ඇතුළත් නම් ලකුණ වැඩි, "example", "placeholder" වැනි වචන අඩු කරයි. 0.0‑1.0 අතර score එක ගණනය කර, ඉහළ score (0.7‑ට වැඩි) වලට පමණක් CI බ්ලොක් කිරීම සිදු කරයි.
මෙම ත්රි‑ස්තර ක්රමය ග්රහණය කිරීමෙන් false positives 80%ක් අඩු විය. අධික ඇලර්ට් වලින් නිර්මාණශීලී කණ්ඩායම් බාධා නොවී, DLP නිවැරදිව රහස් දත්ත සොයාගැනීමට හැකි වුණා.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තාක්ෂණික ආයතන, start‑ups සහ විශ්වවිද්යාල සිසුන්ට මේ නවීන DLP ක්රමවේදය විශාල වාසියක්. මුලින්ම, අතිරේක වැරදි ඇලර්ට් වලින් මුදල් හා කාලය ඉතුරුවීමේ හැකියාව ලැබේ. දෙවැනි, entropy‑ගේට් පදනම්ව සකස් කළ ලාබ් සොෆ්ට්වෙයා පාඨමාලා, සිසුන්ට Shannon entropy හා data security මූලධර්ම ඉගැන්වීමට හොඳ උදාහරණයක් වේ. තුන්වැනි, ශ්රී ලංකා ආයතනවල cloud‑based API සහ micro‑service ආකෘති භාවිතා කරන විට, context scoring මඟින් නිශ්චිත production secret හඳුනා ගැනීමේ විශ්වාසය වැඩිවේ.
අවසානයේ, DLP තාක්ෂණයෙහි වැරදි අඩු කිරීම නිසා ආයතන ආරක්ෂාව ශක්තිමත් වේ, සංවර්ධකයින්ගේ නිෂ්පාදන වේගය වැඩිවේ, සහ ශ්රී ලංකාවේ තාක්ෂණික පරිසරය ජාත්යන්තර ප්රමිතීන් සමඟ ගැලපේ.