Sමහ (Sumeh) නමින් නවතම Python පුස්තකාලය, දත්ත ගුණාත්මක පරීක්ෂණ සඳහා එකම API එකක් සපයයි. මෙය Great Expectations, Soda, Pandera වැනි ප්රසිද්ධ ප්රවෘත්තිකයන්ට වෙනස්ව, පළාත් පරිසරයක් නොව, කේත ලයිබ්රරියක් ලෙස නිර්මාණය කර ඇත. ඔබට පමණක් validation rules නිර්වචනය කර, ඒම නියමයන් සියලුම ප්රධාන එන්ජින් – Pandas, Polars, PySpark, Dask, DuckDB, BigQuery, Snowflake, Athena, PyFlink, Ray – මත එකම ආකාරයෙන් ක්රියාත්මක කළ හැක.
ලේඛකයා උදාහරණයක් ලෙස pandas backend එකේ validate ක්රියාවලිය භාවිතා කරයි. නීති දෙකක් (email පූර්ණත්වය, age වයස් පරාසය) දෙන විට, report = pandas.validate(df, rules) ලෙස ක්රියාත්මක කර, report.split() මගින් සොයාගත් නරක පේළි සහ පිරිසිදු පේළි දෙකක් ලබා ගත හැක. මෙය “single‑pass bifurcation” ලෙස හැඳින්වෙයි – දත්ත එකවර පරීක්ෂා කර, එක් විශ්ලේෂණයෙන්ම clean සහ quarantine data වෙන් කරයි. PySpark හි lazy column expressions භාවිතා කිරීම නිසා .collect() කිසිදාත් කැඳවන්නේ නැත, එයින් driver‑side OOM අවදානමක් ඉවත් වේ.
v3.0 නව සංස්කරණය, v2.0 හි සිදු කළ විශාල ආකෘතිගත කිරීමේ පදනම මත, අමතර විශේෂාංග එක් කරයි. API එකේ වෙනස්කම් නැතිව, SQL generation SQLGlot AST මත පදනම්ව සිදු කරයි, එසේම cuallee නාමාවලිය ඉවත් කර ඇත. v2.x පරිශීලකයින්ට නවතම සංස්කරණයට යාවත්කාලීන වීම අඩු වශයෙන් සිදු වේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
- අධ්යාපනය: දත්ත විද්යාව, AI සහ ML පාඨමාලා ගනීම් කරන විශ්වවිද්යාල සිසුන්ට, Sumeh මඟින් වඩාත් සරලව data quality pipeline එකක් ගොඩනැගීමට හැකිවේ.
- ඩෙවලපර්: බහු‑engine support එක නිසා, ලංකාවේ startup හා enterprise පරිසරයන්ට එකම කේත පදනමෙන් Pandas සිට Spark දක්වා දත්ත පරීක්ෂා කළ හැක, මෙය development time අඩු කරයි.
- ව්යාපාර: data‑driven decision‑making සඳහා ගුණාත්මක දත්ත අවශ්යයි. Sumeh හි built‑in split function මගින් bad rows quarantine කර, real‑time monitoring හා lineage tools සමඟ සරලව ඒකාබද්ධ කළ හැක.
අවසානයේ, Sumeh එකම API එකක් මත 14 engine ගණනක් ආවරණය කිරීම, Python දත්ත පරිසරයේ නව මට්ටමක් ගෙන එයි. ඔබේ data pipeline එකේ ගුණාත්මක පරීක්ෂණය සරල, වේගවත්, සහ පරිසර‑මිතුරුවක් කරගැනීමට අදම Sumeh උත්සාහ කර බලන්න.