Apache Spark 4.2 නව නිකුතුවේ, SQL මඟින් සෘජු Vector Search ක්රමයක් එක් කර ඇත. එයින් අර්ථය වන්නේ, ඔබේ embeddings (වෙක්ටර්) දත්ත ගබඩාවේම රැඳී, වෙනම Vector Database එකක් තැබීමට අවශ්ය නොවීමයි.
Spark 4.2 හි NEAREST BY වැනි නව ප්රාථමිකයන්, vector distance, similarity, normalization, sum, average වැනි ගණිත ක්රියාකාරකම් සපයයි. මේවා SQL විධාන මගින් සරලව භාවිතා කළ හැකි බැවින්, පරණ “bolt‑on” ලයිබ්රරිය හෝ වෙනත් එන්ජින් අවශ්ය නොවේ. එමඟින් embeddings එකක් Spark ටේබලයකට සුරැකුම් කර, සමානත්වය පරීක්ෂා කර, ඉහලම K ලක්ෂ්යයන් තෝරා ගත හැකිය.
කොහොමද මේක වැදගත්? පසුගිය කාලයේ බොහෝ සංවිධාන, දත්ත ලේක් හෝ වාර්හවුස් එකේ embeddings තබා, වෙනම Vector Database එකක් (උදා: Pinecone, Milvus) ස්ථාපනය කර, ඒ අතර සින්ක් කිරීමේ පද්ධතියක් තැනීමට සිදු විය. ඒ නිසා පද්ධතියේ අඩංගු කොටස්, ආරක්ෂාව, පිරිවැය, 2am දෝෂ නිරාකරණය වැනි ගැටලු උදාවුණි. Spark 4.2 එම පියවර අඩු කර, එකම වේදිකාවේ data processing හා vector search එකක් ලබා දෙයි.
නමුත්, සෑම අවස්ථාවකම මේක ප්රයෝජනවත් නොවේ. Real‑time, low‑latency (වෙනත් මිනිත්තු කිහිපයකින් අඩු) සෙවීමක් අවශ්ය නම්, HNSW වැනි Approximate Nearest Neighbor (ANN) index සපයන විශේෂිත Vector Database එකක් තවමත් වඩා සුදුසු. Spark 4.2 නවතම වර්ගයේ exact search පමණක් සපයන බැවින්, විශාල dataset එකක් මත exact similarity ගණනය කිරීම වේගයෙන් අඩු වේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තොරතුරු විද්යාත්මක පරිසරය තවමත් වඩාත් ව්යාප්ත වෙමින් පවතින අතර, Spark 4.2 නව Vector Search එක මෙහිදී විශාල වාසියක් ගෙනෙනු ඇත.
- ඉගෙනුම් ආකාරය: විශ්වවිද්යාල සහ පුහුණු වැඩමුළුවල AI, ML පාඨමාලා වලදී, embeddings එකක් Spark තුළම තබා, SQL භාවිතයෙන් සමානතා විශ්ලේෂණය කිරීම ඉගෙන ගැනීම සරල වේ.
- ඩිවලපර්ලාගේ කාර්යබහුලතාවය: තනි පද්ධතියක් (Spark) භාවිතා කිරීමෙන්, data pipeline එකේ සංකීර්ණතා අඩු වේ, නවීන AI සේවා (RAG chatbots, recommendation engines) ඉක්මනින් නිර්මාණය කළ හැකිය.
- ව්යාපාරික ප්රතිලාභ: Vector Database එකක් වෙනම තබා පවත්වා ගැනීමට අවශ්ය ආධාර, බලපෑම්, ආරක්ෂා ගාස්තු අඩු කර, පිරිවැය ඉතිරි කිරීමේ හැකියාව ලැබේ. එමෙන්ම, Spark එකේ ඇති සම්පූර්ණ data lakehouse සමඟ සම්බන්ධතාවය නිසා, analytics සහ AI පරීක්ෂණ එකටම කළ හැකිය.
අවසන් වශයෙන්, Spark 4.2 Vector Search එක batch, analytical පරිසරයන් සඳහා ඉතා හොඳ තේරීමකි. Real‑time, user‑facing සෙවීම් සඳහා, වර්තමාන Vector Database තවමත් ආරක්ෂිත තේරීමයි. ඔබේ වැඩ බර, latency අවශ්යතා අනුව තීරණය කරන්න.