DNA තොරතුරු ගොනුවක් බලලා “මේක මොකක්ද?” කියලා සිතන ඔබට, දැන් Python, LlamaIndex, FAISS යොදාගෙන ඒ තොරතුරු ප්රායෝගික තොරතුරකට පරිවර්තනය කරගන්න පුළුවන්.
මෙම උපදෙස් මගින් 23andMe, Ancestry.com වැනි සේවාවන්ගෙන් ලබා ගත් raw .vcf හෝ .txt ගොනුවක් ගෙන, ඒවා Pandas සහ Biopython භාවිතා කර සරලව පාර්ස් කරගන්නෙමු. පාර්ස් කළ පසු, උසස්‑ආකාරයේ SNP (Single Nucleotide Polymorphism) දත්ත තෝරා, ClinVar නමින් ලෝකයේ ප්රමුඛතම ජීනෝමික් වර්ගීකරණ දත්ත ගබඩාව සමඟ සම්බන්ධ කරගනිමු.
ClinVar දත්ත සම්පූර්ණයෙන් LLM (Large Language Model) එකකට දායක නොකිරීම සඳහා, අපි FAISS Vector Store එකක් සකස් කර, රුචිකර වර්ග (උදා: හෘද රෝග, මැටබොලික් රෝග) සඳහා සීමා කළ සංස්කරණයක් පමණක් අඩංගු කරගනිමු. මෙය LlamaIndex මගින් ඉන්ඩෙක්ස් කර, RAG (Retrieval‑Augmented Generation) යන්ත්රය භාවිතා කර ඔබගේ DNA‑යේ rsid අංකය සමඟ සම්බන්ධිත සෞඛ්ය තොරතුරු ලබාගැනීමට ඉඩ සලසයි.
අවසන් වශයෙන්, GPT‑4o මොඩලයක් මෙම සම්බන්ධිත තොරතුරු එකතු කර, ඔබට තේරුම් ගත හැකි ඉන්ටරක්ටිව් රිස්ක් රිපෝට් එකක් උත්පාදනය කරයි. මෙය ඔබගේ ජාන තත්ත්වය පිළිබඳ තීරණ ගැනීමට, වෛද්ය උපදෙස් ලබා ගැනීමට, හෝ පර්යේෂණ කටයුතු සඳහා ආරම්භක දත්ත ලෙස භාවිතා කිරීමට උදව් කරනවා.
ශ්රී ලංකාවට ඇති වැදගත්කම
- විද්යාර්ථීන් සහ පර්යේෂකයින් – Genomic RAG පයිප්ලයින් එකක් නිසා දේශීය ජාන පර්යේෂණ කටයුතු වේගවත් කර, ලොව පළවෙනි දත්ත සමුදා සමඟ සරලව සම්බන්ධ වීමට හැකි වේ.
- ඩිවෙලොපර්ලා – Python, LlamaIndex, FAISS වැනි නවතම AI‑දෘශ්ය පරිසරයන් සමඟ වැඩ කිරීමෙන් තාක්ෂණික කුසලතාවයන් වැඩිදියුණු වේ.
- ව්යාපාරිකයන් – නව සෞඛ්ය‑තාක්ෂණ සේවා, පෞද්ගලික DNA‑විශ්ලේෂණ ඇප්ස්, හෝ රෝග විශ්ලේෂණ AI විසින් නව ආදායම් මාර්ග ගොඩනැගීමට අවස්ථාව ලැබේ.
මෙම පයිප්ලයින් සකස් කිරීම සංකීර්ණ නොවේ; ඔබට Python පරිසරයක්, සුළු ගොනු දෙකක් (DNA VCF ගොනුව සහ ClinVar CSV) සහ අඩු පරිමාණ GPU එකක් (හෝ CPU) තිබ්බාම පමණක් අවශ්යයි. ඉදිරියේදී, මෙවැනි RAG තාක්ෂණය සෞඛ්ය‑තොරතුරු, කෘෂි‑ජීනෝමික්, හෝ පාරිසරික DNA විශ්ලේෂණ වැනි විශාල ක්ෂේත්රවලට වඩාත් ව්යාප්ත වේ.
ඔබේ DNA‑ය ගැන දැන් තොරතුරු පමණක් නොව, ඒ තොරතුරු මත පදනම්ව ක්රියාත්මක විය හැකි පියවර ගැනීමටත්, තාක්ෂණික නවෝත්පාදනයේ අත්දැකීම් ලබා ගැනීමටත් මේ පයිප්ලයින් ඔබට උපකාරී වේ.