ශ්‍රී ලංකාවේ නවතම තාක්ෂණික පුවත් 2026-07-28, Tuesday
🤖 කෘත්‍රිම බුද්ධිය · 🕒 කියවීමට විනාඩි 2 · 👁 1

WebAudio මගින් මූඛ සාකච්ඡාවේ නිශ්ශබ්දතාවය මැනීම – Speech API එකේ අඩුපාඩු

WebAudio මගින් මූඛ සාකච්ඡාවේ නිශ්ශබ්දතාවය මැනීම – Speech API එකේ අඩුපාඩු

අන්තර්ජාල බ්‍රවුසරයේ ඕනෑම වෙලාවක හඬ ඇසීමට හැකි, AI‑මූලික පරීක්ෂණයක් වන Preterview යෙදුමක් නිර්මාණය කරන කාලයෙදි, "ඇත්තටම අපේක්ෂකයා කතා කිරීම නවතා දැමුවාද?" කියන ප්‍රශ්නයට වහාම පිළිතුරක් ලැබීම අත්‍යවශ්‍ය වුණා.

සාමාන්‍යයෙන් ඕනෑම වාචික ඇප් එකක, කථා‑ටෙක්ස්ට් (STST) සේවාව භාවිතා කරමින් පරීක්ෂකයාට නිශ්ශබ්ද කාලයක් හඳුනා ගත හැකි යැයි සිතෙයි. නමුත් මේ ක්‍රමය සත්‍ය වේලාවේ නිවැරදි සංඥාවක් ලබා දීමට නොහැක. වාණිජ‑වලින් පරිභෝජනය වන Cloud‑Speech recognizer එකේ ජාල ප්‍රතිචාර වේගය, බෆර් කිරීම, සහ මැදින්‑මැදින් නිගමනය වෙනස් කිරීම වැනි කරුණු නිසා, කථා‑ටෙක්ස්ට් ඉන්පූට් අතර ඇති හිස් කාලය වාචික නිශ්ශබ්දතාවය නොව, පද්ධතියේ ප්‍රතිචාරය පමණක් පෙන්වයි.

වලංගු නොවන ත්‍රිත්වය මෙසේ වේ:

  • ජාල ප්‍රතිචාරය – සර්වර් වෙත හඬ යැවීමෙන් පසු ප්‍රතිඵලය ආපසු ලැබීමට ගතවන කාලය නිශ්ශබ්ද කාලය ලෙස වැරදිව හඳුන්වයි.
  • බෆර් කිරීම – recognizer එක හඬ කොටස් තැන්පත් කර, ඒවා කණ්ඩායම් කර එවීම නිසා, කථා කරමින් සිටියදීත් පවතින හිස් කාලයක් පෙනේ.
  • අතරමංගල (interim) ප්‍රතිඵල – පද්ධතිය තාවකාලිකව පදයක් වෙනස් කරන විට, ඒ වෙනස්කම් සිදුවන තත්පරය නිශ්ශබ්ද බවක් ලෙස වැරදි වාර්තා කරයි.

ඒ නිසා, අපි WebAudio API භාවිතා කර, මයික්‍රොෆෝනයේ සෘජු රූප රේඛාව (waveform) මැනීමට තීරණය කළෙමු. Analyzer node එකක් සකසා, RMS (root‑mean‑square) ගණනය කිරීමෙන් එක් කාල පරාසයක ශබ්ද තීව්‍රතාවය ගණනය කරයි. මේ ක්‍රමය හරහා නිශ්ශබ්දතාවය සෘජුවම, පරිසරයේ ශබ්ද මට්ටමට සම්බන්ධව මැනීමට හැකියාව ලැබේ.

වෙබ්‑අවුඩියෝග්‍රාෆ් එකේ හයිස්ටරීසිස් (hysteresis) යෙදීමෙන්, සෑම විටම අඩු‑ඉහල තීරණයක් නොව, ස්ථාවර තීරණයක් ලබා ගත හැක. පළමුව පරිසර ශබ්ද මට්ටම සමාලෝචනය කර, එය “quiet” මට්ටම ලෙස සකසයි. පසුව, කථාකරුගේ කථනයේදී RMS අගය මෙම මට්ටම ඉක්මවා යන විට, පද්ධතිය කතා කිරීමක් ලෙස හඳුනා ගනී. තවද, දෙකක් ත්‍රිත්වයක් (two thresholds) භාවිතා කර, “සැලසුම් කරන අතර” සහ “පිළිතුර අවසන්” යන දෙක වෙනස් කරයි.

ශ්‍රී ලංකාවට ඇති වැදගත්කම

ශ්‍රී ලංකාවේ තරුණ සංවර්ධකයින්, විශ්වවිද්‍යාල සිසුන්, සහ තාක්ෂණික ව්‍යාපාර සඳහා මෙය විශාල අවස්ථාවක් වේ. පළමු වරට, ඉලෙක්ට්‍රොනික පරිසරයක් තුළ AI‑මූලික මූඛ පරීක්ෂණ පුනරුත්පත්තිය ලබා ගත හැකි නිසා, රැකියා සම්මුඛ සාකච්ඡා සඳහා අවශ්‍ය වාචික කුසලතා වඩාත් නිරවද්‍යව පුහුණු කරගත හැකිය. දෙවැනි, WebAudio‑ය භාවිතා කිරීමෙන්, අන්තර්ජාල සම්බන්ධතා අඩු හෝ නොමැති අවස්ථාවල ද පරිසර ශබ්දය මත පදනම් වූ නිශ්ශබ්ද සොයා ගැනීමේ හැකියාව ලැබේ – මෙය ශ්‍රී ලංකාවේ ග්‍රාමීය ප්‍රදේශවලට විශේෂයෙන් වැදගත්.

තවත් වැදගත් කරුණක් වන්නේ, මෙම තාක්ෂණය වෙනත් භාෂා (ඉංග්‍රීසි, කොරියානු) සමඟද සමඟින් ක්‍රියා කරයි, එබැවින් බහු-භාෂා පරිසරයක් ඇති ශ්‍රී ලංකාවේ අන්තර්ජාතික ආයතන සඳහා ඉතා සුදුසු වේ. ඒ නිසා, දේශීය සංවර්ධකයින්ට නව AI‑API, WebAudio, සහ real‑time signal processing යන අංග අධ්‍යයනයට අවස්ථාව ලැබේ.

අවසානයේ, WebAudio මගින් නිශ්ශබ්දතාවය මැනීම, පරිශීලක අත්දැකීම වඩාත් ස්ථාවර කරයි. AI‑මූලික මූඛ පරීක්ෂකයෙකු ලෙස Preterview, ශ්‍රී ලංකාවේ තරුණයින්ට තරඟකාරී රැකියා වෙළෙඳපලේ ඉදිරියට යාමට නව මාර්ගයක් විවෘත කරයි.

💡 ඔබත් AI‑මූලික මූඛ පරීක්ෂණය අත්හදා බලන්න!
මූලාශ්‍රය මෙම ලිපිය AI මගින් රචිත මුල් සාරාංශයකි. සම්පූර්ණ වාර්තාව කියවන්න:
Dev.to ↗
#WebAudio #Speech API #Interview #Sri Lanka #AI