ඔන්ලයින් කතාබස් පුහුණු වේදිකාවක් ක්රියාත්මක කරන ශ්රී ලංකා සංවර්ධකයකු, AI ගනුදෙනුකරුගේ පිළිතුරන් ඉතා වේගයෙන් පැමිණීම නිසා කතාබස් මැදම කඩකිරීමේ ගැටලුවක් මුහුණ දුන්නේය. එම ගැටලුව විසඳීමට, පද්ධතියේ වේගය අනිවාර්යයෙන්ම අඩු කරමින්, කතාබස් සම්පූර්ණ වීමට අවශ්ය කාලය වැඩි කළේය.
මෙම වේදිකාවේ පසුබැසීමේ තාක්ෂණික මූලිකාංග වන්නේ Pipecat (ඔර්කෙස්ට්රේෂන්), LiveKit (දත්ත ප්රේරණ), Deepgram Flux (STT), Cartesia Sonic (TTS) සහ OpenRouter මත පදනම් වූ කතාබස් AI මොඩලයයි. ජූලි මාසයේ පද්ධතියේ p95 latency 880 ms පමණ වූ අතර, AI ගනුදෙනුකරු කතාබස් අවසන් වූ බව තේරුම් ගන්නා තත්වය (EOT) ඉතා අධිකව සකසා තිබුණි.
ඉතා වේගවත් පයිප්ලයින් එක නිසා, AI ගනුදෙනුකරු පරිශීලකයා තවත් වචනයක් කියා ඇරඹීමට පෙරම පිළිතුරක් පෙන්වීමෙන්, කතාබස් මැදම කඩකිරීම සිදු වුණි. එය “ඉක්මන් වේගය ගැටලුව තවත් ගැටලුවක් බවට පත් කරයි” යන නිගමනයට හේතුවිය.
සංවර්ධකයා eager end‑of‑turn විකල්පය අක්රිය කර, VOICE_EOT_THRESHOLD 0.5 සිට 0.7 දක්වා, VOICE_EOT_TIMEOUT_MS 700ms සිට 1200ms දක්වා වැඩි කළේය. එම වෙනස්කම් පසු, AI පිළිතුරු පළවෙනි අඩි 0.5 තත්පරයකින් පසු එළඹී, කතාබස් ස්වභාවික රිදීමක් ලෙස පෙනෙමින්, කඩකිරීම් නැතිවී ගියා.
ඉන්පසු, පද්ධතියේ p95 latency 1 second කට අඩු නොවී, පරිශීලකයාගේ “කතාබස් ඉවසීම” කාලය වෙන් කර තිබේ. මෙය p50 latency (සාමාන්ය කාලය) හා වෙනස් වන අතර, p95 අගය පරිශීලකයාට සැබෑ අත්දැකීමක් ලබා දේ.
ශ්රී ලංකාවට ඇති වැදගත්කම
මෙම පළපුරුද්ද ශ්රී ලංකාවේ තාක්ෂණික පිරිසට, විශේෂයෙන් AI, WebRTC සහ cloud සේවා පිළිබඳ වැඩ කරන සංවර්ධකයන්ට වටිනා පාඩමකි.
- ඉගෙනුම් වාසිය: පද්ධති වේගය හා අවසන්‑තත්ව සකස් කිරීමේ සම්බන්ධතාවය ගැන පැහැදිලි අවබෝධයක් ලබා ගත හැක.
- ව්යාපාරික ප්රයෝජනය: AI කතාබස් සේවාවන්හි පාරිභෝගික අත්දැකීම උත්තරීතර කර ගැනීමට, latency‑ය පාලනය කිරීමේ වැදගත්කම තේරුම් ගත හැක.
- ඉංජිනේරු නවෝත්පාදනය: TTS ඉල්ලීම් “chunking” කිරීම මගින් මිනිත්තු කිහිපයකට පමණ ලාභයක් ලැබීමේ ක්රමයක් අධ්යයනය කළ හැක.
අවසන් වශයෙන්, පද්ධතියේ websocket එක අස්ථිරව බිඳී යාම නිසා AI ගනුදෙනුකරු කණගාටුකාරීව කතා නොකිරීමේ දෙවන බග් එකද හඳුනා ගන්නා ලදි. මෙම අත්දැකීම්, වඩාත් විශ්වාසදායක, පරිශීලක‑මිතුරා AI කතාබස් පද්ධති නිර්මාණයට මාර්ගෝපදේශයක් ලෙස කටයුතු කරයි.