ඇමතුමකදී පාරිභෝගිකයා කතා කිරීම නවත්තලා සිටින තත්වයෙන් පළමු පිළිතුරේ ශබ්දය ඇසෙන තෙක් කාලය 500 ms පමණයි. මේ කාලය ඉක්මවා ගියොත් කථාව රොබෝ වගේ අහඩ් වෙලා, පාරිභෝගිකයා කතා කපා හෝ ඇමතුම අත්හැරීමට ඉඩ ලැබේ.
වෙළඳ සේවාවන් සඳහා භාවිතා කරන කථා AI ඇජන්ට් එක තුනක් මූලික කොටස්ගෙන් යුක්තයි – Speech‑to‑Text (STT), Large Language Model (LLM) සහ Text‑to‑Speech (TTS). මෙයින් තවත් එකක් CRM API එකට ඇමතුම් කරලා තොරතුරු ලබා ගන්නා “tool” ලූපයයි. මේ සියල්ල එකට ගතහොත් සම්පූර්ණ ප්රතිචාර කාලය 1.5‑2 s පමණ වේ – පාරිභෝගිකයාට අසීරුයි.
කාලය කොහෙද වැය වෙන්නේ?
- වචන අවසන් කිරීම (endpointing) – 200‑800 ms
- STT නිරාකරණය – 50‑150 ms (කතා කරන අතරම ස්ට්රීම් වෙයි)
- LLM පළමු ටෝකන් – 200‑600 ms
- TTS පළමු බයිට් – 100‑300 ms
- ජාල/දුරකථන ගමන්‑ගත කාලය – 2 × 50‑150 ms
මෙම කාලයන් එකට එකතු කළොත් 2 s ක පසුබැසීමක් වේ. නමුත් අවස්ථානුකූලව කාර්යයන් එකිනෙකට රැඳෙන්න නොදෙන්නේ නම් කාලය අඩු කළ හැකිය.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලංකාවේ තාක්ෂණ ශිෂ්යයන්, සංවර්ධකයන් සහ ව්යාපාරිකයන්ට මේ නව වාස්තුකලාපය විශාල වාසියක් ගෙන එයි.
- ශිෂ්යයන් – AI කථා ඇප්ලිකේෂන් නිර්මාණය කළ හැකි නව පාරිභෝගික අත්දැකීම් ගැන අධ්යයනයෙන්, පරිගණක විද්යාවේ ප්රායෝගික දැනුම වැඩි වේ.
- සංවර්ධකයන් – Stream‑based API, VAD/endpointing සැකසුම්, Pipecat, LiveKit වැනි ලයිබ්රරීන් භාවිතයෙන් කාලය අඩු කරන තාක්ෂණික කුසලතා ඉගෙන ගත හැක.
- ව්යාපාරිකයන් – 500 ms කට අඩු ප්රතිචාර සමඟ පාරිභෝගික සතුට වැඩිවීම, ඇමතුම් අස්ථානගත වීම අඩුවීම, ඒ මගින් අලෙවි හා සේවා ගුණාත්මකත්වය උසස් වේ.
උදාහරණයක් ලෙස, CRM අමතා දත්ත ලබා ගත යුතු අවස්ථාවල “ඉදිරියට කතා කරනවා” කියලා TTS එකෙන් “මොහොතක් රැඳෙන්න” කියා පාරිභෝගිකයාට කියා දෙන විට, 1‑2 s පූර්ණ නිශ්ශබ්ද කාලය අඩු කරයි. ඒ නිසා පාරිභෝගිකයා “කතා කපා ගිය” කියලා හැඟීමක් නොවේ.
කාලය අඩු කිරීමේ රහස වන්නේ, එක් කොටසක් අවසන් වන තුරු රැඳී නොසිට, ඊළඟ කොටසට දත්ත යවා පාරිභෝගිකයාට ඒකක‑ඒකකයෙන් ශබ්දය ලබා දීමයි. මෙය “stream‑first” තත්ත්වය ලෙස හැඳින්වේ.
අවසන් වශයෙන්, AI කථා ඇජන්ට් එකේ latency‑වලට අවධානයක් දෙමින්, කේතය නිසි පරිදි සැකසීම, VAD/endpointing සකස් කිරීම, සහ CRM ඇමතුම් පෙරම TTS‑කින් පුරවා දීමෙන්, 500 ms කට අඩු කාලයේ පාරිභෝගික අත්දැකීමක් ලබා දිය හැකිය.