ඉදිරි තාක්ෂණික ලෝකයේ පොත් පරිවර්තනයේ අලුත් තරඟයක් පටන් ගනී. බහු-කණ්නාඩි (multi‑voice) ඇඩියෝබුක් නිර්මාණය කරමින්, හඬ තෝරා ගැනීමේ ගැටලුවට වඩා, සීල (click) සහ ශබ්ද පරාස ගැලපීමේ ගැටළු නිසා අත්යවශ්ය ගුණාත්මකත්වය අඩු වෙයි. මේ ලිපියෙන්, එවැනි ගැටළු ඉවත් කර, නිරන්තර, සීල‑නොමැති ඇඩියෝබුක් එකක් නිර්මාණය කරන ක්රමවේදයක් හඳුන්වා දෙයි.
EPUB ගොනුවක් සරල zip ගොනුවක් වුවද, එහි OPF manifest, spine, nav වැනි අංගයන් නිසා පරිච්ඡේද (chapter) හඳුනා ගැනීම සරල නොවේ. කීපයක් සිදුවේ: එක spine අයිතමය තුළ පරිච්ඡේද පහක් ඇතුළත් වීම, හෝ එක් පරිච්ඡේදයක් බොහෝ spine අයිතමවලට බෙදා හරිනවා. එමනිසා, පරිච්ඡේද හඳුනා ගැනීමේ ත්රි-සංඛ්යාත (nav, heading, spine) ක්රමයක් භාවිතා කරයි.
පරිච්ඡේද හඳුනා ගැනීමේ වැදගත් පියවර
- nav ලේඛනයේ fragment ID (chapter3.xhtml#ch3) පළමු සලකුණ ලෙස භාවිතා කිරීම.
- content හි heading (h1‑h2) මට්ටම පරිච්ඡේද සලකුණක් ලෙස පරීක්ෂා කිරීම.
- අවසානයේ spine අනුපිළිවෙලට පදනම්ව fallback කිරීම.
අදාල front‑matter (cover, copyright) සහ back‑matter (acknowledgments, index) හඳුනා ගනිමින්, ඒවා සයිලන්ට් (skippable) ලෙස සලකයි. පරිශීලකයන්ට අවශ්ය නම් ඒවා ඇතුළත් කළ හැකිය, නමුත් ISBN වැනි අංක කියවීම වැළැක්වීම අත්යවශ්යය.
ඉදිරියට, TTS මොඩ්යුලයෙන් ලැබෙන සියලු segment (sentence/paragraph) එකතු කිරීමේදී මතු වන්නා වූ තුන් ප්රධාන ගැටළු:
- Sample rate mismatch – විවිධ voice engine හෝ දිනය අනුව 24kHz, 22.05kHz වැනි sample rate වෙනස් වීම. සියලු segment එකට float32 වලට decode කර, එකම sample rate එකකට resample කර පසුකාලීන encode කිරීම.
- Click noises – segment A අවසන් වීමේ amplitude හා segment B ආරම්භයේ amplitude අතර තද පඩි. ඒ සඳහා trailing silence trim, leading silence trim, 8ms fade‑in/out යෙදීමෙන් click ඉවත් කරයි.
- අසමත් silence gaps – engine එකෙන් ලබා දෙන leading/trailing silence අස්ථිරවීම නිසා හඬ අතර අඩු පරතරයක් පෙනේ. එය trim කිරීමෙන් පසු, අවශ්ය silence පදනමක් නැවත එක් කරයි.
ශ්රී ලංකාවට ඇති වැදගත්කම
ශ්රී ලාංකීය සිසුන්, සංවර්ධකයන් හා ව්යාපාරිකයන් සඳහා මේ තාක්ෂණය විශාල අවස්ථාවක් වේ. පළමු, ග්රන්ථාගාරයේ ඉංග්රීසි‑සිංහල පොත් වල TTS මගින් අඩු‑මිලට, සීල‑නොමැති ඇඩියෝබුක් සැපයීමෙන් අධ්යාපන ප්රවේශය වර්ධනය වේ. දෙවැනි, දේශීය app developers ලට EPUB parsing හා audio stitching algorithm එකක් අන්තර්ගත කිරීමෙන්, තමාගේ සේවා වඩාත් ප්රභල කරගත හැක. තුන්වැනි, ස්ථානික ප්රකාශකයන්ට AI‑driven TTS භාවිතා කර, අඩු කාලය තුළ බහු‑කණ්නාඩි ඇඩියෝබුක් නිර්මාණය කිරීමේ හැකියාව ලැබේ, ඒත් එය නව වෙළඳපල අවස්ථා සලසයි.
අවසන් වශයෙන්, TTS segment stitching තාක්ෂණය ඇඩියෝබුක් නිර්මාණයේ “නොදැනුම්” ගුණාත්මකත්වය ඉහළ නැංවීමට මූලිකය. එය සීල‑නොමැති, ස්ථාවර volume, නිරන්තර පරිච්ඡේද සැලැස්වීමේ මඟින් ශ්රෝතාන්ට අත්දැකීමේ ගුණාත්මකභාවය වැඩි කරයි. මෙය ශ්රී ලංකාවේ අධ්යාපන, තාක්ෂණික හා වාණිජ පරිසරයට නව මාර්ගයක් විවර කරයි.