Pereiti prie turinio

Mūsų technologija: lietuviška balso grandinė, valdoma nuo pradžios iki pabaigos

AI balso agentas telefonu nėra vienas produktas — tai kelių technologijų grandinė. Klientas kalba, sistema jį supranta, sugalvoja atsakymą ir prabyla atgal, ir viskas turi įvykti per akimirką, kad pokalbis skambėtų natūraliai. Šio puslapio tikslas — paprastai paaiškinti, iš ko ta grandinė sudaryta ir kurias jos dalis kuriame patys.

Trumpas atsakymas: dvi svarbiausias lietuvių kalbos dalis — kalbos atpažinimą ir balso sintezę — treniruojame patys, o ne nuomojamės iš užsienio tiekėjų. Būtent tai lemia, ar agentas supranta lietuviškus vardus ir ar skamba kaip žmogus, o ne kaip robotas su akcentu.

Iš ko sudarytas AI balso agentas telefonu?

Iš keturių pagrindinių dalių, kurios dirba viena po kitos maždaug per sekundę:

  1. Telefonijakaip skambutis pasiekia agentą (telefono numeris, ryšys). Naudojame profesionalią balso jungtį su ES serveriais.

  2. Kalbos atpažinimas (angl. STT — Speech-to-Text)kliento šneka paverčiama tekstu. Šią dalį lietuvių kalbai treniruojame patys.

  3. Kalbos modelis (angl. LLM — Large Language Model)„smegenys“, kurios supranta prasmę ir suformuluoja atsakymą pagal jūsų žinių bazę.

  4. Balso sintezė (angl. TTS — Text-to-Speech)tekstas paverčiamas natūralia lietuviška šneka. Šią dalį irgi kuriame patys.

Pramonėje tokia grandinė vadinama „pakopine“ (angl. cascaded): garsas kiekvienoje pakopoje virsta tekstu ir atgal. Galutinę kokybę lemia ne viena dalis, o tai, kaip visos jos suderintos tarpusavyje — todėl svarbu, kieno rankose jos yra.

Kodėl lietuvišką kalbos atpažinimą (STT) treniruojame patys?

Nes agentas skirtas registruoti ir aptarnauti klientus lietuviškai, o tam nepakanka bendro daugiakalbio modelio.

Vardai ir pavardės. Agentas privalo teisingai išgirsti lietuviškus vardus — su ė, č, ų ir visais linksniais, ne tik tarptautinius. Mūsų atpažinimo modelis treniruotas būtent lietuviškai šnekai telefonu.

Šnekamoji kalba. Klientai nekalba sakiniais iš vadovėlio: dvejoja, persigalvoja, įterpia „nu“, „žinokit“, „palaukit“. Modelis treniruotas suprasti gyvą telefono šneką, o ne diktoriaus įrašus.

Jūsų srities žodynas. Procedūrų pavadinimai, automobilių markės, medicininiai terminai — kadangi modelis mūsų, jį galime pririnkti prie jūsų srities žodyno, o ne laukti, kol tai padarys užsienio tiekėjas.

Kodėl balso sintezę (TTS) kuriame patys?

Nes balso natūralumas — pirmas dalykas, iš kurio klientas atpažįsta „pigų robotą“ ir padeda ragelį.

Linksniai ir kirčiai. Sintezuojamas balsas sako „lauksime jūsų trečiadienį, spalio aštuntą dieną“ taisyklingais linksniais ir natūraliais kirčiais — be roboto akcento.

Skaičiai, datos, laikai. Telefone nuolat tariami skaičiai (kaina, valanda, data). Juos tarti taisyklingai lietuviškai yra atskiras darbas, kurį darome patys.

Kadangi balsą kuriame patys, galime jį tobulinti pagal jūsų grįžtamąjį ryšį — o ne rinktis iš kelių fiksuotų užsienio balsų, kurių kokybės nekontroliuojame.

O agento „smegenys“ (kalbos modelis, LLM)?

Čia elgiamės kitaip — ir sąmoningai. Kalbos modelį (LLM) naudojame geriausią rinkoje per jungtį (API) su duomenų tvarkymo sutartimi (DPA). Didžiuosius kalbos modelius kuria kelios pasaulio kompanijos, investuojančios milijardus; kurti savo nuo nulio nebūtų nei protinga, nei sąžininga jums.

Vertė, kurią kuriame mes, yra ne pats modelis, o kaip jį panaudojame: jūsų žinių bazė, pokalbio scenarijus, apsauga nuo išgalvotų atsakymų ir integracijos. Modelis yra variklis; mes suprojektuojame visą automobilį aplink jį ir vairuojame lietuviškai.

Ar palaikote kitas kalbas be lietuvių?

Taip — ir tai mūsų nuosavos technologijos bei ES įrankių derinys.

Lietuvių — mūsų nuosava technologija (kalbos atpažinimas ir balso sintezė), su visu gyliu, apie kurį rašėme aukščiau. Tai mūsų stiprioji pusė ir ją visada valdome patys.

Kitas kalbas (anglų, rusų, lenkų ir kt.) palaikome per Microsoft Azure AI Speech ES regione: pokalbio pradžioje kalbos analizatorius atpažįsta, kokia kalba kalba klientas, ir agentas perjungia į tos kalbos supratimą bei balsą. Azure palaiko per 100 kalbų, tačiau mes nesiūlome „visų kalbų“ kaip reklamos — su jumis suderiname konkretų rinkinį, kurio iš tikrųjų reikia jūsų klientams (pavyzdžiui, lietuvių ir anglų).

Kodėl būtent Azure ir ES regionas: duomenys lieka ES (svarbu finansams ir jautriems sektoriams), tai tas pats debesis kaip mūsų kalbos modelis, ir viskas dengiama viena duomenų tvarkymo sutartimi. Lietuvių kalba visada lieka mūsų — tai, kas mus išskiria. Daugiakalbį perjungimą kiekvienam klientui suderiname ir paruošiame diegimo metu.

Kodėl visą grandinę valdome savo infrastruktūroje?

Dėl trijų priežasčių, kurių nebūtų sudėjus grandinę iš svetimų dalių.

Greitis (latencija).

Pokalbio natūralumą lemia ritmas: žmonės telefonu atsako beveik akimirksniu. Kai visa grandinė mūsų rankose, galime taikyti šiuolaikinius metodus — balso sintezę pradėti dar formuluojant atsakymą (angl. streaming), tiksliai nustatyti, kada klientas baigė kalbėti (angl. endpointing / turn-taking), leisti klientui pertraukti agentą vidury sakinio (angl. barge-in). Kiekvieną tokią milisekundę derinam patys, o ne laukiam, kol tai padarys užsienio tiekėjas.

Duomenų vieta.

Balso duomenys nekeliauja per dešimtį svetimų paslaugų — jie lieka mūsų valdomoje ES infrastruktūroje.

Nepriklausomybė.

Nesame įkaitas vieno užsienio tiekėjo kainų ar taisyklių pokyčių: jeigu kuri nors dalis mūsų, ją tobuliname pagal jūsų poreikį, ne pagal svetimą tvarkaraštį.

Kur ir kaip apdorojami duomenys?

Tiksliai ir be reklaminių perdėjimų: balso duomenys (atpažinimas ir sintezė) apdorojami mūsų valdomoje ES infrastruktūroje; teksto apdorojimui naudojamas kalbos modelio jungtis (LLM API) su duomenų tvarkymo sutartimi (DPA). Su kiekvienu klientu pasirašome duomenų tvarkymo sutartį, kurioje aiškiai apibrėžta, kas yra duomenų valdytojas, kas tvarkytojas ir kokie duomenys kur keliauja. Plačiau — saugos ir atitikties puslapyje.

Kuo tai skiriasi nuo užsienio platformos „apvalkalo“?

Daugelis rinkoje siūlomų „lietuviškų“ balso robotų yra užsienio platformų apvalkalai: lietuvių kalba juose — viena iš dešimčių ar šimtų pridėtų kalbų, kurios kokybės tiekėjas nekontroliuoja. Tai teisėtas pasirinkimas, bet jis reiškia platumą, ne gylį.

Mes renkamės atvirkščiai — gylį vienoje kalboje. Investuojame į lietuvišką kalbos atpažinimą ir balso sintezę, nes tikime, kad Lietuvos klientas nusipelno pokalbio, kuris skamba kaip žmogaus, o ne kaip į lietuvių kalbą „išverstas“ užsienio įrankis. Esame vieni pirmųjų, viešai įrodančių nuosavą lietuvišką balso technologiją — ir tą įrodymą galite išgirsti demonstracijoje.

Dažni klausimai apie mūsų technologiją

Toliau — tiesūs atsakymai į klausimus, kuriuos dažniausiai užduoda techniškesni klientai.

  • Ar tikrai patys treniruojate lietuvišką STT ir TTS?

    Taip. Lietuvišką kalbos atpažinimą (STT) ir balso sintezę (TTS) treniruojame patys ant lietuviškos šnekos, o ne nuomojamės kaip gatavą užsienio paslaugą. Geriausias įrodymas — ne aprašymas, o demonstracinis pokalbis, kuriame galite bandyti agentą „sulaužyti“ lietuviškais vardais ir šnekamąja kalba.
  • Ar naudojate ElevenLabs ar kitą užsienio balsą?

    Lietuvių kalbos balso sintezei naudojame savo, ne užsienio, modelį — būtent tai leidžia kontroliuoti lietuviškų linksnių, kirčių ir skaičių tarimą. Kitoms kalboms (kai jų reikia) naudojame Microsoft Azure AI Speech ES regione, kad duomenys liktų ES. Kalbos modelį (LLM, „smegenis“) naudojame išorinį per jungtį su duomenų tvarkymo sutartimi, nes tokius modelius kuria kelios pasaulio kompanijos ir kurti savo nuo nulio nebūtų prasminga.
  • Kuo nuosava technologija praktiškai geresnė už „apvalkalą“?

    Trimis dalykais: tikslesnis lietuviškų vardų ir šnekamosios kalbos supratimas, natūralesnis tarimas su taisyklingais linksniais bei kirčiais, ir galimybė viską pritaikyti jūsų srities žodynui. Kadangi grandinė mūsų, galime ją derinti pagal jūsų grįžtamąjį ryšį, o ne laukti užsienio tiekėjo.
  • Kur apdorojami mūsų klientų duomenys?

    Balso duomenys apdorojami mūsų valdomoje ES infrastruktūroje; teksto apdorojimui naudojamas kalbos modelio jungtis (LLM API) su duomenų tvarkymo sutartimi (DPA). Detalės ir sutartys aprašytos saugos ir atitikties puslapyje.
  • Ar galite pritaikyti agentą mūsų srities terminams?

    Taip. Kadangi kalbos atpažinimą ir sintezę kuriame patys, galime juos pririnkti prie jūsų žodyno — procedūrų pavadinimų, prekių ženklų, specifinių terminų. Tai suderiname diegimo metu ir tiksliname pagal realius pokalbius.
  • Kiek kalbų agentas moka ir supranta?

    Lietuvių kalbą — pilnai, savo nuosava technologija (tai mūsų stiprioji pusė). Kitas kalbas (anglų, rusų, lenkų ir kt.) palaikome per Microsoft Azure AI Speech ES regione, kuris moka per 100 kalbų; tačiau nesiūlome „visų kalbų“ — su jumis suderiname konkretų rinkinį, kurio reikia jūsų klientams. Pokalbio pradžioje kalbos analizatorius atpažįsta kalbą ir perjungia. Daugiakalbį perjungimą paruošiame diegimo metu.

Išgirskite skirtumą, tada spręskite

Technologiją geriausia vertinti ne aprašymu, o ausimis. Registruokitės į demo — parengsime bandomąjį pokalbį pagal jūsų sritį, ir išgirsite, kaip agentas supranta lietuvišką šneką ir taria vardus. Arba užpildykite formą ir gaukite pasiūlymą per 24 val. darbo dienomis.