Noile modele reprezintă o schimbare importantă față de generațiile anterioare de asistenți vocali, care transformau vocea în text, generau un răspuns scris și apoi îl redau audio, scrie Financial Times. Modelele mai noi pot procesa și genera direct vorbire, reducând întârzierile, tonul nefiresc și pierderea contextului.
„Oamenilor le place să își folosească vocea pentru a pune întrebări. Este foarte potrivită pentru acea conversație naturală, dus-întors. Textul este foarte bun și el, dar să tastezi presupune mult efort”, a declarat Atty Eleti, product lead pentru ChatGPT Voice în cadrul OpenAI.
OpenAI și Google mizează pe conversațiile vocale cu AI
Pariul companiilor este că, pe măsură ce sistemele AI trec de la simpla oferire a unor răspunsuri la executarea unor sarcini care se desfășoară pe perioade mai lungi, utilizatorilor li se va părea mai natural să vorbească decât să introducă instrucțiuni într-o fereastră de chat.
Primele date prezentate de companii indică deja o schimbare de comportament. Google spune că utilizarea funcțiilor sale vocale live s-a dublat în anul până în aprilie, iar conversațiile cu chatbotul sunt, în medie, de cinci ori mai lungi prin voce decât prin text. La OpenAI, peste 150 de milioane de persoane folosesc săptămânal funcțiile vocale din ChatGPT.
Sarah Bird, chief product officer pentru responsible AI la Microsoft, spune că vocea începe să câștige din nou teren odată cu dezvoltarea agenților care pot executa sarcini de durată.
„Începe să crească din nou odată cu acești agenți care rulează pe perioade lungi, unde pur și simplu pare foarte natural să le dai sarcinile prin voce”, a spus Bird.
Ea a adăugat că vede inclusiv colegi care lucrează pe GitHub, platforma de programare a Microsoft, și care trimit de pe telefon comenzi vocale pentru activități de coding.
OpenAI susține că tehnologia vocală a fost afectată anterior de un decalaj în ceea ce privește nivelul de inteligență al modelelor. Până la lansarea ChatGPT Live săptămâna trecută, primul său model vocal nou din ultimii doi ani, soluția vocală OpenAI fusese criticată pentru viteza redusă și pentru faptul că putea confunda diferite limbi sau accente.
„Oamenii pur și simplu încep să vorbească mai mult pentru că știu că modelul înțelege, iar acum se așteaptă să poată face mai multe și vor ca dispozitivele respective să facă mai multe”, a spus Leland Rechis, responsabil de experiențele vocale în cadrul Google.
Google a ales, potrivit acestuia, un stil conversațional „mult mai spontan”, după ce compania a observat că utilizatorii au devenit mai confortabili să vorbească cu inteligența artificială odată ce modelele lingvistice mari au ajuns „în spatele microfonului”.
Vocea începe să fie folosită inclusiv pentru programare
Programarea este unul dintre primele domenii în care susținătorii tehnologiei spun că vocea ar putea avea un avantaj. Atunci când vorbesc, utilizatorii pot descrie mai detaliat intenția, constrângerile și rezultatul pe care îl urmăresc decât atunci când încearcă să comprime problema într-un prompt scris.
Sandro Gianella, care lucrează în strategie internațională și operațiuni la OpenAI, spune că vocea a devenit o componentă importantă a modului în care utilizează Codex, instrumentul de programare al companiei.
„Când tastez, de multe ori comprim problema prea devreme și trec direct la sarcină. Când vorbesc, tind să explic mai mult de ce: ce încerc de fapt să obțin, care este intenția mea, ce constrângeri contează, unde am incertitudini și cum ar arăta un rezultat bun”, a scris Gianella pe LinkedIn în această lună.
Creșterea utilizării instrumentelor vocale a determinat unele startupuri din Silicon Valley să investească inclusiv în microfoane noi și în izolarea fonică a birourilor, pentru a împiedica sistemele să confunde comenzile utilizatorilor cu zgomotul ambiental.
Soluțiile merg de la microfoane tip lavalieră până la dispozitive integrate într-un tub negru sau chiar într-o protecție pentru gură.
În paralel, apar startupuri hardware care încearcă să facă interacțiunea vocală mai discretă și mai fiabilă. Pocket și Plaud, de exemplu, dezvoltă mici dispozitive portabile destinate dictării.
Startupurile de AI vocal atrag investiții de 7 miliarde de dolari
OpenAI este, de asemenea, așteptată să lanseze la începutul anului viitor primul produs dintr-o nouă familie de dispozitive, un asistent vocal ambiental echipat cu o cameră, microfon și difuzor, potrivit mai multor persoane familiarizate cu proiectul.
Interesul pentru tehnologia vocală se reflectă și în finanțări. Investițiile de venture capital în startupurile de AI vocal au crescut la 7 miliarde de dolari în primul trimestru al acestui an, comparativ cu puțin sub 1 miliard de dolari în aceeași perioadă a anului trecut, potrivit datelor PitchBook.