Saltar al contenido

desarrollo · 4 min de lectura

GPT-Live-1 d'OpenAI: veu full-duplex per a la teva empresa

OpenAI llança GPT-Live-1, un model de veu full-duplex que escolta i parla alhora. Què és i què cal mirar abans de portar-ho a l'atenció telefònica de la teva empresa.

Publicat el · Evicron

El 8 de juliol de 2026, OpenAI va presentar GPT-Live-1, un model de veu amb arquitectura full-duplex: escolta i parla alhora, tal com faria una persona, en lloc d’esperar torns com els assistents de veu clàssics. Un dia després va arribar GPT-5.6 (la família Sol, Terra i Luna), el model de raonament al qual GPT-Live-1 delega les tasques complexes. Per a qualsevol empresa que atén trucades —reserves, cites, suport— la pregunta ja no és si la IA de veu sona bé en una demo, sinó si aguanta una centraleta real.

Què canvia amb la veu full-duplex

Els assistents de veu que coneixem —Siri, Alexa, la majoria de bots telefònics— funcionen en semidúplex: un parla, l’altre espera, i si t’interromps la conversa es trenca. GPT-Live-1 fa servir una arquitectura full-duplex que decideix diverses vegades per segon si ha de parlar, escoltar, callar o interrompre, i incorpora senyals conversacionals naturals (“mhmm”, “d’acord”) per sonar menys robòtic. Segons l’anunci oficial d’OpenAI, el model es recolza en GPT-5.6 quan la conversa requereix raonament profund, cerca o diversos passos, sense trencar el flux de la trucada. TechCrunch confirma el desplegament a iOS, Android i ChatGPT.com, amb una variant mini disponible també al pla gratuït.

No és un anunci aïllat: OpenAI va llançar el mateix mes la família GPT-5.6 Sol, Terra i Luna, amb un mode de raonament ampliat i la capacitat de coordinar subagents per a tasques complexes, segons la nota d’OpenAI sobre GPT-5.6. La combinació —veu natural en temps real més un model de raonament més potent al darrere— és la que de veritat importa per a l’ús empresarial: no només sona millor, també pot fer més coses dins la mateixa trucada.

Per què li importa al teu negoci, no només als desenvolupadors

Si la teva empresa rep trucades fora d’horari, perd reserves per no contestar a temps o dedica hores de recepció a preguntes repetitives, això t’afecta directament. Un hotel o restaurant que no pot atendre el telèfon a les onze de la nit perd aquella reserva. Una clínica que satura la centraleta amb confirmacions de cita hi dedica el temps d’una persona. Un despatx de serveis professionals filtra trucades abans de passar cadascuna a qui correspon. En tots els casos, la millora no és “que la IA parli més natural”: és que pot entendre la petició, comprovar disponibilitat i actuar —agendar, confirmar, transferir— sense que l’interlocutor noti que parlava amb un model minuts abans.

De la demo a la centraleta: el que el titular no explica

Aquí hi ha la part que sol passar-se per alt. GPT-Live-1 és extraordinari a ChatGPT, parlant amb una persona a través del mòbil o el navegador. Però una línia d’atenció telefònica real necessita bastant més que un model de veu potent:

  • Connexió amb la xarxa telefònica. El model no marca ni respon trucades per si sol; cal integrar-lo amb telefonia (per exemple Twilio) i un servidor de veu que gestioni la conversa en temps real.
  • Coneixement del teu negoci. Sense una base de coneixement pròpia (RAG) connectada a les teves dades reals —preus, disponibilitat, polítiques—, el model respon amb generalitats o s’ho inventa.
  • Transferència a una persona. Qualsevol agent de veu seriós necessita saber quan escalar la trucada a un humà, no només quan seguir parlant.
  • Traçabilitat. Transcripció, gravació i puntuació de cada trucada per poder mesurar conversió i qualitat, no només “que soni bé”.
  • On viuen les dades. Per a molts sectors regulats (sanitat, serveis financers) importa que la infraestructura de veu corri a Europa.

És exactament el terreny on treballem amb Elop, la nostra pròpia plataforma d’agents de veu amb IA: fa servir veu en temps real d’OpenAI combinada amb ElevenLabs i Cartesia per a una latència de síntesi d’uns 40 ms, un servidor de veu propi en Node.js sobre Twilio i una base de coneixement RAG amb les dades reals de cada negoci, tot sobre infraestructura europea. Un model de veu millor —com GPT-Live-1— puja el sostre del que és possible, però la fiabilitat d’una centraleta 24/7 continua depenent d’aquestes peces d’enginyeria al voltant del model.

Què mirar abans d’adoptar-ho

Abans de substituir la teva centraleta o el teu xatbot de reserves per un agent de veu, convé comprovar quatre coses: si respon amb les teves dades i no amb informació genèrica, què passa quan necessita transferir a una persona, si queda transcripció i puntuació de cada trucada per mesurar resultats, i on es processen les dades dels teus clients. Sectors com l’hostaleria, on perdre una reserva fora d’horari té un cost directe, són dels que abans noten el retorn d’automatitzar l’atenció telefònica amb criteri.

En resum

GPT-Live-1 i GPT-5.6 milloren de manera real la part que fins ara frenava l’adopció de veu IA a les empreses: sonar natural i raonar mentre es parla. Però portar això a una línia d’atenció al client en producció continua sent un projecte d’enginyeria, no una API que es connecta sola. A Evicron ajudem a avaluar si un projecte d’IA aplicada —agent de veu, xatbot o automatització— té sentit per al teu volum de trucades abans d’escriure ni una línia de codi.

Perds trucades o reserves fora d’horari? Explica’ns el teu cas: la primera consultoria és gratuïta i responem en menys de 24 hores.

Parlem?

Explica'ns el teu projecte, problema o oportunitat. Et responem en menys de 24 hores amb un pla d'acció concret i pressupost orientatiu.