En el umbral entre la innovación y la responsabilidad, OpenAI ha presentado Voice Engine, una herramienta capaz de reproducir la voz humana a partir de apenas quince segundos de grabación. La empresa, consciente del peso de lo que ha creado, opta por la cautela en lugar del despliegue masivo, reconociendo que la misma tecnología que puede acercar idiomas y abrir puertas a la accesibilidad también puede convertirse en un instrumento de engaño y suplantación. Es un momento que obliga a la sociedad a preguntarse qué significa la autenticidad cuando la voz —ese rasgo íntimo y distintivo de cada pe
OpenAI lanza Voice Engine, herramienta que clona voces humanas con solo 15 segundos
Con solo 15 segundos, cualquiera podría clonar tu voz
¿Por qué OpenAI decidió no lanzar esto como hizo con ChatGPT, simplemente abierto al mundo?
Porque reconocen que 15 segundos de audio es todo lo que necesita alguien para robar tu voz. No es una limitación técnica, es una decisión deliberada sobre el riesgo.
Pero espera, ¿cuántas personas tienen acceso a esta prueba a pequeña escala? El comunicado no lo dice. ¿Cien usuarios? ¿Mil? Sin ese número, no sabemos realmente cuán limitado es el lanzamiento.
¿Y si alguien dentro de esa prueba decide clonar la voz de un político?
Ese es exactamente el escenario que OpenAI está tratando de evitar. Por eso están siendo cautelosos. Quieren tiempo para pensar en cómo proteger a las personas públicas antes de que esto sea ampliamente disponible.
Pero ¿qué tan efectiva puede ser una prueba a pequeña escala para identificar todos los riesgos? Los problemas reales probablemente solo aparezcan cuando millones de personas tengan acceso.
¿Qué propuestas específicas tiene OpenAI para mantener esto seguro?
Quieren eliminar la autenticación por voz en banca, desarrollar formas de rastrear dónde viene el contenido de audio, y educar al público sobre lo que la IA puede hacer.
Eso es ambicioso, pero la autenticación por voz es una decisión que no le pertenece a OpenAI. Los bancos tendrían que cambiar sus sistemas. ¿Quién obliga a que eso suceda?
Entonces esto es más una conversación que comienza que una solución que termina.
Exactamente. OpenAI está siendo honesta sobre eso. Dice que quiere dialogar antes de desplegar ampliamente. Es un enfoque diferente al de ChatGPT.
Y eso es prudente, pero también significa que mientras tanto, la tecnología existe y está siendo probada. El riesgo no desaparece solo porque sea limitado.
O Pulso
- Con solo quince segundos de audio, Voice Engine puede clonar cualquier voz y hacerla hablar en otro idioma conservando el acento original, una capacidad técnica sin precedentes que redefine los límites de la identidad sonora.
- El riesgo es inmediato: cualquier persona con una grabación breve podría suplantar la voz de otra, amenazando la seguridad bancaria, la integridad de figuras públicas y la confianza en los contenidos de audio.
- OpenAI frena el impulso de lanzar la herramienta al mundo abierto y elige una prueba restringida, buscando primero el diálogo con legisladores, investigadores y creativos antes de tomar decisiones irreversibles.
- La empresa propone medidas concretas: retirar la autenticación por voz en banca, crear políticas de protección de identidad vocal, rastrear el origen de contenidos audiovisuales y educar al público sobre la IA generativa.
- Voice Engine llega semanas después de Sora, el generador de video de OpenAI, consolidando un patrón de innovaciones que transforman la percepción de lo real y plantean preguntas urgentes sobre la autenticidad en el mundo digital.
En el umbral entre la innovación y la responsabilidad, OpenAI ha presentado Voice Engine, una herramienta capaz de reproducir la voz humana a partir de apenas quince segundos de grabación. La empresa, consciente del peso de lo que ha creado, opta por la cautela en lugar del despliegue masivo, reconociendo que la misma tecnología que puede acercar idiomas y abrir puertas a la accesibilidad también puede convertirse en un instrumento de engaño y suplantación. Es un momento que obliga a la sociedad a preguntarse qué significa la autenticidad cuando la voz —ese rasgo íntimo y distintivo de cada persona— puede ser replicada con una precisión casi perfecta.
OpenAI ha presentado Voice Engine, una herramienta de inteligencia artificial que puede recrear la voz de una persona con una muestra de apenas quince segundos. El sistema genera habla natural que replica el timbre y tono del hablante original, y puede leer cualquier texto en distintos idiomas conservando incluso el acento nativo. Las posibilidades para la accesibilidad, la traducción y la localización de contenidos son genuinas y significativas.
Sin embargo, la empresa dirigida por Sam Altman ha decidido no repetir el lanzamiento masivo que caracterizó a ChatGPT. La razón es directa: con tan poco audio, cualquiera podría clonar la voz de otra persona. El riesgo de fraude, suplantación de identidad y desinformación —especialmente cuando se trata de figuras públicas o políticos— es demasiado grave para ignorarlo. OpenAI reconoce abiertamente esta tensión y apuesta por una prueba a pequeña escala mientras busca iniciar un diálogo informado sobre cómo desplegar la tecnología de forma responsable.
Antes de un lanzamiento amplio, la compañía considera necesarios varios cambios estructurales: eliminar progresivamente la autenticación por voz en servicios bancarios, desarrollar políticas que protejan el uso de voces individuales en sistemas de IA, y acelerar las técnicas para rastrear el origen de contenidos audiovisuales. También aboga por educar al público sobre las capacidades reales de estas herramientas.
Voice Engine se suma a Sora, el generador de video presentado el mes anterior, y juntos dibujan un patrón claro: OpenAI está expandiendo sus capacidades más allá del texto hacia territorios donde la frontera entre lo real y lo sintético se vuelve cada vez más difusa. Lo que ocurra a continuación dependerá de las conversaciones que la empresa dice querer tener con legisladores, investigadores y creadores. La tecnología ya existe; la pregunta que queda abierta es cómo la sociedad elegirá usarla.
OpenAI acaba de presentar Voice Engine, una herramienta de inteligencia artificial capaz de recrear la voz humana con una precisión inquietante. Todo lo que necesita es una grabación de 15 segundos. Con esa muestra, el sistema puede generar habla natural que reproduce fielmente el timbre, tono y características del hablante original, leyendo cualquier texto que se le proporcione.
La capacidad técnica es notable. Un usuario puede entregar una muestra de audio en español y luego pedirle al programa que lea un párrafo en inglés, mandarín o cualquier otro idioma, manteniendo la identidad vocal del original. Cuando se utiliza para traducción, Voice Engine conserva incluso el acento nativo del hablante: si alguien de habla francesa proporciona la muestra, el inglés generado tendría acento francés. La herramienta abre posibilidades genuinas para accesibilidad, localización de contenidos y traducción de audio.
Pero OpenAI no está lanzando esto al mundo sin restricciones. La empresa, dirigida por Sam Altman, ha decidido un enfoque cauteloso: una prueba a pequeña escala en lugar del acceso generalizado que caracterizó el lanzamiento de ChatGPT. La razón es clara y preocupante. Con solo 15 segundos de grabación de alguien, cualquiera podría clonar su voz. El riesgo de suplantación de identidad es inmediato y grave.
OpenAI reconoce explícitamente que está siendo prudente debido al potencial de uso indebido de voces sintéticas. La empresa dice que quiere iniciar un diálogo sobre cómo desplegar responsablemente esta tecnología y cómo la sociedad puede adaptarse a estas nuevas capacidades. Basándose en las conversaciones que surjan de estas pruebas limitadas, tomará una decisión más informada sobre si generalizar el acceso y de qué manera.
La compañía ha identificado varios cambios que considera necesarios antes de un lanzamiento amplio. Propone eliminar progresivamente la autenticación por voz como medida de seguridad para acceder a cuentas bancarias e información sensible, puesto que dejaría de ser confiable. También plantea la necesidad de desarrollar políticas que protejan el uso de las voces individuales en sistemas de inteligencia artificial. El riesgo de manipulación y desinformación es especialmente marcado cuando se trata de figuras públicas y políticos.
OpenAI también aboga por educar al público sobre las capacidades y limitaciones de estas tecnologías, incluyendo la posibilidad de contenidos de IA engañosos. Otra propuesta importante es acelerar el desarrollo de técnicas para rastrear el origen de los contenidos audiovisuales, de modo que siempre quede claro cuándo se está interactuando con una persona real o con un sistema de IA.
Esta herramienta se suma a un portafolio de innovaciones que OpenAI ha estado desarrollando más allá del lenguaje. El mes pasado presentó Sora, una herramienta de generación de video que necesita solo un texto para crear videos cortos con el contenido y estilo solicitados. Voice Engine representa el mismo tipo de salto en capacidad técnica, pero en el dominio del audio, con implicaciones igualmente profundas para cómo experimentamos la autenticidad en línea.
Lo que suceda ahora dependerá de esas conversaciones que OpenAI dice querer tener con responsables políticos, investigadores, desarrolladores y creativos. La tecnología existe. La pregunta es cómo la sociedad decidirá usarla.
Citações Notáveis
Es notable que un pequeño modelo con una sola muestra de 15 segundos pueda crear voces emotivas y realistas— OpenAI
Estamos adoptando un enfoque cauteloso e informado ante un lanzamiento más amplio debido al potencial de uso indebido de las voces sintéticas— OpenAI