Anúnciate en Cañasanta
Cañasanta Radio - Muy pronto

LA IA YA TIENE ROSTRO

Google acaba de dar un paso inquietante y fascinante en la evolución de la inteligencia artificial. Gemini ya no solo puede escucharte, verte y responderte: ahora puede aparecer frente a ti con un rostro animado, hablar en tiempo real, mover los labios de forma sincronizada y reaccionar durante una conversación. La frontera entre hablar con un programa y mantener una videollamada con alguien acaba de hacerse mucho más estrecha.

Google presentó este 24 de septiembre Gemini 3.8 Live with Live Avatar, una nueva capacidad que combina su inteligencia artificial conversacional con generación de vídeo de baja latencia. El resultado es un interlocutor digital que escucha, observa y responde mediante una figura visual capaz de hablar y expresarse mientras mantiene una conversación.

No se trata simplemente de colocar una cara animada sobre una voz artificial. Gemini procesa simultáneamente información visual y sonora. Puede recibir imágenes de una cámara o una pantalla, escuchar al usuario y utilizar ese contexto para responder. Mientras habla, el avatar genera movimientos de labios sincronizados con la voz, expresiones faciales y una presencia visual continua.

Google lo está llevando inicialmente al terreno empresarial. La compañía imagina estos agentes trabajando como asistentes, representantes de atención al cliente, guías virtuales, tutores o recepcionistas digitales. Una persona podría, por ejemplo, encontrarse frente a una pantalla en un hotel y conversar con un agente artificial que la ve, escucha sus preguntas y la acompaña durante todo el proceso de registro.

La diferencia con muchos de los avatares digitales conocidos hasta ahora es que aquí la conversación y la representación visual forman parte del mismo sistema en tiempo real. La documentación técnica de Google especifica que Gemini 3.8 Live puede producir vídeo sincronizado del avatar a 24 fotogramas por segundo, además de procesar voz, texto, imágenes procedentes de cámaras y transmisiones de pantalla.

También puede continuar hablando mientras realiza operaciones en segundo plano. Un agente podría consultar una base de datos, utilizar una API, acceder a un sistema empresarial o ejecutar determinadas herramientas sin dejar al usuario esperando en silencio.

Otro elemento importante es el idioma. Gemini 3.8 Live puede detectar y cambiar dinámicamente entre 97 idiomas durante una misma conversación. Si el usuario cambia de lengua, el sistema puede adaptarse sin necesidad de activar manualmente otro modo, manteniendo la voz y la sincronización visual del avatar.

Y hay algo todavía más llamativo: las empresas autorizadas pueden crear avatares personalizados a partir de una imagen de referencia. Es decir, no están obligadas a utilizar únicamente personajes prediseñados por Google. Esta posibilidad se encuentra restringida por ahora a clientes seleccionados y requiere autorización específica.

La tecnología introduce inevitablemente preguntas sobre identidad digital, suplantación y la dificultad creciente para distinguir una presencia humana de una generada artificialmente. Google ha incorporado algunas barreras precisamente por ese motivo. Los avatares personalizados están sometidos a controles adicionales y tanto el audio como el vídeo generados incorporan SynthID, el sistema de marcas digitales imperceptibles desarrollado por Google para identificar contenido producido mediante inteligencia artificial.

Por ahora no significa que cualquier usuario de Gemini pueda abrir mañana su teléfono y conversar cara a cara con su propio avatar artificial. Live Avatar está disponible inicialmente en Gemini Enterprise, con infraestructura destinada a organizaciones y desarrolladores.

Pero la dirección tecnológica resulta difícil de ignorar. Durante años interactuamos con las computadoras escribiendo órdenes. Después llegaron los asistentes de voz. Más tarde aparecieron inteligencias artificiales capaces de conversar, razonar sobre imágenes y observar lo que ocurre mediante una cámara.

Ahora comienzan a mirarnos desde el otro lado de la pantalla. La inteligencia artificial acaba de recibir algo que hasta hace muy poco pertenecía casi exclusivamente a la ciencia ficción: un rostro con el que conversar.

COMPARTIR
Fuentes / Referencias
Cañasanta

CAÑASANTA es un medio en español dedicado a explorar la actualidad, la cultura, la ciencia y las ideas que transforman nuestra sociedad. Nuestra redacción reúne noticias, análisis y perspectivas con una mirada crítica, plural y cercana a la comunidad. Apostamos por un periodismo claro, por el contraste de fuentes y por el contexto necesario para comprender los acontecimientos, promover la conversación y acompañar a nuestros lectores en un mundo cambiante.

Deja un comentario