> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Tavus Griffin: el 48% creyó hablar con una persona real
- URL: https://www.digitalbrain.news/noticias/tavus-griffin-48-por-ciento-creyo-persona-real/
- Published: 2026-10-02T14:46:37.000Z
- Updated: 2026-10-02T14:48:03.000Z
- Description: Tavus, la startup de San Francisco que hace avatares de vídeo con IA, ha presentado Griffin, un modelo que mantiene una videollamada en directo con cara…
- Author: Ramón Pérez Coronado
- Tags: #noticias, avatares, video-ia, nvidia, seguridad-ia

Tavus, la startup de San Francisco que hace avatares de vídeo con IA, ha presentado [Griffin](https://www.tavus.io/griffin?ref=digitalbrain.news), un modelo que mantiene una videollamada en directo con cara, voz y gestos generados al momento. En un estudio de la propia empresa, 26 de las 54 personas que hablaron con él durante un minuto salieron convencidas de que al otro lado había un humano. Eso es el 48%.

Con el sistema anterior de Tavus, con el mismo protocolo, se lo creyó 1 de 41\. El 2,4%.

## Puntos clave

- **Qué es:** Griffin es lo que Tavus llama un Human Interaction Model, un modelo que recibe vídeo y audio de la persona y devuelve vídeo y audio propios, sin turnos.
- **El dato:** 48% de participantes engañados en una llamada de un minuto, frente al 2,4% del sistema anterior (Phoenix-4.5 con Sparrow-2 y Raven-1).
- **Prueba externa:** en VideoFDB, el banco de pruebas de conversación por vídeo de NVIDIA, saca 3,83 sobre 5 en generación. La referencia humana está en 3,92 y el siguiente sistema, [Gemini](https://www.digitalbrain.news/guias/que-es-gemini/) 2.5 con Anam, en 2,80.
- **Disponibilidad:** de momento solo Griffin-Lite, una versión de investigación para probadores seleccionados. No hay fecha para clientes.

## Qué hace distinto

Casi toda la IA de voz o vídeo en tiempo real funciona en cadena. Un sistema pasa tu voz a texto, un modelo de lenguaje contesta a ese texto, y otros dos convierten la respuesta en voz y en cara. Cada salto añade retraso y tira información por el camino: el tono con el que lo dijiste, la cara que pusiste, lo que se ve en tu cámara.

Por eso las videollamadas con avatares se notan tanto. Esperan a que acabes, piensan, y contestan. Si haces una pausa para pensar, se lanzan a responder a media frase. Si cuentas algo serio, la cara sigue sonriendo.

Griffin junta todo en un solo sistema que funciona en dúplex completo, es decir, escucha y mira mientras habla. Cada fracción de segundo decide si sigue callado, si asiente, si suelta un "ajá" o si toma la palabra. Puede interrumpir y dejarse interrumpir sin perder el hilo.

En los vídeos de demostración que ha publicado Tavus se ve a Griffin guiando a alguien con un cubo de Rubik mientras lo mira girar, esperando cuando la persona se para a pensar. En otro acompaña a un técnico que suelda una placa base y habla cuando toca el siguiente paso, no cada vez que el técnico se queda en silencio. Y en un juego de "Simón dice" copia el gesto solo cuando la persona dice la fórmula.

## Cómo está construido

Son dos piezas que corren a la vez.

La primera es un motor de conversación continua. Recibe el audio y el vídeo de la persona y, a intervalos de menos de un segundo, decide qué decir y cómo: tono, postura, expresión, gesto. Eso lo manda como señales de control a la segunda pieza.

La segunda genera la voz y la imagen. La voz sale de un [transformer](https://www.digitalbrain.news/glosario/#transformer) de difusión que produce paquetes de audio de apenas 10 milisegundos, así que empieza a hablar antes de tener la frase entera. Con unos 10 segundos de grabación clona una voz.

La imagen sale de un generador que produce vídeo 720p en bloques de 320 milisegundos a partir de una sola foto de referencia. Genera el plano entero: la cara, las manos, la silla que se mueve, la sombra y el fondo. Para llegar ahí, Tavus destiló un modelo de difusión grande y lento en otro de pocos pasos que genera fotograma a fotograma, en tres fases.

En latencia, Tavus dice que Griffin-Lite tarda de media 0,43 segundos en H100 desde que llega el audio hasta que la cara reacciona. Según la empresa, la mitad que el siguiente método publicado.

## Los números, con su asterisco

El 48% es el dato que ha corrido por todas las newsletters, y conviene leerlo con cuidado.

El estudio lo ha hecho Tavus. Los participantes salieron de una plataforma independiente de reclutamiento y se les dijo que iban a hablar un minuto con otro participante sobre lo que esperaban de este año. Al otro lado había un avatar de Griffin-Lite. Solo al final de la encuesta se les preguntó si en algún momento habían sospechado que no era una persona, y después se les contó la verdad.

Son 54 personas. Una llamada de un minuto. Con un tema de conversación ligero. Y sin avisar de que podía ser una IA, que es justo como llegaría una llamada real.

Algunos detalles del estudio son más interesantes que el titular. Más de la mitad dijo que la posibilidad ni se le pasó por la cabeza, y casi todos esos acabaron diciendo que era real. Los que sospecharon lo hicieron en los primeros 20 segundos. Y en una escala de 7, la naturalidad sacó un 5,4, la sensación de que el otro escuchaba un 5,5 y la fluidez de la conversación un 4,9, la nota más baja.

El dato de VideoFDB sí es externo: NVIDIA corre la evaluación con sus propias métricas y su propio juez automático. En la parte de percepción, que mide si el modelo usa lo que ve además de lo que oye, Griffin saca 3,73 frente a 4,20 de la referencia humana, el mejor de los 15 modelos evaluados.

## La parte incómoda

Tavus lo dice en su propio anuncio: lo que hace útil a Griffin es lo mismo que permite engañar a alguien para que crea que habla con una persona. Por eso no lo abre a clientes. Dice que está trabajando en funciones de aviso y con organizaciones de seguridad de IA antes de soltarlo.

La reacción en X fue de ese estilo. Una de las respuestas más votadas al anuncio pedía que esto fuera ilegal, y Emad Mostaque, fundador de Stability AI, resumió que el trabajo en remoto "está acabado".

Yo no iría tan lejos, pero el problema práctico es inmediato. Las estafas por videollamada con caras falsas ya existen y casi siempre fallan por el mismo sitio: el retraso, la mirada fija, la falta de reacción cuando le interrumpes. Griffin ataca justo esas señales.

## Por qué importa

Para una empresa española, esto toca dos frentes.

El primero es el uso legítimo. Tavus ya vende avatares para ventas, selección, formación y atención médica, y dice que tiene 150.000 desarrolladores y empresas en su plataforma. Un tutor que nota cuándo no entiendes, un simulador para ensayar una conversación difícil con un empleado, un soporte técnico en el que enseñas la pieza rota a la cámara. Cuando Griffin salga, esas herramientas van a dar un salto de calidad.

El segundo es la seguridad. Si tu proceso de aprobar un pago o de verificar a un candidato se apoya en "le vi en una videollamada", ese control tiene fecha de caducidad. Una palabra clave acordada, una llamada de vuelta a un número conocido o una segunda aprobación por otro canal son medidas baratas que conviene tener montadas antes de que estos modelos estén al alcance de cualquiera.

Fuente original: [tavus.io](https://www.tavus.io/griffin?ref=digitalbrain.news)

---

**Relacionado**

[![El cofundador de HeyGen se fue de baja, dejó un clon de IA vendiendo y cerró 132 clientes](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/heygen-clon-ia-ventas-132-clientes-baja-paternidad.jpg)El cofundador de HeyGen se fue de baja, dejó un clon de IA vendiendo y cerró 132 clientes](https://www.digitalbrain.news/noticias/heygen-clon-ia-ventas-132-clientes-baja-paternidad/)[![Perplexity Computer ya hace vídeo con Seedance 2.5 y MiniMax H3](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/perplexity-computer-video-seedance-minimax.jpg)Perplexity Computer ya hace vídeo con Seedance 2.5 y MiniMax H3](https://www.digitalbrain.news/noticias/perplexity-computer-video-seedance-minimax/)[![Nvidia vigila a los agentes de IA desde el chip](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/nvidia-open-agent-safety-platform-bluefield-agentes.webp)Nvidia vigila a los agentes de IA desde el chip](https://www.digitalbrain.news/noticias/nvidia-open-agent-safety-platform-bluefield-agentes/)