Griffin-Lite conversa, observa y reacciona en tiempo real. En una prueba, 26 de 54 participantes creyeron hablar con una persona.
Una IA en videollamadas acaba de cruzar una frontera que hasta hace poco parecía fácil de reconocer. Griffin-Lite, un modelo desarrollado por Tavus, sostuvo conversaciones en vivo de un minuto con 54 personas sin que éstas supieran que su interlocutora era artificial. Al terminar, 26 dijeron creer que habían hablado con un ser humano.
El 48% resulta llamativo, pero necesita contexto. La prueba fue organizada por la propia empresa, utilizó una muestra pequeña y midió interacciones de apenas 60 segundos. No demuestra que la inteligencia artificial ya pueda hacerse pasar por una persona en cualquier conversación ni constituye una prueba de Turing estandarizada e independiente, aunque Tavus utiliza ese término para describir el resultado.
IA en videollamadas ya reacciona
La diferencia respecto de muchos avatares actuales está en lo que ocurre mientras habla la persona. Griffin funciona en modalidad full-duplex: escucha y observa al mismo tiempo que genera voz y video. Puede asentir mientras su interlocutor sigue hablando, detenerse si lo interrumpen, cambiar una expresión facial, reaccionar ante algo que aparece frente a la cámara o interpretar una pausa antes de decidir si toma la palabra.
En lugar de esperar a que una persona termine una frase, el sistema reevalúa la conversación en intervalos inferiores a un segundo. Además, genera en tiempo real el rostro, la mirada, los gestos, la voz y el entorno visual a partir de una imagen de referencia. Tavus asegura que Griffin-Lite produce video de 720p en fragmentos de 320 milisegundos.
La diferencia también apareció cuando la empresa comparó el modelo con su tecnología anterior. En una prueba semejante, sólo una de 41 personas, el 2.4%, había confundido aquel sistema con un interlocutor humano. Con Griffin-Lite fueron 26 de 54.
Cerca del desempeño humano
Una evaluación separada aporta un dato más sólido. VideoFDB, un benchmark desarrollado por NVIDIA para medir conversaciones audiovisuales bidireccionales, colocó a Griffin-Lite por encima de los demás sistemas evaluados en generación y percepción.
En generación —que mide la naturalidad de la voz, el rostro, la fluidez y las reacciones no verbales— obtuvo 3.83 puntos sobre 5, frente a 3.92 de las grabaciones humanas utilizadas como referencia. El siguiente sistema obtuvo 2.80.
La evaluación de percepción arrojó una distancia mayor frente a las personas. Griffin-Lite logró 3.73 puntos, mientras la referencia humana alcanzó 4.20. En esta prueba se mide si el modelo entiende no sólo lo que escucha, sino lo que ocurre visualmente durante la conversación.
Estas cifras no significan que la inteligencia artificial sea prácticamente indistinguible de una persona en todos los escenarios. El benchmark mide capacidades concretas y la prueba con usuarios duró un minuto. Sí muestran que varias señales que hasta ahora delataban fácilmente a un avatar —retardos, gestos desfasados, interrupciones torpes o expresiones que no corresponden a la conversación— están desapareciendo.
El problema no comienza con Griffin
Los fraudes mediante video generado con inteligencia artificial ya existen. En 2024, autoridades de Hong Kong documentaron un caso en el que un empleado participó en una falsa videoconferencia con personas que aparentaban ser directivos de su empresa y terminó autorizando transferencias por alrededor de HK$200 millones.
Aquel fraude tenía una limitación que resulta significativa frente a los avances actuales: la videoconferencia utilizaba material previamente generado y no mantenía una conversación realmente interactiva. Un sistema capaz de escuchar, ver, contestar e interrumpir en tiempo real podría eliminar parte de esa barrera técnica.
El FBI también ha advertido que delincuentes utilizan clonación de voz y video para hacerse pasar por familiares, compañeros de trabajo, socios comerciales y otras personas de confianza. El objetivo puede ser obtener información, acceso a sistemas o autorización para efectuar operaciones financieras.
Ver a alguien ya no bastará
La consecuencia práctica es sencilla: una videollamada ya no debe considerarse por sí sola una prueba de identidad. Reconocer el rostro y escuchar la voz de un familiar, jefe, cliente o compañero puede dejar de ser suficiente para confirmar quién está del otro lado.
Ante solicitudes de dinero, transferencias, contraseñas, documentos o información sensible, la identidad tendrá que verificarse mediante un segundo canal conocido previamente. En empresas, las autorizaciones financieras requieren procedimientos independientes de la llamada, especialmente cuando aparece urgencia, confidencialidad inusual o presión para actuar sin consultar a otras personas.
La propia Tavus reconoce el riesgo. Griffin-Lite todavía no está disponible para clientes y permanece en manos de evaluadores seleccionados mientras la compañía trabaja en mecanismos de seguridad y avisos que permitan identificar que el interlocutor es una inteligencia artificial.
El avance de la IA en videollamadas abre usos legítimos para capacitación, atención a clientes, enseñanza o asistencia remota. Al mismo tiempo, obliga a abandonar una idea que hasta ahora parecía razonable: que ver y escuchar a alguien en tiempo real bastaba para saber que realmente estaba allí.
