返回首页
[ 头条新闻 ] 2026-10-04 14:48

Tavus发布全球首个“人类交互模型”Griffin:AI视频通话,真假越来越难辨

Tavus发布全球首个“人类交互模型”Griffin:AI视频通话,真假越来越难辨

10月1日,美国AI视频公司Tavus发布了号称全球首个“人类交互模型”的Griffin。它主打全双工、视频到视频的实时交互,在测试中,约48%的人分不清对面是AI还是真人,而上一代系统只有2.4%。这背后,是一套完全不同的技术思路。

Griffin的“真”,到底体现在哪?

传统AI数字人聊天,基本是“语音识别—大模型—语音合成—形象驱动”的流水线。你说一句,它识别、思考、合成、动嘴,每一步都有延迟,所以对话总慢半拍。

Griffin则另辟蹊径。它把整个对话当成一个连续建模的过程,每隔不到一秒就重新评估一次状态,把你说的内容、表情、手势全都综合起来,判断自己该接话,还是该安静看着你。这就不只是“会聊天”,而是“会对话”。

效果确实惊艳,但先别急着高兴

Tavus公布了一组测试数据:在1分钟视频通话中,54名参与者里有26人认为自己是在和真人对话,比例约48%;上一代系统在41人中只骗过了1人,比例为2.4%。单看数字,Griffin的“真人感”确实提升了一大截。

不过,这组测试有几个明显的坑:

  • 参与者事先被告知“会跟另一位参与者视频通话”,心理暗示很强,他们普遍默认对面就是真人。
  • 样本量不大,54人和41人都谈不上多,且聊的话题也比较简单。
  • 结果没有第三方独立验证,也没有标准的测试协议背书。

所以,48%这个数字可以拿来讨论,但别当成铁证。

技术底子:快,才是真本事

Griffin能跟住对话节奏,靠的是自研的Tavec音频编解码器,以及自回归扩散模型生成语音,再用蒸馏、Self-Forcing等方法把视频生成压到实时。官方称,它每320毫秒生成一段720p画面,从听到声音到做出面部反应,平均延迟只有0.43秒。这种速度在视频交互里非常关键——人脑对延迟极其敏感,慢半拍就露馅。

在NVIDIA的全双工音视频对话基准VideoFDB上,Griffin-Lite的“生成”赛道得分3.83,接近人类参考值3.92;“感知”赛道得分3.73,排第一。能在两个维度同时拿高分,说明它不只是表情做得像,对对话节奏的理解也在线。

企业上云能从中看到什么?

这类实时AI交互模型,对算力的消耗相当惊人。每一帧表情、每一次语音合成,都要在极短时间内完成,没有稳定的云端GPU和低延迟网络根本撑不住。企业自己搭一套,成本高,运维也麻烦。最现实的办法,还是走公有云路线——找阿里云代理商把云服务器ECS的配置和预算算清楚,再结合阿里云优惠、阿里云代金券这些政策,尽量把上云成本压下来。

比如像易枫顺 - 阿里云官方旗舰级代理商这类服务商,能帮企业做云资源选型、成本评估和架构部署。想在AI视频赛道“卷”出成绩的团队,可以少踩不少坑。

现在想用Griffin?还得再等等

Griffin-Lite目前没有向普通客户开放,只给了少数受信任的测试者。Tavus既没有公布具体的商用时间表,也没有说明价格。所以如果你是开发者,想立刻把Griffin接到自己的产品里,暂时还不行。可以先记下这项技术趋势,等开放测试后再上手。

FAQ

问:Griffin模型现在能直接用吗?

答:Griffin-Lite目前只对少数受信任的测试者开放,普通用户和开发者暂时用不上。Tavus也没给出正式的商用时间,想体验还得等。

问:48%的真人判断率可信吗?

答:这个数字来自Tavus自己的测试,局限性很明显:参与者有心理暗示、样本量小、话题简单,也未经独立验证。可以把它看作参考,别当成普遍结论。

问:这类AI视频交互技术对企业有什么价值?

答:它可以用于客服、虚拟助手、数字人直播等场景,但落地需要很强的算力和网络支撑。企业上云后用云服务器ECS部署,再通过阿里云代理商拿优惠和代金券,能降低前期成本。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:极客公园

微信扫码咨询

微信二维码