Griffin不是把聊天模型套上一张会动的脸,而是Tavus对实时人机交流方式的一次重新设计。它尝试把视觉感知、对话决策、语音生成和视频生成放进同一个持续运行的系统,让AI在说话时仍能看见并听见用户,随时决定继续、暂停、让出话轮或做出非语言回应。

Griffin是什么?
Griffin是Tavus推出的首个人类交互模型(Human Interaction Model,HIM)。官方把它定义为全双工视频到视频模型:输入不只有文字和声音,还包括画面、表情、视线、停顿及周围环境;输出也不只是一段回答,而是同步生成语音、脸部表情、视线、手势、身体动作和完整视频画面。
当前公开的是Griffin-Lite研究预览。它尚未作为常规客户产品开放,只提供给少量可信测试者。普通用户目前更适合把这个页面当作研究发布、能力演示和技术说明来阅读,而不是立即可用的在线工具。
为什么值得关注?
大多数实时数字人仍是串联系统:先听写,再交给语言模型思考,然后合成语音,最后驱动画面。每一步依次传递,容易出现抢话、停顿误判、表情与语气脱节等问题。Griffin的核心变化是让感知、决策和生成同时进行,即使AI正在说话,也不会停止接收用户的声音和视频。
这使它能够处理更接近真人交流的细节,例如用户还没说完时先点头示意,遇到打断立即停下,看到用户举起物品后调整解释,或根据沉默时长判断对方是在思考还是等待回应。真正的价值并不只是“更像真人”,而是减少用户为了配合机器而刻意调整说话方式的负担。
核心能力
- 全双工对话:边说边听,持续判断是否该回应、停顿、让出话轮或插入简短反馈。
- 多模态感知:同时理解语音、画面、表情、视线、动作和环境信息。
- 行为与情绪表达:根据语境改变音色、情绪、表情、目光和手势。
- 完整场景生成:从参考图像出发生成整帧视频,而非只替换嘴型或面部。
- 时间理解:把沉默持续时间和任务进度纳入判断,适合需要等待和观察的互动。
技术路径
Griffin由两个部分协同工作。持续对话建模引擎负责接收音视频,判断何时回应以及应该如何表达,并不断输出语气、表情和动作控制信号;音视频生成引擎再把这些控制信号转换成连续声音与画面。官方称系统会以小于一秒的间隔重新评估交流状态。
语音部分使用流式生成,并能从约10秒参考音频克隆声音。视频部分采用少步自回归扩散架构,以一个潜变量对应约320毫秒画面,在25fps下实时输出720p视频。Tavus还通过蒸馏、教师强制和自强制训练来减少生成步骤,并改善长时间生成时的稳定性。
测试结果应该怎样看?
官方公布的面对面实验中,54名参与者与Griffin-Lite进行一分钟视频通话,26人认为对方是真人,占48%。这个结果说明实时合成人物已能在特定短时场景中产生较强可信感,但不能简单外推为任何场景都能骗过人类。
样本量、通话时长、招募方式和事先给参与者的情境都会影响结果。Tavus把它称为首次通过实时视频图灵测试,这是厂商对本次实验的定义。更稳妥的结论是:Griffin在受控的一分钟对话中显著提高了真人感,后续仍需要独立复现和更长时间测试。
适合哪些场景?
如果未来正式开放,Griffin最可能首先进入在线辅导、客户支持、培训、销售演练和远程服务。AI老师可以通过学生的表情判断是否需要换一种解释;客服可以看到用户举到镜头前的设备并进行指导;训练系统则能根据受训者的语气和动作即时调整反馈。
它也不适合被当成普通的视频生成器。Griffin的重点是持续互动,而不是输入提示词后生成一段成片。需要批量制作广告、短片或镜头素材的用户,应选择专门的文生视频工具;需要实时面对面AI时,才是Griffin所代表的方向。
安全与使用边界
越自然的数字人越容易造成身份混淆。Tavus已经明确承认这项能力可能使人误以为正在与真人交流,并表示正在开发AI身份披露功能、继续进行安全和对齐评估。在正式部署之前,清晰显示AI身份、限制未经授权的声音克隆、保留操作日志和设置人工接管机制都应成为基础要求。
综合评价
Griffin最有价值的地方,是把实时视频AI从“轮流回答的会说话头像”推向持续观察和共同参与的交互伙伴。它展示了全双工、多模态和流式音视频生成结合后的可能性,也把身份披露、冒用和信任问题推到了更前面。
现阶段它更像值得研究者、开发者和产品团队关注的技术预览,而不是普通用户可以马上购买的成熟服务。对它保持兴趣是合理的,但在更大规模开放、独立验证和安全机制落地之前,也需要保留足够审慎。

