做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

Griffin官网直达 - 能看表情、会接话的实时视频交互模型

53
推荐关注!不再等你说完才回应,Griffin尝试把观察、接话、表情和动作统一到实时视频对话中
评分
产品定位:面向实时面对面交流的人类交互模型(HIM)研究预览交互输入:连续接收视频、语音、表情、视线、停顿和环境信息输出能力:实时语音、面部表情、视线、手势、身体动作与完整画面视频规格:720p、25fps,按约320毫秒片段流式生成当前状态:Griffin-Lite仅向部分可信测试者开放研究预览开发团队:Tavus Research 与工程团队
推荐关注!Griffin把视觉感知、对话决策、语音和视频生成放进同一个全双工系统,让AI能边听边说、观察表情并…
AI视频|AI数字人·AI视频生成·多模态AI·实时交互

Griffin不是把聊天模型套上一张会动的脸,而是Tavus对实时人机交流方式的一次重新设计。它尝试把视觉感知、对话决策、语音生成和视频生成放进同一个持续运行的系统,让AI在说话时仍能看见并听见用户,随时决定继续、暂停、让出话轮或做出非语言回应。

Tavus Griffin人类交互模型官方页面截图

Griffin是什么?

Griffin是Tavus推出的首个人类交互模型(Human Interaction Model,HIM)。官方把它定义为全双工视频到视频模型:输入不只有文字和声音,还包括画面、表情、视线、停顿及周围环境;输出也不只是一段回答,而是同步生成语音、脸部表情、视线、手势、身体动作和完整视频画面。

当前公开的是Griffin-Lite研究预览。它尚未作为常规客户产品开放,只提供给少量可信测试者。普通用户目前更适合把这个页面当作研究发布、能力演示和技术说明来阅读,而不是立即可用的在线工具。

为什么值得关注?

大多数实时数字人仍是串联系统:先听写,再交给语言模型思考,然后合成语音,最后驱动画面。每一步依次传递,容易出现抢话、停顿误判、表情与语气脱节等问题。Griffin的核心变化是让感知、决策和生成同时进行,即使AI正在说话,也不会停止接收用户的声音和视频。

这使它能够处理更接近真人交流的细节,例如用户还没说完时先点头示意,遇到打断立即停下,看到用户举起物品后调整解释,或根据沉默时长判断对方是在思考还是等待回应。真正的价值并不只是“更像真人”,而是减少用户为了配合机器而刻意调整说话方式的负担。

核心能力

  • 全双工对话:边说边听,持续判断是否该回应、停顿、让出话轮或插入简短反馈。
  • 多模态感知:同时理解语音、画面、表情、视线、动作和环境信息。
  • 行为与情绪表达:根据语境改变音色、情绪、表情、目光和手势。
  • 完整场景生成:从参考图像出发生成整帧视频,而非只替换嘴型或面部。
  • 时间理解:把沉默持续时间和任务进度纳入判断,适合需要等待和观察的互动。

技术路径

Griffin由两个部分协同工作。持续对话建模引擎负责接收音视频,判断何时回应以及应该如何表达,并不断输出语气、表情和动作控制信号;音视频生成引擎再把这些控制信号转换成连续声音与画面。官方称系统会以小于一秒的间隔重新评估交流状态。

语音部分使用流式生成,并能从约10秒参考音频克隆声音。视频部分采用少步自回归扩散架构,以一个潜变量对应约320毫秒画面,在25fps下实时输出720p视频。Tavus还通过蒸馏、教师强制和自强制训练来减少生成步骤,并改善长时间生成时的稳定性。

测试结果应该怎样看?

官方公布的面对面实验中,54名参与者与Griffin-Lite进行一分钟视频通话,26人认为对方是真人,占48%。这个结果说明实时合成人物已能在特定短时场景中产生较强可信感,但不能简单外推为任何场景都能骗过人类。

样本量、通话时长、招募方式和事先给参与者的情境都会影响结果。Tavus把它称为首次通过实时视频图灵测试,这是厂商对本次实验的定义。更稳妥的结论是:Griffin在受控的一分钟对话中显著提高了真人感,后续仍需要独立复现和更长时间测试。

适合哪些场景?

如果未来正式开放,Griffin最可能首先进入在线辅导、客户支持、培训、销售演练和远程服务。AI老师可以通过学生的表情判断是否需要换一种解释;客服可以看到用户举到镜头前的设备并进行指导;训练系统则能根据受训者的语气和动作即时调整反馈。

它也不适合被当成普通的视频生成器。Griffin的重点是持续互动,而不是输入提示词后生成一段成片。需要批量制作广告、短片或镜头素材的用户,应选择专门的文生视频工具;需要实时面对面AI时,才是Griffin所代表的方向。

安全与使用边界

越自然的数字人越容易造成身份混淆。Tavus已经明确承认这项能力可能使人误以为正在与真人交流,并表示正在开发AI身份披露功能、继续进行安全和对齐评估。在正式部署之前,清晰显示AI身份、限制未经授权的声音克隆、保留操作日志和设置人工接管机制都应成为基础要求。

综合评价

Griffin最有价值的地方,是把实时视频AI从“轮流回答的会说话头像”推向持续观察和共同参与的交互伙伴。它展示了全双工、多模态和流式音视频生成结合后的可能性,也把身份披露、冒用和信任问题推到了更前面。

现阶段它更像值得研究者、开发者和产品团队关注的技术预览,而不是普通用户可以马上购买的成熟服务。对它保持兴趣是合理的,但在更大规模开放、独立验证和安全机制落地之前,也需要保留足够审慎。

常见问题(FAQ)

Griffin现在可以直接注册使用吗?
暂时不能作为普通客户产品使用。官方说明Griffin-Lite仅向少量可信测试者开放研究预览,更广泛发布要等安全披露和对齐方案完善后再决定。
它和常见AI数字人有什么区别?
常见系统通常依次完成语音识别、语言模型、语音合成和形象驱动;Griffin采用全双工视频到视频架构,在输出时仍持续看和听,并以亚秒级间隔重新判断何时说话、停顿或做出表情动作。
48%的人把它当成真人,是否等于已经完全通过图灵测试?
这是Tavus对一次特定实验的表述。实验只有54名参与者,通话持续一分钟,并有预设情境,因此更适合看作阶段性结果,仍需更大样本、更长对话和独立复现。
Griffin生成的是头像还是完整视频画面?
官方称它会从一张参考图像出发实时生成整帧内容,不只处理脸部和嘴型,也包括手臂、手指、椅子移动、阴影与背景变化。
这种模型适合哪些应用?
潜在场景包括在线辅导、客服、培训、销售演练和远程协作。由于它可能让用户误以为对方是真人,实际部署必须明确披露AI身份并限制声音克隆和身份冒用风险。
0 / 600
细中粗
0 讨论
热门最新
总结
暂无总结

相关网站

热门最新
暂无链接数据;请在后台添加链接或调整分类筛选。
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1