暂无菜单项

15款音频大模型集体失忆:VoxMem实测32K历史最高仅38.5%,语气与背景声几乎记不住

发布于 更新于
12

导读:把对话窗口拉长,并不等于语音助手拥有长期记忆;VoxMem首次把“说了什么、谁说的、怎么说、周围有什么声音”放进同一套多会话测试。最扎眼的结果是:在32K历史下,15款受测模型没有一款整体准确率超过40%。

如果语音助手只记住转写文本,它可能知道“灯具更换先暂停”,却不知道这句话是谁说的、语气是否犹豫、当时背景里有没有洗衣机声。到了多用户家庭、客服、会议或长期陪伴场景,这些被转写抹掉的信息,恰好可能决定下一次回答是否正确。

VoxMem论文标题与墨尔本大学、新南威尔士大学作者团队
VoxMem论文标题与墨尔本大学、新南威尔士大学作者团队。

01 / 语音记忆不只是“说了什么”

墨尔本大学与新南威尔士大学研究团队提出VoxMem,目标是测试大型音频语言模型能否跨多次会话保留四类证据:

  • 语音语义:具体说了什么,例如计划、数量和偏好。
  • 说话人身份:哪位用户说了这句话,内容应该绑定给谁。
  • 副语言线索:怎样说的,例如犹豫、惊讶、强调、笑声或语速变化。
  • 环境声音:对话发生时听到了什么,例如交通、警报、家电或动物声。
语音转写会保留语义,却丢失说话人、语气和环境声
语音转写会保留语义,却丢失说话人、语气和环境声。

其中只有语义能够较完整地从文字转写恢复,后面三类信息主要存在于音频信号中。研究团队把用户轮次替换成精确文字后,音频原生题准确率从46.2%降到4.4%,语义题则只从75.9%降到71.0%。这说明测试确实依赖“听”,而不是换一种形式考阅读理解。

02 / 4类证据 × 4种操作,组成15个有效考点

VoxMem的第二条轴线是怎样使用记忆:

  • 信息抽取(IE):从某次历史会话中找到答案。
  • 多会话推理(MSR):组合多次会话,完成计数、比较和匹配。
  • 时序演变追踪(TET):判断计划、说话人、语气或背景声后来怎样变化。
  • 拒答(AR):证据不足或无法唯一确定时,明确表示不能判断。
VoxMem声学证据与记忆操作组成的15类有效测试组合
VoxMem声学证据与记忆操作组成的15类有效测试组合。

“语义×信息抽取”被排除,因为问题和答案如果都只依赖文字,就会退化成普通文本检索。剩下15种组合,才真正覆盖语音记忆中特有的绑定、变化和拒答难题。

信息抽取、多会话推理、时序追踪与拒答任务示例
信息抽取、多会话推理、时序追踪与拒答任务示例。

03 / 同一道题只增加历史,避免把“题更难”误判成“记忆变差”

VoxMem包含799道问题。每道题都生成8K、16K、32K和64K四种历史长度,合计3,196个评测实例、34,743段语音会话和约177小时音频。

长版本严格包含短版本的证据,只增加干扰与填充会话;问题、答案和关键证据保持不变。这样,分数下降才更可能来自历史增长,而不是不同长度使用了不同难度的试题。

VoxMem从任务设计、音频生成到多长度历史和质量控制的构建流程
VoxMem从任务设计、音频生成到多长度历史和质量控制的构建流程。

每段历史包含三类会话:真正含答案的证据会话、话题相似但取值不同的干扰会话,以及无关的日常填充会话。声学线索还会制作“文字和音色相同、只移除目标线索”的配对版本,用于确认答案确实来自语气或背景声。

04 / 15款模型:32K历史下最高只有38.5%

团队测试了15款音频大模型,其中5款为闭源模型,10款为开放权重模型。所有模型通过原生音频接口接收相同历史和指令,并使用统一规则评分。

15款音频大模型在8K、16K和32K历史下的准确率
15款音频大模型在8K、16K和32K历史下的准确率。

32K历史下,排名第一的Qwen3.8-Omni-Flash整体准确率为38.5%;闭源模型平均33.0%,开放权重模型平均21.9%。这里的结论并不是某一款模型偶尔失误,而是当前音频大模型普遍没有建立可靠的跨会话声音记忆。

32K平均准确率 闭源模型 开放权重模型
语音语义 55.6% 31.6%
说话人身份 32.7% 26.7%
副语言线索 20.0% 14.5%
环境声音 21.9% 15.5%

05 / 说出口的变化还能追,没说出口的几乎全忘

把证据类型和记忆操作交叉后,最明显的差距出现在时序追踪:计划明确说出口时,平均准确率为44.5%;说话人身份变化降到20.0%;变化只藏在语气和环境声里时,准确率仅3.4%和1.2%。

32K历史下四种记忆操作与四类声学证据的交叉准确率
32K历史下四种记忆操作与四类声学证据的交叉准确率。

这说明模型并非完全不会时间推理,而是很难把语气和背景声维护成可更新、可检索的状态。它能追踪“入住改到周二”,却很难记住“这次说话听起来更惊讶”或“两次对话是不是同一台洗衣机在响”。

拒答题也不能简单解释为模型更谨慎。模型在副语言和环境声上的拒答准确率较高,可能只是因为它本来就难以识别这些线索,而不是准确判断了证据缺失。

06 / 历史越长,谁、语气和环境声掉得更快

从8K增长到32K,闭源模型平均准确率由40.1%降至33.0%,开放权重模型由26.6%降至21.9%。在能完成64K测试的10款模型中,四类证据都持续下降。

历史从8K增长到64K时不同声学证据的准确率衰减
历史从8K增长到64K时不同声学证据的准确率衰减。

到64K时,语义保留了8K准确率的70.3%,副语言为69.8%,说话人身份为66.5%,环境声只有63.2%。副语言的绝对成绩一直很低,而说话人与环境声随长度增长衰减更快,这是两种不同的失败模式。

07 / 多数错误发生在“听进去”之前

研究团队把错误分为证据识别或定位失败、内容与说话人绑定错误、记忆操作执行错误、无依据回答等类型。64K结果显示:

  • 说话人题:48%的错误属于绑定失败,内容可能记住了,却挂到了错误的人或会话上。
  • 副语言题:63%的错误属于定位失败,所需语气线索根本没有被找回来。
  • 环境声题:41%是定位失败,39%是无依据回答。
  • 时序追踪:55%是定位失败,真正“证据找对但操作做错”的比例很低。
VoxMem在64K历史下对模型错误原因的分类结果
VoxMem在64K历史下对模型错误原因的分类结果。

所以当前瓶颈往往不在最后一步推理,而在模型能否先识别声音线索,再把它正确绑定到人物、事件与时间。

08 / VoxMem怎么跑?先做免费冒烟测试

官方仓库已经提供数据读取、模型运行、恢复执行和评分脚本。一个稳妥的起点是先跑25条说话人测试,用始终拒答的基线检查数据链路:

git clone https://github.com/swagshaw/voxmem.git
cd voxmem
pip install -r requirements.txt

python run_voxmembench.py --config 8k_speaker_information 
  --model abstain --allow-abstention --limit 25 
  --out predictions_smoke.jsonl

python score_voxmembench.py 
  --predictions predictions_smoke.jsonl --judge exact-match

正式评测可以选择完整32K配置,也可以只跑语义、说话人、副语言或环境声切片。API模型通过模型标识接入,本地模型需要提供仓库规定的适配函数。完整64K配置约32.83GB,建议先从单一切片和少量样本开始。

评分提醒:exact-match只适合冒烟测试。开放式答案需要使用官方说明的LLM裁判流程;修改系统提示词、拒答规则或音频输入方式,会让结果失去可比性。

09 / 做视频网观点:未来的语音助手需要“声学记忆层”

现在很多语音系统的长期记忆,本质上仍是“转写文字→提取事实→写入数据库”。这种方案能记住用户喜欢什么,却很难保存是谁说的、说话状态怎样、背景环境发生了什么。

VoxMem给产品团队的提示很明确:真正的语音长期记忆不能只有文本向量库,还需要说话人绑定、声学事件索引、情绪与语气状态、时间更新和证据不足拒答。同时,声音比文字更敏感,保存声纹、情绪和家庭环境声之前,必须提供清晰授权、最小化存储、可删除记录和本地处理选项。

一句话总结:上下文窗口只是书架,长期语音记忆还需要把声音证据听出来、绑对人、放进时间线,并在需要时准确取回。

相关站内内容

VoxMem站内导航:https://www.zuoshipin.com/link/49506.html

Griffin实时视频交互模型:https://www.zuoshipin.com/link/47153.html

Wispr Flow语音输入工具:https://www.zuoshipin.com/link/31548.html

AI耳机与语音Agent产业分析:https://www.zuoshipin.com/article/45494

苹果家庭AI与Siri前瞻:https://www.zuoshipin.com/article/49474

官方资料

VoxMem官方GitHub仓库

VoxMem官方项目页与排行榜

VoxMem研究论文

常见问题(FAQ)

VoxMem是什么?
VoxMem是面向大型音频语言模型的多会话记忆评测基准,测试语义、说话人、语气、环境声以及信息抽取、推理、时序追踪和拒答能力。
VoxMem测试了多少款音频大模型?
论文评测15款模型,包括5款闭源模型和10款开放权重模型;32K历史下没有模型整体准确率超过40%,最高为38.5%。
为什么只有语音转写不够?
转写主要保留说了什么,却会丢失说话人身份、语气、笑声、语速和环境声,而这些信息可能是跨会话问题的必要证据。
VoxMem为什么要提供8K到64K四种长度?
四档历史使用相同问题、答案和证据,只增加干扰与填充会话,因此可以更干净地观察历史变长对记忆能力的影响。
普通开发者如何开始运行VoxMem?
先安装官方仓库依赖,再用8K说话人切片、abstain基线和25条样本完成免费冒烟测试;确认链路后再接入API或本地音频模型。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材

暂无数据