导读:把对话窗口拉长,并不等于语音助手拥有长期记忆;VoxMem首次把“说了什么、谁说的、怎么说、周围有什么声音”放进同一套多会话测试。最扎眼的结果是:在32K历史下,15款受测模型没有一款整体准确率超过40%。
如果语音助手只记住转写文本,它可能知道“灯具更换先暂停”,却不知道这句话是谁说的、语气是否犹豫、当时背景里有没有洗衣机声。到了多用户家庭、客服、会议或长期陪伴场景,这些被转写抹掉的信息,恰好可能决定下一次回答是否正确。

01 / 语音记忆不只是“说了什么”
墨尔本大学与新南威尔士大学研究团队提出VoxMem,目标是测试大型音频语言模型能否跨多次会话保留四类证据:
- 语音语义:具体说了什么,例如计划、数量和偏好。
- 说话人身份:哪位用户说了这句话,内容应该绑定给谁。
- 副语言线索:怎样说的,例如犹豫、惊讶、强调、笑声或语速变化。
- 环境声音:对话发生时听到了什么,例如交通、警报、家电或动物声。

其中只有语义能够较完整地从文字转写恢复,后面三类信息主要存在于音频信号中。研究团队把用户轮次替换成精确文字后,音频原生题准确率从46.2%降到4.4%,语义题则只从75.9%降到71.0%。这说明测试确实依赖“听”,而不是换一种形式考阅读理解。
02 / 4类证据 × 4种操作,组成15个有效考点
VoxMem的第二条轴线是怎样使用记忆:
- 信息抽取(IE):从某次历史会话中找到答案。
- 多会话推理(MSR):组合多次会话,完成计数、比较和匹配。
- 时序演变追踪(TET):判断计划、说话人、语气或背景声后来怎样变化。
- 拒答(AR):证据不足或无法唯一确定时,明确表示不能判断。

“语义×信息抽取”被排除,因为问题和答案如果都只依赖文字,就会退化成普通文本检索。剩下15种组合,才真正覆盖语音记忆中特有的绑定、变化和拒答难题。

03 / 同一道题只增加历史,避免把“题更难”误判成“记忆变差”
VoxMem包含799道问题。每道题都生成8K、16K、32K和64K四种历史长度,合计3,196个评测实例、34,743段语音会话和约177小时音频。
长版本严格包含短版本的证据,只增加干扰与填充会话;问题、答案和关键证据保持不变。这样,分数下降才更可能来自历史增长,而不是不同长度使用了不同难度的试题。

每段历史包含三类会话:真正含答案的证据会话、话题相似但取值不同的干扰会话,以及无关的日常填充会话。声学线索还会制作“文字和音色相同、只移除目标线索”的配对版本,用于确认答案确实来自语气或背景声。
04 / 15款模型:32K历史下最高只有38.5%
团队测试了15款音频大模型,其中5款为闭源模型,10款为开放权重模型。所有模型通过原生音频接口接收相同历史和指令,并使用统一规则评分。

32K历史下,排名第一的Qwen3.8-Omni-Flash整体准确率为38.5%;闭源模型平均33.0%,开放权重模型平均21.9%。这里的结论并不是某一款模型偶尔失误,而是当前音频大模型普遍没有建立可靠的跨会话声音记忆。
| 32K平均准确率 | 闭源模型 | 开放权重模型 |
|---|---|---|
| 语音语义 | 55.6% | 31.6% |
| 说话人身份 | 32.7% | 26.7% |
| 副语言线索 | 20.0% | 14.5% |
| 环境声音 | 21.9% | 15.5% |
05 / 说出口的变化还能追,没说出口的几乎全忘
把证据类型和记忆操作交叉后,最明显的差距出现在时序追踪:计划明确说出口时,平均准确率为44.5%;说话人身份变化降到20.0%;变化只藏在语气和环境声里时,准确率仅3.4%和1.2%。

这说明模型并非完全不会时间推理,而是很难把语气和背景声维护成可更新、可检索的状态。它能追踪“入住改到周二”,却很难记住“这次说话听起来更惊讶”或“两次对话是不是同一台洗衣机在响”。
拒答题也不能简单解释为模型更谨慎。模型在副语言和环境声上的拒答准确率较高,可能只是因为它本来就难以识别这些线索,而不是准确判断了证据缺失。
06 / 历史越长,谁、语气和环境声掉得更快
从8K增长到32K,闭源模型平均准确率由40.1%降至33.0%,开放权重模型由26.6%降至21.9%。在能完成64K测试的10款模型中,四类证据都持续下降。

到64K时,语义保留了8K准确率的70.3%,副语言为69.8%,说话人身份为66.5%,环境声只有63.2%。副语言的绝对成绩一直很低,而说话人与环境声随长度增长衰减更快,这是两种不同的失败模式。
07 / 多数错误发生在“听进去”之前
研究团队把错误分为证据识别或定位失败、内容与说话人绑定错误、记忆操作执行错误、无依据回答等类型。64K结果显示:
- 说话人题:48%的错误属于绑定失败,内容可能记住了,却挂到了错误的人或会话上。
- 副语言题:63%的错误属于定位失败,所需语气线索根本没有被找回来。
- 环境声题:41%是定位失败,39%是无依据回答。
- 时序追踪:55%是定位失败,真正“证据找对但操作做错”的比例很低。

所以当前瓶颈往往不在最后一步推理,而在模型能否先识别声音线索,再把它正确绑定到人物、事件与时间。
08 / VoxMem怎么跑?先做免费冒烟测试
官方仓库已经提供数据读取、模型运行、恢复执行和评分脚本。一个稳妥的起点是先跑25条说话人测试,用始终拒答的基线检查数据链路:
git clone https://github.com/swagshaw/voxmem.git
cd voxmem
pip install -r requirements.txt
python run_voxmembench.py --config 8k_speaker_information
--model abstain --allow-abstention --limit 25
--out predictions_smoke.jsonl
python score_voxmembench.py
--predictions predictions_smoke.jsonl --judge exact-match
正式评测可以选择完整32K配置,也可以只跑语义、说话人、副语言或环境声切片。API模型通过模型标识接入,本地模型需要提供仓库规定的适配函数。完整64K配置约32.83GB,建议先从单一切片和少量样本开始。
评分提醒:exact-match只适合冒烟测试。开放式答案需要使用官方说明的LLM裁判流程;修改系统提示词、拒答规则或音频输入方式,会让结果失去可比性。
09 / 做视频网观点:未来的语音助手需要“声学记忆层”
现在很多语音系统的长期记忆,本质上仍是“转写文字→提取事实→写入数据库”。这种方案能记住用户喜欢什么,却很难保存是谁说的、说话状态怎样、背景环境发生了什么。
VoxMem给产品团队的提示很明确:真正的语音长期记忆不能只有文本向量库,还需要说话人绑定、声学事件索引、情绪与语气状态、时间更新和证据不足拒答。同时,声音比文字更敏感,保存声纹、情绪和家庭环境声之前,必须提供清晰授权、最小化存储、可删除记录和本地处理选项。
一句话总结:上下文窗口只是书架,长期语音记忆还需要把声音证据听出来、绑对人、放进时间线,并在需要时准确取回。
相关站内内容
VoxMem站内导航:https://www.zuoshipin.com/link/49506.html
Griffin实时视频交互模型:https://www.zuoshipin.com/link/47153.html
Wispr Flow语音输入工具:https://www.zuoshipin.com/link/31548.html
AI耳机与语音Agent产业分析:https://www.zuoshipin.com/article/45494
苹果家庭AI与Siri前瞻:https://www.zuoshipin.com/article/49474






