### [15款音频大模型集体失忆:VoxMem实测32K历史最高仅38.5%,语气与背景声几乎记不住](https://www.zuoshipin.com/article/49507) **Published:** 2026-10-09T16:37:14 **Author:** 天才交易员 **Excerpt:** VoxMem用3,196个实例、34,743段会话和177小时音频测试15款音频大模型。32K历史下最高整体准… **导读:**把对话窗口拉长,并不等于语音助手拥有长期记忆;VoxMem首次把“说了什么、谁说的、怎么说、周围有什么声音”放进同一套多会话测试。最扎眼的结果是:在32K历史下,15款受测模型没有一款整体准确率超过40%。 如果语音助手只记住转写文本,它可能知道“灯具更换先暂停”,却不知道这句话是谁说的、语气是否犹豫、当时背景里有没有洗衣机声。到了多用户家庭、客服、会议或长期陪伴场景,这些被转写抹掉的信息,恰好可能决定下一次回答是否正确。 [![VoxMem论文标题与墨尔本大学、新南威尔士大学作者团队](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image01.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image01.webp) VoxMem论文标题与墨尔本大学、新南威尔士大学作者团队。 ## 01 / 语音记忆不只是“说了什么” 墨尔本大学与新南威尔士大学研究团队提出VoxMem,目标是测试大型音频语言模型能否跨多次会话保留四类证据: - **语音语义:**具体说了什么,例如计划、数量和偏好。 - **说话人身份:**哪位用户说了这句话,内容应该绑定给谁。 - **副语言线索:**怎样说的,例如犹豫、惊讶、强调、笑声或语速变化。 - **环境声音:**对话发生时听到了什么,例如交通、警报、家电或动物声。 [![语音转写会保留语义,却丢失说话人、语气和环境声](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image02.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image02.webp) 语音转写会保留语义,却丢失说话人、语气和环境声。 其中只有语义能够较完整地从文字转写恢复,后面三类信息主要存在于音频信号中。研究团队把用户轮次替换成精确文字后,音频原生题准确率从46.2%降到4.4%,语义题则只从75.9%降到71.0%。这说明测试确实依赖“听”,而不是换一种形式考阅读理解。 ## 02 / 4类证据 × 4种操作,组成15个有效考点 VoxMem的第二条轴线是怎样使用记忆: - **信息抽取(IE):**从某次历史会话中找到答案。 - **多会话推理(MSR):**组合多次会话,完成计数、比较和匹配。 - **时序演变追踪(TET):**判断计划、说话人、语气或背景声后来怎样变化。 - **拒答(AR):**证据不足或无法唯一确定时,明确表示不能判断。 [![VoxMem声学证据与记忆操作组成的15类有效测试组合](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image03.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image03.webp) VoxMem声学证据与记忆操作组成的15类有效测试组合。 “语义×信息抽取”被排除,因为问题和答案如果都只依赖文字,就会退化成普通文本检索。剩下15种组合,才真正覆盖语音记忆中特有的绑定、变化和拒答难题。 [![信息抽取、多会话推理、时序追踪与拒答任务示例](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image04.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image04.webp) 信息抽取、多会话推理、时序追踪与拒答任务示例。 ## 03 / 同一道题只增加历史,避免把“题更难”误判成“记忆变差” VoxMem包含799道问题。每道题都生成8K、16K、32K和64K四种历史长度,合计3,196个评测实例、34,743段语音会话和约177小时音频。 长版本严格包含短版本的证据,只增加干扰与填充会话;问题、答案和关键证据保持不变。这样,分数下降才更可能来自历史增长,而不是不同长度使用了不同难度的试题。 [![VoxMem从任务设计、音频生成到多长度历史和质量控制的构建流程](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image05.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image05.webp) VoxMem从任务设计、音频生成到多长度历史和质量控制的构建流程。 每段历史包含三类会话:真正含答案的证据会话、话题相似但取值不同的干扰会话,以及无关的日常填充会话。声学线索还会制作“文字和音色相同、只移除目标线索”的配对版本,用于确认答案确实来自语气或背景声。 ## 04 / 15款模型:32K历史下最高只有38.5% 团队测试了15款音频大模型,其中5款为闭源模型,10款为开放权重模型。所有模型通过原生音频接口接收相同历史和指令,并使用统一规则评分。 [![15款音频大模型在8K、16K和32K历史下的准确率](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image06.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image06.webp) 15款音频大模型在8K、16K和32K历史下的准确率。 32K历史下,排名第一的Qwen3.8-Omni-Flash整体准确率为**38.5%**;闭源模型平均33.0%,开放权重模型平均21.9%。这里的结论并不是某一款模型偶尔失误,而是当前音频大模型普遍没有建立可靠的跨会话声音记忆。 | 32K平均准确率 | 闭源模型 | 开放权重模型 | | --- | --- | --- | | 语音语义 | 55.6% | 31.6% | | 说话人身份 | 32.7% | 26.7% | | 副语言线索 | 20.0% | 14.5% | | 环境声音 | 21.9% | 15.5% | ## 05 / 说出口的变化还能追,没说出口的几乎全忘 把证据类型和记忆操作交叉后,最明显的差距出现在时序追踪:计划明确说出口时,平均准确率为44.5%;说话人身份变化降到20.0%;变化只藏在语气和环境声里时,准确率仅**3.4%**和**1.2%**。 [![32K历史下四种记忆操作与四类声学证据的交叉准确率](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image07.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image07.webp) 32K历史下四种记忆操作与四类声学证据的交叉准确率。 这说明模型并非完全不会时间推理,而是很难把语气和背景声维护成可更新、可检索的状态。它能追踪“入住改到周二”,却很难记住“这次说话听起来更惊讶”或“两次对话是不是同一台洗衣机在响”。 拒答题也不能简单解释为模型更谨慎。模型在副语言和环境声上的拒答准确率较高,可能只是因为它本来就难以识别这些线索,而不是准确判断了证据缺失。 ## 06 / 历史越长,谁、语气和环境声掉得更快 从8K增长到32K,闭源模型平均准确率由40.1%降至33.0%,开放权重模型由26.6%降至21.9%。在能完成64K测试的10款模型中,四类证据都持续下降。 [![历史从8K增长到64K时不同声学证据的准确率衰减](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image08.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image08.webp) 历史从8K增长到64K时不同声学证据的准确率衰减。 到64K时,语义保留了8K准确率的70.3%,副语言为69.8%,说话人身份为66.5%,环境声只有63.2%。副语言的绝对成绩一直很低,而说话人与环境声随长度增长衰减更快,这是两种不同的失败模式。 ## 07 / 多数错误发生在“听进去”之前 研究团队把错误分为证据识别或定位失败、内容与说话人绑定错误、记忆操作执行错误、无依据回答等类型。64K结果显示: - **说话人题:**48%的错误属于绑定失败,内容可能记住了,却挂到了错误的人或会话上。 - **副语言题:**63%的错误属于定位失败,所需语气线索根本没有被找回来。 - **环境声题:**41%是定位失败,39%是无依据回答。 - **时序追踪:**55%是定位失败,真正“证据找对但操作做错”的比例很低。 [![VoxMem在64K历史下对模型错误原因的分类结果](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image09.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/voxmem-audio-memory-image09.webp) VoxMem在64K历史下对模型错误原因的分类结果。 所以当前瓶颈往往不在最后一步推理,而在模型能否先识别声音线索,再把它正确绑定到人物、事件与时间。 ## 08 / VoxMem怎么跑?先做免费冒烟测试 官方仓库已经提供数据读取、模型运行、恢复执行和评分脚本。一个稳妥的起点是先跑25条说话人测试,用始终拒答的基线检查数据链路: ``` git clone https://github.com/swagshaw/voxmem.git cd voxmem pip install -r requirements.txt python run_voxmembench.py --config 8k_speaker_information --model abstain --allow-abstention --limit 25 --out predictions_smoke.jsonl python score_voxmembench.py --predictions predictions_smoke.jsonl --judge exact-match ``` 正式评测可以选择完整32K配置,也可以只跑语义、说话人、副语言或环境声切片。API模型通过模型标识接入,本地模型需要提供仓库规定的适配函数。完整64K配置约32.83GB,建议先从单一切片和少量样本开始。 **评分提醒:**exact-match只适合冒烟测试。开放式答案需要使用官方说明的LLM裁判流程;修改系统提示词、拒答规则或音频输入方式,会让结果失去可比性。 ## 09 / 做视频网观点:未来的语音助手需要“声学记忆层” 现在很多语音系统的长期记忆,本质上仍是“转写文字→提取事实→写入数据库”。这种方案能记住用户喜欢什么,却很难保存是谁说的、说话状态怎样、背景环境发生了什么。 VoxMem给产品团队的提示很明确:真正的语音长期记忆不能只有文本向量库,还需要**说话人绑定、声学事件索引、情绪与语气状态、时间更新和证据不足拒答**。同时,声音比文字更敏感,保存声纹、情绪和家庭环境声之前,必须提供清晰授权、最小化存储、可删除记录和本地处理选项。 **一句话总结:**上下文窗口只是书架,长期语音记忆还需要把声音证据听出来、绑对人、放进时间线,并在需要时准确取回。 ## 相关站内内容 **VoxMem站内导航:**[https://www.zuoshipin.com/link/49506.html](https://www.zuoshipin.com/link/49506.html) **Griffin实时视频交互模型:**[https://www.zuoshipin.com/link/47153.html](https://www.zuoshipin.com/link/47153.html) **Wispr Flow语音输入工具:**[https://www.zuoshipin.com/link/31548.html](https://www.zuoshipin.com/link/31548.html) **AI耳机与语音Agent产业分析:**[https://www.zuoshipin.com/article/45494](https://www.zuoshipin.com/article/45494) **苹果家庭AI与Siri前瞻:**[https://www.zuoshipin.com/article/49474](https://www.zuoshipin.com/article/49474) ## 官方资料 [VoxMem官方GitHub仓库](https://github.com/swagshaw/voxmem) [VoxMem官方项目页与排行榜](https://swagshaw.github.io/voxmem/) [VoxMem研究论文](https://arxiv.org/abs/2609.32607) **Tags:** AI评测, VoxMem, 多模态记忆, 语音助手, 音频大模型 **Categories:** AI资讯 ---