VoxMem是什么?
VoxMem是面向大型音频语言模型的多会话语音记忆评测基准。它不只测试模型能否记住转写文字,还测试模型能否跨多次会话记住说话人身份、语气变化和环境声音,并完成信息抽取、多会话推理、时序演变追踪与证据不足拒答。

数据规模
- 799道问题,覆盖15种“声学证据×记忆操作”组合
- 8K、16K、32K、64K四档历史长度,共3,196个评测实例
- 34,743段语音会话,约177小时音频
- 语音语义、说话人、副语言线索、环境声四类证据
- 信息抽取、多会话推理、时序追踪、拒答四类操作

如何运行?
- 克隆官方仓库并安装requirements依赖。
- 选择8K、16K、32K或64K配置,也可以只运行某一种声学证据切片。
- 先使用abstain基线进行25条免费冒烟测试,确认拒答与可回答数据连接正常。
- 再通过OpenAI、Gemini或本地模型适配器运行正式评测。
- 使用评分脚本生成整体准确率、证据类型、记忆操作和上下文长度分项结果。
pip install -r requirements.txt
python run_voxmembench.py --config 8k_speaker_information
--model abstain --allow-abstention --limit 25
--out predictions_smoke.jsonl
python score_voxmembench.py
--predictions predictions_smoke.jsonl --judge exact-match
运行前注意
- 完整配置数据量较大:官方列出的全量8K约4.03GB,64K约32.83GB。
- 真实开放式回答通常需要LLM裁判;exact-match适合冒烟测试,不适合直接复现论文主结果。
- 本地模型需实现仓库规定的音频消息适配器,并确认系统提示词没有被聊天模板忽略。
- 仓库页面未明确展示开源许可证,二次分发、商用或修改前应核对最新条款。

适合谁?
适合语音助手、实时对话、智能家居、客服、会议系统、音频Agent与长期记忆方向的研究者和工程团队。它是评测与研究工具,不是面向普通用户的语音助手。
