25.2亿参数、131K上下文、Apache 2.0许可:跑分会随榜单版本变化,但模型、数据、RL框架和训练Recipe一起开放,才是这次发布最重的一部分。
先说预测:未来两年,端侧大模型不会只做“离线聊天”,而会逐渐接管个人电脑里的代码、文件、搜索与软件操作。决定胜负的也不只是模型分数,而是谁能把权重、数据、训练框架、工具调用与部署生态一起交给开发者。
OpenBMB刚刚开源的MiniCPM5-2B,正好踩中了这个方向。它是一款只有2B级规模的稠密模型,却把131K长上下文、推理、代码和Agent工具调用放进同一个权重里。更关键的是,这次开放的不只有模型,还有UltraData训练数据、强化学习方法和Meshy训练框架。

2B到底有多大?先把规格说清楚
“2B”是便于传播的规模标签。官方模型卡给出的精确数字是2,516,756,480个总参数,其中非嵌入参数为1,981,982,720。模型包含42层Transformer、16个Query Heads和2个KV Heads,原生上下文长度为131072 Tokens,并采用Apache 2.0许可。
这组配置的意义不是它能替代云端旗舰模型,而是把一个可用的通用Agent核心压缩到个人工作站、开发机和边缘服务器更容易承受的范围。对隐私敏感、网络不稳定、调用量大或需要固定成本的场景,小模型反而可能比最强API更实用。


真正惊喜的不是23分,而是小模型开始能做完整任务
旧版评测里,MiniCPM5-2B在4B以下模型中进入领先位置。Agentic Index覆盖代码代理、深度研究、GDPval专业任务和工具使用,这说明它的目标不是只在选择题上得高分,而是尝试读完要求、调用工具、执行步骤并交付结果。

发布图还显示,模型一次评测平均输出约2.1万Tokens,其中约1.4万用于推理、7000用于最终回答。长推理不自动等于更聪明,却说明2B模型也开始具备持续展开复杂任务的能力。部署时则要注意:输出越长,等待时间和算力消耗越高,生产系统需要限制最大Tokens和任务超时。

GDPval-AA v2用具有经济价值的专业任务衡量模型,旧版图中的Elo为891,人类基线为1000。“逼近人类”适合作为发布时的直观描述,却不能理解成模型已经达到通用人类工作水平:评测任务、评分器、工具权限与真实工作环境之间仍有很大距离。

官方自测平均53.9,应该怎么读?
OpenBMB在模型卡里列出了知识、数学、代码、长上下文、指令遵循与Agent等多组测试,MiniCPM5-2B在其选定对比集合中的平均分为53.9。它在部分测试上接近或超过更大模型,也有明显落后的项目。

我的判断:这个表格最有价值的不是证明MiniCPM5“全面第一”,而是说明它已经越过了端侧小模型的可用门槛。官方自测和第三方榜单都可能受提示模板、推理预算、量化与版本影响;真正准备部署的人,应该拿自己的客服记录、代码库、工具Schema和长文档做一套固定回归集。
模型变强的关键:RL加在线策略蒸馏
官方披露,MiniCPM5-2B在监督微调之后继续进行了强化学习和Online Policy Distillation。模型卡给出的汇总结果显示,这一阶段让通用与推理任务平均提升10.96分,Agent任务平均提升6.96分。

所谓在线策略蒸馏,可以理解为让小模型在自己当前会遇到的轨迹上,持续吸收更强策略的判断,而不是只模仿一批固定答案。配合可验证奖励和更细粒度的信用分配,小模型才有机会把有限容量用在最关键的推理步骤上。
这次最值钱的开放资源,其实是UltraData
权重解决“能不能直接用”,数据解决“能不能继续做自己的模型”。OpenBMB同步公开了UltraX、UltraData-Code、UltraData-SFT-Agent-2609和UltraData-RL-2609等资源,其中Agent监督微调数据约50万条,强化学习数据超过8万条。

其数据路线从文本精炼延伸到代码仓库清洗、合成任务、工具轨迹与可验证RL样本。对开发团队来说,这比只拿到一个最终权重更重要:可以研究模型为什么学会某项能力,也能围绕垂直工具、私有代码和行业流程继续训练。
本地部署教程:普通体验与Agent服务分两条路
路线一:普通用户先用桌面工具
- 在Hugging Face模型页确认官方或社区提供的量化格式。
- 使用LM Studio、Ollama、llama.cpp或Apple Silicon上的MLX加载合适版本。
- 先从较短上下文开始,观察内存、首Token延迟和生成速度,再逐渐增加窗口。
- 用自己的中文写作、代码解释、文档问答任务测试,不要只看聊天第一印象。
路线二:用vLLM搭建OpenAI兼容服务
pip install "vllm>=0.21"
vllm serve openbmb/MiniCPM5-2B --port 8000这条路线适合把模型接入已有应用、内部助手或评测脚本。生产环境还要补齐鉴权、并发限制、日志脱敏和资源监控。
路线三:用SGLang启用工具调用
pip install "sglang[srt]>=0.5.16"
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --tool-call-parser minicpm5 --port 30000MiniCPM5原始工具调用会输出XML风格结构,SGLang的minicpm5解析器可以转成OpenAI兼容的tool_calls。这一步不能省,否则模型“说要调用工具”与应用真正收到结构化调用是两回事。
和同级产品比,MiniCPM5-2B赢在哪里?
| 模型 | 定位 | 更值得关注的点 | 选择提醒 |
|---|---|---|---|
| MiniCPM5-2B | 端侧通用Agent | 131K上下文、工具调用、训练数据与RL框架同时开放 | 生态较新,需要验证推理后端和量化版本 |
| Qwen3.5 2B/4B | 通用、代码与成熟部署生态 | 社区量化、微调与推理适配通常更丰富 | 具体版本、许可和上下文需逐项核对 |
| Gemma 4 E2B | Google开放模型生态 | 多平台支持与Google工具链整合 | 许可、实际激活参数与部署需求不能只看名称 |
| MiniCPM5-1B | 更低资源端侧运行 | 内存更省、速度更容易做高 | 复杂推理、代码和Agent稳定性通常要让步 |
如果目标是尽可能省内存,1B版本更合理;如果已有成熟Qwen或Gemma工作流,迁移成本也要算进去。MiniCPM5-2B最有吸引力的用户,是希望研究小模型如何做长上下文与Agent,并且需要训练数据和RL配方的人。
Meshy:把同步与异步RL放进同一套服务拓扑
Meshy是这次发布里容易被忽略的另一块。它把推理、训练和Rollout拆成独立服务,用TransferQueue同时传递数据和控制信号。研究者不需要为同步、有限离策略与全异步RL维护三套完全不同的系统,只需调整各服务生产和消费数据的节奏。
它基于SGLang与torchtitan,官方当前建议使用NVIDIA GPU、CUDA 12.9和Python 3.12+。最快体验方式是拉取Alpha镜像,再运行仓库里的GRPO示例。普通用户不需要为了运行MiniCPM5安装Meshy,它面向的是继续训练模型的研究与工程团队。
端侧Agent落地前,必须补上五道安全门
- 工具白名单:只开放任务需要的搜索、文件或API能力。
- 危险动作确认:删除、付款、发布、发送和权限修改必须人工确认。
- 上下文隔离:不要把整块硬盘、所有聊天记录或生产密钥一次交给模型。
- 输出与费用上限:限制最大Tokens、循环次数、并发与重试,避免小模型长时间自我推理。
- 固定回归测试:每次更换量化、模板、推理框架或权重版本,都重新跑业务测试集。
最终判断:MiniCPM5-2B最值得关注的,不是一次榜单上“23分”的截图,而是它把端侧Agent需要的模型、长上下文、工具调用、训练数据和RL基础设施拼成了一个可继续开发的起点。小模型未必取代云端旗舰,但会接住大量高频、私有、可验证的具体任务。
站内导航与官方资源
MiniCPM5-2B站内导航:
https://www.zuoshipin.com/link/34519.html
Meshy站内导航:
https://www.zuoshipin.com/link/34520.html
官方模型卡: 查看模型权重、部署文档与许可
MiniCPM代码仓库: 查看GitHub项目
UltraData: 查看开放训练数据











