产品定位
MiniCPM5-2B是一款面向端侧助手、代码代理和工具调用流程的开源小模型。它采用稠密Transformer架构,约25.2亿总参数、约19.8亿非嵌入参数,并把原生上下文扩展到131072 Tokens。
核心能力
- 推理与代码:针对数学、指令遵循、长链推理和代码任务训练。
- Agent工具调用:可以生成结构化工具调用,适合搜索、代码执行和业务API流程。
- 长上下文:131K窗口适合阅读较长文档、代码仓库摘要和多轮任务记录。
- 开放训练资源:除权重外,团队还公开UltraData系列数据与强化学习配方。
- 部署选择多:覆盖服务端推理、桌面GUI、Apple Silicon和GGUF量化生态。
最快部署方法
普通用户可以优先使用LM Studio、Ollama或兼容GGUF的llama.cpp前端;开发者搭建OpenAI兼容服务,可安装vLLM后运行下面的命令:
pip install "vllm>=0.21"
vllm serve openbmb/MiniCPM5-2B --port 8000需要工具调用时,官方模型卡推荐SGLang,并提供专用解析器:
pip install "sglang[srt]>=0.5.16"
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --tool-call-parser minicpm5 --port 30000怎么选部署方案
- 只是体验聊天:先用Hugging Face在线Demo或桌面GUI。
- Apple Silicon:优先查看MLX版本与量化模型。
- NVIDIA服务器:vLLM适合通用推理服务,SGLang更适合官方工具调用流程。
- CPU或低显存:选择llama.cpp与合适的GGUF量化,但要接受速度和精度折损。
评测与使用提醒
Artificial Analysis曾在v4.1.1指数中给出23分,后续v4.2版本改为15分,并明确提醒两个版本不可直接比较;榜单后来仍在继续换版。模型卡中的平均53.9也属于开发团队选定测试集的结果。判断实际能力时,应使用自己的文档、代码和工具链做回归测试。
本地运行不等于自动安全。工具调用必须设置权限白名单、超时、预算和人工确认;量化、提示词模板、上下文长度及推理后端都会影响结果。







