### [MiniCPM5-2B – 131K上下文的开源端侧Agent模型](https://www.zuoshipin.com/) **Published:** 2026-09-08T14:15:21 **Author:** 天才交易员 **Excerpt:** MiniCPM5-2B是OpenBMB开源的稠密大语言模型,拥有约25.2亿总参数、131072上下文,支持推… ## 产品定位 **MiniCPM5-2B是一款面向端侧助手、代码代理和工具调用流程的开源小模型。**它采用稠密Transformer架构,约25.2亿总参数、约19.8亿非嵌入参数,并把原生上下文扩展到131072 Tokens。 ## 核心能力 - **推理与代码:**针对数学、指令遵循、长链推理和代码任务训练。 - **Agent工具调用:**可以生成结构化工具调用,适合搜索、代码执行和业务API流程。 - **长上下文:**131K窗口适合阅读较长文档、代码仓库摘要和多轮任务记录。 - **开放训练资源:**除权重外,团队还公开UltraData系列数据与强化学习配方。 - **部署选择多:**覆盖服务端推理、桌面GUI、Apple Silicon和GGUF量化生态。 ## 最快部署方法 普通用户可以优先使用LM Studio、Ollama或兼容GGUF的llama.cpp前端;开发者搭建OpenAI兼容服务,可安装vLLM后运行下面的命令: ``` pip install "vllm>=0.21" vllm serve openbmb/MiniCPM5-2B --port 8000 ``` 需要工具调用时,官方模型卡推荐SGLang,并提供专用解析器: ``` pip install "sglang[srt]>=0.5.16" python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --tool-call-parser minicpm5 --port 30000 ``` ## 怎么选部署方案 - **只是体验聊天:**先用Hugging Face在线Demo或桌面GUI。 - **Apple Silicon:**优先查看MLX版本与量化模型。 - **NVIDIA服务器:**vLLM适合通用推理服务,SGLang更适合官方工具调用流程。 - **CPU或低显存:**选择llama.cpp与合适的GGUF量化,但要接受速度和精度折损。 ## 评测与使用提醒 Artificial Analysis曾在v4.1.1指数中给出23分,后续v4.2版本改为15分,并明确提醒两个版本不可直接比较;榜单后来仍在继续换版。模型卡中的平均53.9也属于开发团队选定测试集的结果。判断实际能力时,应使用自己的文档、代码和工具链做回归测试。 本地运行不等于自动安全。工具调用必须设置权限白名单、超时、预算和人工确认;量化、提示词模板、上下文长度及推理后端都会影响结果。 ---