项目定位
Meshy是一套给大模型强化学习研究者使用的服务化训练框架。它把推理、训练和Rollout都做成独立服务,服务之间通过TransferQueue交换数据和控制信号,不依赖一个中央Driver搬运RPC或张量。
为什么值得关注
- 同一拓扑切换训练节奏:改变生产与消费节奏,就能覆盖同步、有限离策略和全异步RL。
- 组件可独立扩缩:推理、Rollout和训练服务可以按瓶颈单独调整资源。
- 减少中央调度压力:TransferQueue同时承担数据面和控制面。
- 复用成熟底层:推理基于SGLang,训练部分建立在torchtitan之上。
- 提供现成Recipe:仓库包含GRPO、数学任务等示例,方便研究者复现实验。
Docker快速体验
官方给出的最短路径是使用预构建镜像。准备支持CUDA 12.9的NVIDIA GPU与容器工具后运行:
docker pull ztonyzhao/meshy:0.1.0-alpha
docker run --gpus all -it --rm ztonyzhao/meshy:0.1.0-alpha进入环境后,可从最小GRPO示例开始:
python scripts/launch.py --recipe recipe.grpo_gsm8k适合谁
适合研究强化学习、奖励建模、Rollout服务、分布式训练和异步策略优化的团队。它不是面向普通用户的模型启动器,也不能替代数据清洗、奖励设计、实验监控和安全评估。
使用提醒
项目仍处早期Alpha阶段,对CUDA、GPU、容器和分布式训练经验要求较高。正式投入集群前,应先在小规模Recipe上验证版本、显存、通信、检查点恢复和指标一致性,并锁定镜像与依赖版本。





