这四个框架覆盖了从入门到大规模生产的完整 RLHF / Post-training 学习路径。

背景概览

框架 来自 核心定位 特色
ms-swift ModelScope 阿里 全链路微调框架 SFT + 偏好学习 + GRPO 族,Megatron 并行
verl ByteDance 字节 高性能 RL 训练库 PPO/GRPO,VLM 支持,FSDP/Megatron 双后端
OpenRLHF OpenRLHF 社区 工业级 RLHF Ray + vLLM 分布式,70B+ 全量微调
MiniMind 龚一淳 (个人) 入门教育 + 轻量级复现 全流程从0实现,$3 / 2小时,单卡可跑

一、MiniMind(⭐入门首选)

推荐理由: 代码纯净,核心算法全部从0用 PyTorch 原生实现,不依赖第三方 RL 库封装,非常适合理解底层原理。

  • 🌟 最小 26M 参数,GPT-3 的 1/7000
  • 💰 $3 成本 + 单卡 3090,2小时训完整流程
  • 📖 从0原生实现 PPO / GRPO / CISPO / DPO
  • 🔧 Tool Calling + Adaptive Thinking + YaRN 长文本外推
  • 🖼️ 支持视觉多模态 MiniMind-V

学习路线:

1
2
3
4
Day 1: 环境搭建 + 跑通最简流程
Day 2: 全流程实验 Pretrain → SFT → LoRA → DPO
Day 3: RLHF 强化学习 PPO/GRPO/CISPO
Day 4: 高级特性 YaRN / Tool Calling / Adaptive Thinking

资源:

二、ms-swift(工业级入门)

推荐理由: 全链路覆盖,文档最友好,国内生态最完善。

  • 支持算法:DPO, KTO, GRPO, DAPO, GSPO, SAPO, CISPO, RLOO, Reinforce++
  • 支持 vLLM / SGLang / LMDeploy 推理加速
  • Megatron TP/PP 并行 + Web-UI 训练界面
  • 多模态 VLMs 支持

学习路线:

1
2
3
Day 5-6: 环境搭建 + SFT + DPO/KTO 偏好学习
Day 7: GRPO 强化学习实战
Day 8: Megatron 并行 + 多模态支持

资源:

三、verl(算法深度)

推荐理由: 字节最佳实践,算法实现最专业,VLM 支持最好。

  • DAPO 算法官方实现
  • VLM recipe: Qwen2.5-vl, Kimi-VL
  • Multi-turn Rollout with Tools
  • 支持 AMD / Ascend 多硬件

学习路线:

1
2
3
Day 9: verl 核心架构 Actor/Critic/Reward/Ref
Day 10: GRPO + 多 GPU 扩展
Day 11: VLM + Agent 工具调用

资源:

四、OpenRLHF(大规模生产)

推荐理由: 生产级稳定性,支撑大规模训练,EMNLP 2025 Demo Paper。

  • Ray 分布式调度 + vLLM Rollout Engine
  • ZeRO 训练引擎
  • 70B+ 全量微调支持
  • Hybrid Engine(推理训练分离)

学习路线:

1
2
3
Day 12: OpenRLHF 架构解析
Day 13: 高级特性 Packing / Dynamic Filtering / 调参
Day 14: 多节点集群部署

资源:

推荐学习路线(四框架顺序)

1
2
3
4
5
6
7
MiniMind(零基础入门,理解原理)

ms-swift(工业级框架,掌握全流程)

verl(算法深度,字节最佳实践)

OpenRLHF(大规模生产部署)

实战项目建议

项目1(入门):MiniMind 全流程

用 MiniMind 跑通 Pretrain → SFT → DPO → GRPO 全流程,观测 loss 曲线。

项目2(工程):小模型 RLHF 对齐

用 ms-swift,对 7B 模型做 SFT → GRPO,对比 DAPO vs GRPO vs Reinforce++。

项目3(研究):推理模型蒸馏复现

参考 MiniMind-Reason,复现 DeepSeek-R1 的 GRPO + Reward + Verification 流程。

项目4(生产):多 GPU 分布式 RLHF

用 OpenRLHF Hybrid Engine,配置 70B 模型的多节点 RLHF 训练。