这四个框架覆盖了从入门到大规模生产的完整 RLHF / Post-training 学习路径。
背景概览
| 框架 | 来自 | 核心定位 | 特色 |
|---|---|---|---|
| ms-swift | ModelScope 阿里 | 全链路微调框架 | SFT + 偏好学习 + GRPO 族,Megatron 并行 |
| verl | ByteDance 字节 | 高性能 RL 训练库 | PPO/GRPO,VLM 支持,FSDP/Megatron 双后端 |
| OpenRLHF | OpenRLHF 社区 | 工业级 RLHF | Ray + vLLM 分布式,70B+ 全量微调 |
| MiniMind | 龚一淳 (个人) | 入门教育 + 轻量级复现 | 全流程从0实现,$3 / 2小时,单卡可跑 |
一、MiniMind(⭐入门首选)
推荐理由: 代码纯净,核心算法全部从0用 PyTorch 原生实现,不依赖第三方 RL 库封装,非常适合理解底层原理。
- 🌟 最小 26M 参数,GPT-3 的 1/7000
- 💰 $3 成本 + 单卡 3090,2小时训完整流程
- 📖 从0原生实现 PPO / GRPO / CISPO / DPO
- 🔧 Tool Calling + Adaptive Thinking + YaRN 长文本外推
- 🖼️ 支持视觉多模态 MiniMind-V
学习路线:
1 | Day 1: 环境搭建 + 跑通最简流程 |
资源:
二、ms-swift(工业级入门)
推荐理由: 全链路覆盖,文档最友好,国内生态最完善。
- 支持算法:DPO, KTO, GRPO, DAPO, GSPO, SAPO, CISPO, RLOO, Reinforce++
- 支持 vLLM / SGLang / LMDeploy 推理加速
- Megatron TP/PP 并行 + Web-UI 训练界面
- 多模态 VLMs 支持
学习路线:
1 | Day 5-6: 环境搭建 + SFT + DPO/KTO 偏好学习 |
资源:
三、verl(算法深度)
推荐理由: 字节最佳实践,算法实现最专业,VLM 支持最好。
- DAPO 算法官方实现
- VLM recipe: Qwen2.5-vl, Kimi-VL
- Multi-turn Rollout with Tools
- 支持 AMD / Ascend 多硬件
学习路线:
1 | Day 9: verl 核心架构 Actor/Critic/Reward/Ref |
资源:
四、OpenRLHF(大规模生产)
推荐理由: 生产级稳定性,支撑大规模训练,EMNLP 2025 Demo Paper。
- Ray 分布式调度 + vLLM Rollout Engine
- ZeRO 训练引擎
- 70B+ 全量微调支持
- Hybrid Engine(推理训练分离)
学习路线:
1 | Day 12: OpenRLHF 架构解析 |
资源:
推荐学习路线(四框架顺序)
1 | MiniMind(零基础入门,理解原理) |
实战项目建议
项目1(入门):MiniMind 全流程
用 MiniMind 跑通 Pretrain → SFT → DPO → GRPO 全流程,观测 loss 曲线。
项目2(工程):小模型 RLHF 对齐
用 ms-swift,对 7B 模型做 SFT → GRPO,对比 DAPO vs GRPO vs Reinforce++。
项目3(研究):推理模型蒸馏复现
参考 MiniMind-Reason,复现 DeepSeek-R1 的 GRPO + Reward + Verification 流程。
项目4(生产):多 GPU 分布式 RLHF
用 OpenRLHF Hybrid Engine,配置 70B 模型的多节点 RLHF 训练。
Share / 分享
评论