扩展
All-Sync RL
基于DAPO与LoRA

一种在复杂推理任务中训练大语言模型的可扩展框架

强化学习 分布式系统 性能优化

摘要

DAPO算法与低秩自适应(LoRA)相结合,并采用高同步(All-Sync)强化学习框架实现,代表了大语言模型在复杂推理任务训练上的重大进步。该系统解决了熵崩塌、训练不稳定性和计算成本等关键挑战。

通过引入不对称策略裁剪(Clip-Higher)、智能数据过滤(Dynamic Sampling)和Token级损失计算等创新,DAPO在AIME 2024等基准测试上以更高效率取得了最先进的性能。LoRA的使用大幅减少了内存占用,使得大模型训练成为可能,而All-Sync范式则确保了训练过程的稳定性和可复现性。

性能

在AIME 2024基准测试上取得50分,超越此前SOTA的47分

效率

训练步骤减少50%,同时保持优异性能

可扩展性

在GPU集群上实现近线性扩展

1. DAPO:解耦裁剪与动态采样策略优化

1.1 核心算法创新

Clip-Higher机制

通过不对称裁剪增强模型多样性与探索,上界高于下界(1+ε_high对比1-ε),鼓励更大胆地探索低概率Token。

影响:能有效防止熵崩塌,促进复杂推理任务中的创造性解答。

动态采样

智能数据过滤,确保训练批次始终包含正确与错误样本混合的信息量大的样本。

影响:训练效率提升,无效梯度减少,学习过程更加稳定。

Token级策略梯度损失

对每个Token单独计算优势,为长思维链推理任务提供细粒度反馈,防止学习信号被稀释。

影响:提升对长序列输出的精确学习能力。

过长奖励整形

采用软性长度惩罚,而非硬截断,降低奖励噪声,为过长但可能正确的回答提供更平滑的学习信号。

影响:训练过程更稳定,收敛性更好。

2. LoRA:强化学习中的低秩自适应

低秩自适应(LoRA)是大型语言模型的一种参数高效微调方法,仅需全量微调一小部分计算成本和内存即可训练大模型。

核心原理

  • 冻结预训练权重:保持原始模型参数不变,无需计算其梯度。
  • 注入低秩矩阵:添加小型可训练矩阵A和B,其中ΔW = BA。
  • 降低内存占用:仅需训练原模型参数量的0.4%即可获得优异性能。

LoRA配置

秩(r) 16
缩放因子(α) 32
Dropout 0.1
精度 bfloat16
"The ability to share the base model and only swap the adapters, which might represent as little as 0.4% of the total model parameters, is a powerful optimization for seamless switching between policy and proxy models."

3. All-Sync RL:系统架构与扩展

All-Sync RL采用分布式强化学习范式,所有计算节点高度同步,确保模型参数版本的一致性。

关键优势

  • • 训练过程更稳定、可复现
  • • 消除“陈旧梯度”问题
  • • 行为更确定,便于调试
  • • 算法稳定性更优

通信协议

采用NCCL(NVIDIA Collective Communications Library)实现GPU间高效集体通信。

性能:在InfiniBand等高速互连场景下,同步带宽接近峰值。

架构对比

All-Sync(verl)

一致性优先,适合需要稳定收敛的场景

异步(AReaL)

吞吐量优先,在部分场景下可达2.5倍吞吐量

verl框架集成

  • • 分布式训练抽象
  • • 支持多后端(FSDP、Megatron)
  • • 高性能推理引擎(vLLM、SGLang)
  • • 灵活的控制器设计

4. 实验结果与性能分析

4.1 数学推理基准测试

AIME 2024

50

DAPO分数(超越SOTA 47分)

效率

50%

训练步骤减少

模型规模

32B

参数(Qwen2.5基础模型)

对比表现

DAPO系统在AIME 2024基准测试中获得50分,显著超越DeepSeek-R1-Zero-Qwen-32B模型(47分),并且在达成这一性能时训练步骤减少了50%。

4.2 DAPO组件的消融研究

📈

Clip-Higher

模型多样性与探索提升

🎯

动态采样

无效梯度显著减少

🧩

Token级损失

细粒度学习信号

⚖️

奖励整形

训练稳定性提升

4.3 系统级性能与可扩展性

LoRA带来的资源利用

  • • 内存占用降低80%以上
  • • 可支持更大批量训练
  • • 训练时长大幅缩短
  • • 硬件要求显著降低

分布式性能

  • • 多GPU扩展呈近线性增长
  • • NCCL优化通信
  • • 重叠计算与通信
  • • 多节点训练高效

结论与未来展望

结合DAPO、LoRA和All-Sync RL训练范式,为大语言模型训练提供了稳定、高效且可扩展的方案。该系统在具挑战性的数学推理基准上取得SOTA结果,同时大幅降低了计算与内存需求。

算法创新

DAPO的创新解决了RL训练中的熵崩塌、无效梯度和信号稀疏等核心难题。

高效训练

LoRA实现了参数高效微调,让大模型训练在有限资源下成为可能。

可复现研究

开源verl框架与完整训练代码,有助于推动强化学习和可复现AI研究。