← Flash PapersDAPO: Demystifying Large-Scale LLM Reinforcement Learning

Share this Flash Paper

DAPO: Demystifying Large-Scale LLM Reinforcement Learning

https://flashpapers.ai/p/vztjrtkjz6
Make your own
Qiying Yu, Zheng Zhang +33 more
Details ▸
AIME 2024 Accuracy:50.0%· AIME 2024Training Step Efficiency:50% fewer steps· AIME 2024
DAPO: Demystifying Large-Scale LLM Reinforcement Learning — Flash Papers