← Flash Papers1-Shot RLVR: Reinforcement Learning for Reasoning with One Example

Share this Flash Paper

1-Shot RLVR: Reinforcement Learning for Reasoning with One Example

https://flashpapers.ai/p/64jhmkpezy
Make your own
Yiping Wang, Qing Yang +12 more
Details ▸
MATH500 Accuracy:73.6%· MATH500Average Accuracy across 6 benchmarks:35.7%· 6 Math BenchmarksMATH500 Accuracy (2-shot):74.8%· MATH500
Concepts:GRPO