← Flash Papers
1-Shot RLVR: Reinforcement Learning for Reasoning with One Example
Share
Share this Flash Paper
1-Shot RLVR: Reinforcement Learning for Reasoning with One Example
https://flashpapers.ai/p/64jhmkpezy
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Yiping Wang, Qing Yang +12 more
cs.LG
2025
arXiv:2504.20571
Code
· 437★
· updated 4mo ago
Details ▸
Details ▴
MATH500 Accuracy:
73.6%
· MATH500
Average Accuracy across 6 benchmarks:
35.7%
· 6 Math Benchmarks
MATH500 Accuracy (2-shot):
74.8%
· MATH500
MATH500 Accuracy:
73.6%
· MATH500
Average Accuracy across 6 benchmarks:
35.7%
· 6 Math Benchmarks
MATH500 Accuracy (2-shot):
74.8%
· MATH500
Concepts:
GRPO