← Flash Papers
Spurious Rewards: Rethinking Training Signals in RLVR
Share
Share this Flash Paper
Spurious Rewards: Rethinking Training Signals in RLVR
https://flashpapers.ai/p/bnb9crsych
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Rulin Shao, Shuyue Stella Li +12 more
cs.AI
2025
arXiv:2506.10947
Code
Details ▸
Details ▴
MATH-500 Accuracy:
70.8%
· MATH-500
MATH-500 Accuracy Gain (Random Rewards):
+21.4%
· MATH-500
MATH-500 Accuracy Gain (Ground Truth):
+29.1%
· MATH-500
Code Reasoning Frequency:
95.6%
· MATH-500
MATH-500 Accuracy:
70.8%
· MATH-500
MATH-500 Accuracy Gain (Random Rewards):
+21.4%
· MATH-500
MATH-500 Accuracy Gain (Ground Truth):
+29.1%
· MATH-500
Code Reasoning Frequency:
95.6%
· MATH-500
Spurious Rewards: Rethinking Training Signals in RLVR — Flash Papers