← Flash Papers
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Share
Share this Flash Paper
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
https://flashpapers.ai/p/u8bs3zpgxe
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Rafael Rafailov, Archit Sharma +4 more
cs.LG
2023
arXiv:2305.18290
Code
· 2.9k★
· updated 2y ago
Details ▸
Details ▴
Win Rate vs Reference Summaries:
61.0%
· Reddit TL;DR
Win Rate vs Chosen Responses:
55.0%
· Anthropic-HH Dialogue
Win Rate vs Reference Summaries:
61.0%
· Reddit TL;DR
Win Rate vs Chosen Responses:
55.0%
· Anthropic-HH Dialogue
Concepts:
Direct Preference Optimization
RLHF