← Flash PapersDirect Preference Optimization: Your Language Model is Secretly a Reward Model

Share this Flash Paper

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

https://flashpapers.ai/p/u8bs3zpgxe
Make your own
Rafael Rafailov, Archit Sharma +4 more
Details ▸
Win Rate vs Reference Summaries:61.0%· Reddit TL;DRWin Rate vs Chosen Responses:55.0%· Anthropic-HH Dialogue