← Flash PapersTraining Compute-Optimal Large Language Models

Share this Flash Paper

Training Compute-Optimal Large Language Models

https://flashpapers.ai/p/nckzxt2kkn
Make your own
Jordan Hoffmann, Sebastian Borgeaud +20 more
Details ▸
MMLU 5-shot accuracy:67.6%· MMLULAMBADA zero-shot accuracy:77.4%· LAMBADAWikitext103 Perplexity:7.16· Wikitext103Winograde accuracy:74.9%· Winograde
Concepts:Transformer