← Flash PapersMeasuring Massive Multitask Language Understanding (MMLU)

Share this Flash Paper

Measuring Massive Multitask Language Understanding (MMLU)

https://flashpapers.ai/p/b7vr3tua9m
Make your own
Dan Hendrycks, Collin Burns +5 more
Details ▸
GPT-3 X-Large Average Accuracy:43.9%· MMLUUnifiedQA Average Accuracy:48.9%· MMLUUnspecialized Human Accuracy:34.5%· MMLUExpert Human Accuracy:89.8%· MMLU