← Flash Papers
BERT Explained: Deep Bidirectional Transformers
Share
Share this Flash Paper
BERT Explained: Deep Bidirectional Transformers
https://flashpapers.ai/p/66asdqe6cn
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Jacob Devlin, Ming-Wei Chang +2 more
cs.CL
2018
arXiv:1810.04805
Code
· 40k★
· updated 2y ago
Details ▸
Details ▴
GLUE Average Score:
80.5%
· GLUE
SQuAD v1.1 Test F1:
93.2
· SQuAD v1.1
SQuAD v2.0 Test F1:
83.1
· SQuAD v2.0
SWAG Test Accuracy:
86.3%
· SWAG
GLUE Average Score:
80.5%
· GLUE
SQuAD v1.1 Test F1:
93.2
· SQuAD v1.1
SQuAD v2.0 Test F1:
83.1
· SQuAD v2.0
SWAG Test Accuracy:
86.3%
· SWAG
Concepts:
Self-Attention
Transformer
LoRA
Retrieval-Augmented Generation
Masked Language Modeling