← Flash Papers
An Image is Worth 16x16 Words: Vision Transformers
Share
Share this Flash Paper
An Image is Worth 16x16 Words: Vision Transformers
https://flashpapers.ai/p/uk5cb5pvrn
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Alexey Dosovitskiy, Lucas Beyer +10 more
cs.CV
2020
arXiv:2010.11929
Code
· 13k★
· updated 5mo ago
Details ▸
Details ▴
ImageNet Top-1 Accuracy:
88.55%
· ImageNet-1K
ImageNet ReaL Accuracy:
90.72%
· ImageNet ReaL
CIFAR-100 Accuracy:
94.55%
· CIFAR-100
VTAB Mean Accuracy:
77.63%
· VTAB-1k
ImageNet Top-1 Accuracy:
88.55%
· ImageNet-1K
ImageNet ReaL Accuracy:
90.72%
· ImageNet ReaL
CIFAR-100 Accuracy:
94.55%
· CIFAR-100
VTAB Mean Accuracy:
77.63%
· VTAB-1k
Concepts:
Self-Attention
Contrastive Learning
Masked Language Modeling