← Flash Papers
Learning Transferable Visual Models From Natural Language Supervision (CLIP)
Share
Share this Flash Paper
Learning Transferable Visual Models From Natural Language Supervision (CLIP)
https://flashpapers.ai/p/ummnt2k6gb
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Alec Radford, Jong Wook Kim +10 more
cs.CV
2021
arXiv:2103.00020
Code
· 34k★
· updated 4mo ago
Details ▸
Details ▴
Zero-shot accuracy:
76.2%
· ImageNet
Pre-training Dataset Size:
400,000,000 pairs
· WIT (WebImageText)
Zero-shot accuracy:
76.2%
· ImageNet
Pre-training Dataset Size:
400,000,000 pairs
· WIT (WebImageText)