← Flash PapersLearning Transferable Visual Models From Natural Language Supervision (CLIP)

Share this Flash Paper

Learning Transferable Visual Models From Natural Language Supervision (CLIP)

https://flashpapers.ai/p/ummnt2k6gb
Make your own
Alec Radford, Jong Wook Kim +10 more
Details ▸
Zero-shot accuracy:76.2%· ImageNetPre-training Dataset Size:400,000,000 pairs· WIT (WebImageText)