CLIP1 is a phenomenal playmaker in vision and multimodal representation learning. It plays not only as a foundation model but also a bridge between vision and language. It has triggered a series of research in different fields, especially text-to-image generation.
Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese
calendar_today
December 24, 2022
domain
qwen