Jiahui YuSimVLM: Simple Visual Language Model Pretraining with Weak SupervisionCoCa: Contrastive Captioners are Image-Text Foundation ModelsGemini: A Family of Highly Capable Multimodal ModelsGemini: A Family of Highly Capable Multimodal ModelsAll names