Model card for vit large patch16 siglip 256.v2 webli A SigLIP 2 ViT (image encoder only) for timm . Equivalent to image tower from https://huggingface.co/timm/ViT L 16 SigLIP2 256. Model Details Dataset: webli Papers: SigLIP 2: Multilingual Vision Language Encoders with Improved Semantic Understanding, Localization, and Dense Features: https://arxiv.org/abs/2502.14786 Sigmoid Loss for Language Image Pre Training: https://arxiv.org/abs/2303.15343 Citation
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy