Model Card Model Details Architecture: ViT Base with patch size 32 Training Data: DTD dataset Training Details Adam Optimizer with a constant learning rate 1e 5 for 4000 steps training (batch size=32). Only the vision encoder is fine tuned. Evaluation Results pre trained: 0.4388 fine tuned: 0.7973 Usage load vision model substitute the vision encoder of clip
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy