Model llava llama 3 8b v1 1 hf is a LLaVA model fine tuned from meta llama/Meta Llama 3 8B Instruct and CLIP ViT Large patch14 336 with ShareGPT4V PT and InternVL SFT by XTuner. Note: This model is in HuggingFace LLaVA format. Resources: GitHub: xtuner Official LLaVA format model: xtuner/llava llama 3 8b v1 1 hf XTuner LLaVA format model: xtuner/llava llama 3 8b v1 1 GGUF format model: xtuner/llava llama 3 8b v1 1 gguf Details Model Visual Encoder Projector Resolution Pretraining Strategy Fine tuning Strategy Pretrain Dataset Fine tune Dataset : : : : : : : : LLaVA v1.5 7B CLIP L MLP 336 Frozen LLM, Frozen ViT Full LLM, Frozen ViT LLaVA PT (558K) LLaVA Mix (665K) LLaVA Llama 3 8B CLIP L MLP 336 Frozen LLM, Frozen ViT Full LLM, LoRA ViT LLaVA PT (558K) LLaVA Mix (665K) LLaVA Llama 3 8B v1.1 CLIP L MLP 336 Frozen LLM, Frozen ViT Full LLM, LoRA ViT ShareGPT4V PT (1246K) InternVL SFT (1268K) Results Model MMBench Test (EN) MMBench Test (CN) CCBench Dev MMMU Val SEED IMG AI2D Test ScienceQA Test HallusionBench aAcc POPE GQA TextVQA MME MMStar : : : : : : : : : : : : : : : : : : : : : : : : : : : LLaVA v1.5 7B 66.5 59.0 27.5 35.3 60.5 54.8 70.4 44.9 85.9 62.0 58.2 1511/348 30.3 LLaVA Lla…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy