Model Overview Audio Flamingo Next: Next Generation Open Audio Language Models for Speech, Sound, and Music Audio Flamingo Next (AF Next) is the next generation open large audio language model in the Audio Flamingo series. nvidia/audio flamingo next hf is the instruction tuned checkpoint for general audio understanding, question answering, and conversation over speech, environmental sounds, and music. Description Compared with Audio Flamingo 3, AF Next adds: a stronger foundational audio language model for speech, sound, and music training data scaled beyond academic benchmarks using public and internet scale sources native long audio support up to 30 minutes stronger multilingual ASR, multi talker speech understanding, and long form captioning timestamp aware modeling through Rotary Time Embeddings (RoTE) This checkpoint corresponds to AF Next Instruct , the post trained assistant variant. It is the best default checkpoint if you want: general audio QA instruction following multi turn audio chat long form audio understanding timestamp aware prompts Best For standard audio QA and instruction following across speech, sound, and music assistant style responses for long audio question…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy