Tech Report ACE Step Captioner Description ACE Step Captioner is the annotation model used by ACE Step v1.5 for training data labeling. It is a professional grade music captioning model that generates detailed, structured descriptions of audio content. Performance 🏆 Accuracy surpasses Gemini Pro 2.5 in music description tasks Key Features 🎼 Musical Style Analysis Identifies genres, sub genres, and stylistic influences 🎸 Instrument Recognition Detects and describes 1000+ instrument types and combinations 🎭 Structure & Progression Analyzes musical arrangement including intro, verse, chorus, bridge, climax, and outro 🔊 Timbre Description Captures tonal qualities, textures, and sonic characteristics 📝 Rich Vocabulary Supports 1000+ descriptive terms for comprehensive music annotation Usage The usage is the same as Qwen2.5 Omni 7B. Prompt Format Use the following prompt to caption audio: Output Format The model generates natural language descriptions covering multiple aspects of the music. Example Output Descriptive Capabilities Musical Styles (Examples) Category Styles Electronic Ambient, Techno, House, Drum & Bass, Synthwave, IDM, Downtempo Rock Alternative, Indie, Post Rock, Pr…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy