Covo Audio Covo Audio Technical Report 📖 Overview Covo Audio is a 7B parameter end to end large audio language model that directly processes continuous audio inputs and generates audio outputs within a single unified architecture, which is presented in the paper Covo Audio Technical Report. We release Covo Audio Chat in this repository. An Overview of Comprehensive Performance Comparison. Key Features Hierarchical Tri modal Speech Text Interleaving : We propose a framework designed to achieve deep alignment and fusion across modalities and scales. The Tri modal aspect integrates continuous acoustic features, discrete speech tokens, and natural language text within a unified sequence, effectively bridging the gap between high fidelity prosodic nuances and robust semantic structures. Mitigating Intelligence Speaker Coupling : We propose a intelligence speaker decoupling technique that decouples speaker from dialogue intelligence via multi speaker training, then develop a contextual adaptation method to transfer and share high quality TTS voice. Native Full Duplex Voice Interaction : We evolve Covo Audio into Covo Audio Chat FD, a variant with native, low latency full duplex capabili…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy