audio-generation
22 个项目 · ⭐ 109.2kMulti-lingual large voice generation model, providing inference, training and deployment full-stack ability.
YuE: Open Full-song Music Generation Foundation Model, something similar to Suno.ai but open
A framework for efficient model inference with omni-modality models
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!
Audio generation using diffusion models, in PyTorch.
Self-host the powerful Chatterbox TTS model. This server offers a user-friendly Web UI, flexible API endpoints (incl. OpenAI compatible), predefined voices, voice cloning, and large audiobook-scale text processing. Runs accelerated on NVIDIA (CUDA), AMD (ROCm), and CPU.
SGLang-Omni empowers high-performance serving for TTS, ASR, speech and omni models.
Flatkey media generation CLI for images, videos, audio, text, credits, and model discovery.
Easy fine-tuning for Qwen3-TTS: Fast voice cloning and high-quality multilingual speech synthesis.
共 22 条 · 第 1 / 2 页