asr
215 个项目 · ⭐ 227.7kAn open source chat bot architecture for voice/vision (and multimodal) assistants, local(CPU/GPU bound) and remote(I/O bound) to run.
Privacy-conscious, open-source AI voice typing for Windows.
Speech Recognition model based off of FAIR research paper built using Pytorch.
极简语音输入法,利用豆包 Web 语音识别实现全局听写。支持 macOS 、Windows 与 Linux/SteamOS(Steam Deck 手柄一键语音输入)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
AI Speech Solutions for Tasks such as ASR, Vocal Extraction, Accompaniment Extraction, Audio Denoising, and Enhancement, Support models such as paraformer, sensevoice, fireredasr, zipformer, moonshine, wenet, whisper, fsmn-vad, silero-vad, CT Transformer punc, Spleeter, Uvr5, etc, apply ONNX models in various scenarios.
whisper-cpp-serve Real-time speech recognition and c+ of OpenAI's Whisper model in C/C++
Taiwan Tongues ASR CE 是一個開源語音辨識(Automatic Speech Recognition, ASR)模型專案,專為台灣多元語言環境設計。 本模型支援 國語、台語、客語與英語,提供本地多語混合語音辨識,讓開發者與資訊服務業者可運用此開源模型進行 ASR 模型訓練、微調與發展在地化應用,以低成本、高效率進行 ASR 語音應用落地與智慧服務創新。 本專案為數位發展部數位產業署「114年數位產業跨域軟體基盤系統建置案」之實證成果之一,旨在推動台灣語音技術開源生態,協助資訊服務業者強化智慧應用能量,落實在地 AI 技術自主發展,由台灣大哥大執行與維護。
Turn raw footage into brand-ready, platform-optimized video with one command. Local-first: FFmpeg + WhisperX/MLX + Ollama.
共 215 条 · 第 7 / 11 页