speech-to-speech

本站收录 23 个带「speech-to-speech」标签的 AI 开源项目

dograhdograh 是一个开源的语音 AI 平台,旨在作为 Vapi 和 Retell 的自托管替代方案。它解决了企业在部署语音代理时对数据隐私和成本控制的担忧,支持★ 5,774ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180BayLing-SpeechBayLing-Speech(即LLaMA-Omni)是一个基于Llama-3.1-8B-Instruct构建的端到端语音交互模型,旨在实现GPT-4o级别的语★ 3,146ElatoAIElatoAI 是一个面向硬件开发者的实时语音 AI 框架,专注于在 Arduino ESP32 等低功耗微控制器上运行 100 多种语音模型。它解决了传统 A★ 2,024speech-swiftspeech-swift 是一个专为 Apple Silicon 设备打造的 AI 语音工具包,基于 MLX 和 CoreML 框架,提供端侧语音识别(ASR)★ 1,203mlx-audio-swiftmlx-audio-swift 是一个专为 Apple Silicon 设计的模块化 Swift 音频处理 SDK,基于 MLX 框架构建。它解决了在苹果生态中★ 786FlashLabs-ChromaFlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音对话系统延迟高、音色不自然、无法个性化定制的问题。★ 550real-time-voice-translator这是一个桌面应用,利用AI实现跨语言的实时语音翻译,同时保留说话者的音色和情感。它解决的是传统翻译工具无法保留语气和情绪的问题,核心能力包括语音识别、机器翻译和★ 440Freeze-OmniFreeze-Omni 是一个智能且低延迟的语音到语音对话模型,其核心创新在于冻结大语言模型(LLM)参数,仅训练语音编码器和解码器,从而大幅降低训练成本并保持★ 400UltraEval-AudioUltraEval-Audio 是一个面向音频领域的统一评测基准框架,旨在为 ASR(语音识别)、TTS(语音合成)、音频编解码器以及音频大语言模型提供标准化、★ 325youtube-auto-dubyoutube-auto-dub 是一个基于 AI 的 YouTube 视频自动配音流水线工具。它解决了视频内容跨语言传播时人工配音成本高、效率低的问题,能够自★ 304On-Device-Speech-to-Speech-Conversational-AI这是一个纯CPU上运行的实时语音对话系统,实现与AI模型的双向语音交流。它采用连续流式架构,支持即时响应和自然的打断处理,让对话流畅自然。项目整合了语音识别(A★ 257mod_audio_streammod_audio_stream 是一个 FreeSWITCH 模块,用于把通话中的实时音频通过 WebSocket 双向流式传输出去,并接收远端返回的音频或控★ 241MooERMooER 是摩尔线程推出的开源全双工语音交互模型,主打端到端的语音到语音(speech-to-speech)对话能力。它解决传统语音助手依赖级联模块(ASR→★ 219samantha-os1-openai-realtimeSamantha OS1 是一个基于 OpenAI Realtime API 构建的语音对话 AI 助手原型。它利用 speech-to-speech 技术,实★ 199MOSS-SpeechMOSS-Speech 是一个真正的语音到语音(speech-to-speech)大语言模型,无需文本作为中间引导。它直接接收语音输入并生成语音输出,旨在解决传★ 139Vocal-AgentVocal-Agent 是一个基于 Python 的开源级联语音助手框架,它将实时语音识别(Whisper)、AI 推理(Llama)和神经文本转语音(Koko★ 138dsh-voice-ai-girlfriend这是一个面向 DeepSeek Harness(DSH)的语音 AI 女友插件,用 TypeScript 编写。它把语音识别、语音合成和数字人动画串成一条完整的★ 129conversifyconversify 是一个基于 LiveKit 和本地大语言模型(LLM)构建的实时、低延迟 AI 助手,支持语音、视觉和对话记忆功能。它解决了传统语音助手响★ 110personaplex-mlxPersonaPlex-MLX 是 NVIDIA PersonaPlex 全双工语音对话模型在 Apple Silicon 上的 MLX 移植版,旨在让 Mac★ 86vox-servevox-serve 是一个面向 TTS(文本转语音)和 STS(语音转语音)模型的流式原生推理服务引擎,用 Python 编写。它解决了生产环境中部署语音模型时★ 79rtvcrtvc 是一个基于 ElevenLabs API 的实时语音转录与克隆工具,使用 TypeScript 编写。它解决了开发者在应用中集成实时语音交互的需求,提★ 56