speech-translation
本站收录 11 个带「speech-translation」标签的 AI 开源项目
SpeechSpeech 是一个面向研究人员和开发者的可扩展生成式 AI 框架,专注于大型语言模型、多模态和语音 AI(自动语音识别与文本转语音)。它提供统一的模块化架构,★ 18,524
speech-to-speechspeech-to-speech 是一个构建本地语音代理的开源项目,旨在利用开源模型实现端到端的语音交互。它解决了传统语音助手依赖云端服务、延迟高、隐私风险大等★ 13,350
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974
sokujisokuji 是一款面向双语会议场景的实时双向语音翻译工具,支持自动检测说话语言并双向翻译,可运行于云端或完全离线的本地设备。它提供桌面应用(Windows/m★ 1,356
StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294
my-translatormy-translator 是一款基于 Tauri 的桌面实时语音翻译工具,支持 macOS 和 Windows。它解决的是跨语言实时沟通中的延迟和隐私问题,无★ 1,291
speech_datasetspeech_dataset 是一个面向语音识别(ASR)研究的中文语音数据集仓库,旨在为深度学习语音模型提供训练与评估所需的音频资源。项目整理了多种来源的语音★ 471
echogardenEchogarden 是一个跨平台的语音工具集,既可作为命令行工具使用,也可作为 Node.js 库集成。它整合了多种语音引擎,提供语音合成(TTS)、语音识别★ 452
MooERMooER 是摩尔线程推出的开源全双工语音交互模型,主打端到端的语音到语音(speech-to-speech)对话能力。它解决传统语音助手依赖级联模块(ASR→★ 219
speech-translator-readmeSpeech Translator 是一个实时语音翻译工具,旨在打破语言障碍,让用户能够用母语说话,并即时获得目标语言的语音输出。它解决的是跨语言实时沟通中的效★ 88