voice
本站收录 80 个带「voice」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
agentsagents 是 OpenAI 推出的开源 Python 框架,用于构建实时语音 AI 智能体。它解决的核心问题是:开发者通常需要自己拼接语音识别、大模型推理、★ 14,422
moonshineMoonshine 是一个专为语音代理和语音界面设计的超低延迟语音工具包,集成了语音转文字(STT)、意图识别和文字转语音(TTS)三大核心能力。它解决了传统语★ 11,157
ten-frameworkTEN Framework 是一个面向对话式语音 AI 智能体的开源开发框架,用 Python 编写,主打实时、多模态交互。它要解决的核心问题是:开发者想搭建能★ 11,143
annyangannyang 是一个轻量级的 JavaScript 语音识别库,通过 Web Speech API 为网站添加语音控制能力。它解决了网页端语音交互门槛高、实现★ 6,818
ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770
Android-MVVM-Architecture-Android-Voice-AI-SDKVoice AI SDK 是一个可复用的 Android 库,旨在帮助开发者快速为应用集成完整的语音驱动 AI 对话能力。它基于 Kotlin 和 MVVM 架★ 2,580
alan-sdk-iosAlan AI iOS SDK 是一个将语音对话能力嵌入 iOS 应用的开发工具包,旨在让开发者无需从零构建语音识别、自然语言处理和对话管理,即可快速为 App★ 1,878
alan-sdk-androidAlan AI 是一个面向 Android 应用的对话式 AI 平台,提供完整的语音助手解决方案。开发者通过 Alan Studio 可视化界面设计对话流程,无★ 1,806
alan-sdk-flutterAlan AI 是一个面向 Flutter 应用的对话式 AI 平台 SDK,旨在让开发者通过几行代码为应用集成语音助手和聊天机器人。它解决了应用内自然语言交互★ 1,756
alan-sdk-ionicAlan AI SDK for Ionic 是一个让 Ionic 应用快速获得对话式 AI 能力的官方 SDK。它解决了移动应用内构建复杂语音交互的难题,开发者★ 1,648
voicemodevoicemode 是一个让开发者通过自然语音与 Claude Code 进行对话的开源工具。它解决了在编码过程中频繁切换键盘输入与思考的问题,允许开发者直接说★ 1,385
MToolsMTools 是一款基于 Python 的桌面多功能工具箱,把音视频处理、图片编辑、文本操作和编码工具整合到一个应用里,并内置 AI 增强能力。它想解决的核心问★ 1,352
StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294
vonage-php-sdk-coreVonage PHP SDK Core 是 Vonage(原 Nexmo)官方提供的 PHP 客户端库,用于对接其云通信 REST API。它解决了 PHP 开★ 931
EDDiscoveryEDDiscovery 是专为《精英危险》玩家打造的一款辅助工具,集航行日志记录与 3D 星图于一体。它自动解析游戏生成的日志文件,将玩家的每一次跳跃、探索、贸★ 899
vocalinuxVocalinux 是一款面向 Linux 桌面的免费开源离线语音听写工具,目标是在任何输入框中通过说话完成打字。它基于 whisper.cpp、OpenAI ★ 889
openclaw-nerveOpenClaw Nerve 是 OpenClaw 智能体的实时 Web 控制台,为 AI 代理提供可视化操作界面。它解决的是智能体运行过程中缺乏直观监控和交互★ 869
voxtvoxt 是一个面向 Mac 的本地优先语音输入工具,通过按住说话(hold-to-talk)的方式,将语音实时转换为文本,并自动进行清理、改写、翻译,还能根据★ 852
luelue 是一个运行在终端里的电子书阅读器,核心亮点是集成了高品质的文本转语音(TTS)功能,让用户能在命令行环境中获得类似有声书的阅读体验。它支持 EPUB、P★ 816
TTS-Voice-WizardTTS-Voice-Wizard 是一个面向 VRChat 和 VTuber 的语音转文字再转语音(STTTS)工具。它解决的是虚拟形象无法实时显示说话内容、无★ 809
kokoro-webKokoro Web 是一个基于 Kokoro-82M 模型的开源 AI 文本转语音(TTS)项目,提供在线演示和自托管两种使用方式。它解决了开发者快速集成高质★ 745
MimikaStudioMimikaStudio 是一款面向 macOS(Apple Silicon)的本地优先应用,专注于音频书转换与管理,并集成了 Agentic MCP(模型上下★ 741
stealthstealth 是一个开源的 Ruby 框架,用于构建文本和语音聊天机器人。它旨在简化跨平台对话助手的开发,支持 Alexa、Facebook Messenge★ 598
echokit_serverechokit_server 是一个开源的语音代理平台,基于 Rust 构建,旨在为开发者提供构建语音助手和语音交互应用的完整解决方案。它解决了从语音识别(AS★ 592
alan-sdk-reactnativeAlan AI SDK for React Native 是一个将语音助手能力集成到 React Native 应用中的开发工具包。它解决了移动应用内缺乏自然语★ 575
ollama-voice-macollama-voice-mac 是一个为 Mac 用户打造的语音对话助手,让你通过语音与本地运行的 Ollama 大语言模型自然交流。它解决了在 Mac 上使★ 519
mimic-recording-studioMimic Recording Studio 是一个基于 Docker 的语音样本录制工具,专为 Mycroft 的 Mimic2 TTS(文本转语音)引擎设计★ 517
Neural-Voice-Cloning-With-Few-Samples这是一个基于论文《Neural Voice Cloning With Few Samples》的开源实现,旨在解决少样本语音克隆问题。它通过少量参考音频(甚至几★ 432
alan-sdk-pcfAlan AI SDK for Power Apps 是一个将对话式AI能力嵌入微软Power Apps的低代码开发工具包。它通过Power Apps Comp★ 425
vonage-node-sdkVonage Node.js SDK 是 Vonage 通信平台的官方客户端库,用于在 Node.js 应用中集成短信、语音、文本转语音、号码管理、二次验证(2★ 396
LiveWhisperLiveWhisper 是一个基于 OpenAI Whisper 的近乎实时语音转文字工具,通过 sounddevice 捕获麦克风音频并流式处理,无需修改 W★ 361
kaldi-active-grammarkaldi-active-grammar 是一个基于 Kaldi 的 Python 语音识别封装,核心创新在于支持在解码过程中动态激活或停用语法规则。传统语音识★ 349
NaomiNaomi 是一个开源、技术中立的平台,用于开发常驻后台、支持语音控制的应用程序。它主要面向个人助理和物联网场景,解决了从语音识别到意图处理再到动作执行的完整链★ 302
sapphireSapphire 是一个自托管的 AI 对话助手,定位为“你回家的 AI 伴侣”,主打隐私保护和拟人化陪伴体验。它基于 Python 构建,采用 agentic★ 288
midi2voicemidi2voice 是一个基于 Python 的开源歌声合成工具,旨在将 MIDI 文件直接转换为逼真的人声演唱。它解决了音乐制作中快速生成人声草稿或成品的问★ 286
kittkitt 是一个基于 Go 语言构建的实时语音对话开源项目,它利用 LiveKit 框架让开发者能够快速实现与 ChatGPT 的实时语音交互。该项目解决了传统★ 273
jaicf-kotlinjaicf-kotlin 是一个基于 Kotlin 的对话式 AI 开发框架,旨在简化语音助手和聊天机器人的构建流程。它解决了开发者需要对接多个对话平台(如 A★ 248
TalkifyTalkify 是一个轻量级的 JavaScript 文本转语音(TTS)库,旨在让网页开发者快速为网站添加语音朗读功能。它解决了网页内容无障碍访问和交互体验单★ 244
vonage-ruby-sdk这是 Vonage(原 Nexmo)官方发布的 Ruby 语言 REST API 客户端 SDK,用于快速集成 Vonage 云通信平台。它封装了短信发送、语音★ 221
telegram-chatgpt-bot这是一个基于 Node.js 的 Telegram 机器人,将 ChatGPT 接入 Telegram 聊天界面,支持文本对话、语音聊天和图像生成。它利用 Te★ 208
DictionDiction 是一个用 Go 编写的开源自托管语音转文字方案,定位为 WisprFlow 的替代品,主打 iOS 语音输入键盘。它解决的核心问题是:市面上的语★ 204
chatgpt-talkieaichatgpt-talkieai 是一个基于 ChatGPT 的外语学习应用,核心功能是通过语音与 AI 进行对话练习,并提供语法分析和翻译支持。前端使用 un★ 200
AndroidMaryTTSAndroidMaryTTS 是一个基于 MaryTTS 的离线文本转语音(TTS)引擎,专为 Android 平台打造。它采用 HMM(隐马尔可夫模型)语音合★ 200
voqalvoqal 是一个面向开发者的语音原生 AI 代理,旨在让开发者通过自然语言语音指令来辅助编程工作。它解决了传统编程中需要手动输入代码或文本命令的低效问题,提供★ 193
resemble-unity-text-to-speechResemble Unity Text-to-Speech 是 Resemble AI 官方推出的 Unity 插件,将先进的语音克隆引擎无缝集成到 Unity★ 184
cv-datasetcv-dataset 是 Mozilla Common Voice 语音数据集的元数据与版本管理仓库,用 JavaScript 维护每轮发布的数据清单、校验信息★ 176
cc-beepercc-beeper 是一个为 Claude Code 打造的 macOS 桌面小组件,旨在让开发者在使用 Claude Code 进行编码时,能实时掌握 Cla★ 175
InflectInflect 是一个轻量级、高质量的文本转语音(TTS)模型,旨在以极小的资源占用生成自然流畅的语音。它目前处于积极开发阶段,重点追求快速迭代、优秀的音质和简★ 159
articulate.jsarticulate.js 是一个基于 jQuery 的轻量级插件,利用浏览器原生的 SpeechSynthesis API 实现文字转语音朗读功能。它解决了网★ 138
freeipccfreeipcc 是一个基于 TypeScript 构建的开源智能呼叫中心平台,专注于将传统呼叫中心与 AI 大模型能力深度融合。它解决的是企业客服和电销场景中★ 124