voice-ai
本站收录 53 个带「voice-ai」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
voiceboxvoicebox 是一个开源的 AI 语音工作室,旨在提供一站式的声音克隆、语音转写和语音合成能力。它解决了个人开发者和小团队难以高效构建高质量语音 AI 应用★ 55,989
VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464
runanywhere-sdksrunanywhere-sdks 是一个面向生产环境的 C++ 工具包,旨在让 AI 模型在本地设备上高效运行。它解决了云端推理带来的延迟、隐私和成本问题,提供★ 10,318
SenseVoiceSenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音★ 9,408
Vision-AgentsVision-Agents 是 Stream 推出的开源框架,用于快速构建语音与视觉智能体。它解决了开发者需要集成多种模型和视频提供商、并实现低延迟实时交互的痛★ 8,147
audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180
qwen-audio-agentqwen-audio-agent 是一个面向 AI Agent 的实时语音运行时,基于 JavaScript 构建,旨在让智能体不仅会对话,还能在对话过程中持续★ 2,830
Android-MVVM-Architecture-Android-Voice-AI-SDKVoice AI SDK 是一个可复用的 Android 库,旨在帮助开发者快速为应用集成完整的语音驱动 AI 对话能力。它基于 Kotlin 和 MVVM 架★ 2,580
alan-sdk-webAlan AI SDK for Web 是一个为网页应用提供对话式AI能力的开发工具包,它允许开发者通过简单的集成,为网站或Web应用添加语音和文本交互界面。该★ 2,427
alan-sdk-iosAlan AI iOS SDK 是一个将语音对话能力嵌入 iOS 应用的开发工具包,旨在让开发者无需从零构建语音识别、自然语言处理和对话管理,即可快速为 App★ 1,878
alan-sdk-flutterAlan AI 是一个面向 Flutter 应用的对话式 AI 平台 SDK,旨在让开发者通过几行代码为应用集成语音助手和聊天机器人。它解决了应用内自然语言交互★ 1,756
alan-sdk-ionicAlan AI SDK for Ionic 是一个让 Ionic 应用快速获得对话式 AI 能力的官方 SDK。它解决了移动应用内构建复杂语音交互的难题,开发者★ 1,648
better-chatbotBetter Chatbot(原 Navigator)是一个开源的 AI 工作空间,专注于智能体(Agent)、MCP(模型上下文协议)和工作流自动化。它解决的★ 1,183
PatterPatter 是一个开源的语音 AI SDK,旨在成为 Vapi 和 Retell 的替代方案,让开发者能够完全掌控自己的语音代理技术栈。它解决了构建电话语音代★ 1,062
osos 是一个面向企业组织的开源 AI 智能体平台,目标是让团队快速创建并部署可定制的 AI 助手。它支持接入多家大语言模型提供商,避免被单一厂商锁定;提供实时聊★ 807
mossmoss 是一个面向生产环境 AI 系统的检索层,主打闪电般的搜索速度(<10ms),且无需依赖向量数据库。它专为浏览器、边缘设备、端侧和云端场景设计,旨在解决★ 790
vuiVui 是一个实时语音助手框架,基于 WebRTC 流式传输,集成了 faster-whisper 语音识别、本地 LLM(如 Qwen)和 Vui Nano ★ 769
voice-aiRapida 是一个开源的端到端语音 AI 编排平台,旨在帮助开发者快速构建实时对话式语音代理。它解决了语音代理开发中音频流处理、语音识别(STT)、语音合成(★ 737
agentosagentos 是一个用 TypeScript 编写的 AI 智能体框架,旨在解决复杂任务中智能体的记忆、工具使用和多智能体协作问题。它提供了认知记忆能力,让智★ 673
alan-sdk-reactnativeAlan AI SDK for React Native 是一个将语音助手能力集成到 React Native 应用中的开发工具包。它解决了移动应用内缺乏自然语★ 575
joinlyjoinly 是一个让 AI 智能体能够接入会议场景的开源工具,核心目标是解决 AI 无法直接参与实时会议的问题。它通过将会议音频流、转录文本和参与者信息标准化★ 567
FlashLabs-ChromaFlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音对话系统延迟高、音色不自然、无法个性化定制的问题。★ 550
QuickVoiceQuickVoice 是一个开源、可自托管的 AI 电话代理平台,用 TypeScript 与 Python 混合构建。它要解决的问题是:企业想用 AI 自动接★ 489
deepgram-python-sdkDeepgram 的官方 Python SDK,用于快速集成 Deepgram 的语音 AI 服务。它解决了开发者在 Python 应用中接入语音识别(ASR)★ 468
voice-chat-aivoice-chat-ai 是一个开源的 AI 语音对话项目,让你能直接与 AI 进行自然的口语交流。它解决了传统文本交互不够直观的问题,通过集成多种大语言模型★ 466
alan-sdk-pcfAlan AI SDK for Power Apps 是一个将对话式AI能力嵌入微软Power Apps的低代码开发工具包。它通过Power Apps Comp★ 425
Companion-SpaceCompanion-Space 是一个本地优先的二次元 AI 陪伴学习应用,把虚拟角色陪伴与学习工具结合。它解决的是学习时缺乏陪伴感、容易分心,以及云端 AI ★ 363
voiceaivoiceai 是一个面向语音 AI 智能体开发者的精选资源集合,旨在帮助初学者和进阶者快速上手构建实时语音对话系统。它解决了语音 AI 领域资料分散、入门门槛★ 329
openliveopenlive 是一个开源的、设备端运行的语音与视觉交互层,专为 AI 代理设计。它解决了云端语音服务延迟高、成本高、隐私风险大的问题,让开发者可以自由接入任★ 316
saynaSayna 是一个面向 AI Agent 的统一语音层,旨在为现有智能体框架提供无缝的语音交互能力。它解决了 AI Agent 缺乏原生语音输入输出支持的问题,★ 314
VoicEraVoicEra 是一个开源的语音 AI 构建模块,主打电话集成能力,帮助开发者快速搭建可打电话的对话式 AI 智能体。它把实时语音转文字(STT)、文字转语音(★ 313
deepgram-js-sdkDeepgram 官方 JavaScript SDK,用于在浏览器和 Node.js 环境中集成 Deepgram 的语音 AI 服务。它解决开发者快速接入语音★ 274
streamcore-serverstreamcore-server 是一个用 Go 编写的开源实时语音智能体服务器,专注于构建低延迟的语音对话应用。它通过 WebRTC(WHIP)协议提供实时★ 228
aiTelnyx AI 是 Telnyx 官方推出的一站式 AI 代理与开发者工具包,旨在帮助开发者将 AI 能力与电信服务(如语音、短信、SIP、IoT)无缝集成★ 220
evaeva 是一个用于评估语音代理(Voice Agents)的全新端到端框架。它解决的核心问题是:语音代理系统(如语音助手、对话机器人)在真实场景中的表现难以全面★ 220
pyhtpyht 是 PlayHT 官方推出的 Python SDK,用于快速接入其 AI 文本转语音(TTS)与声音克隆 API。它解决了开发者需要将高质量、自然语音★ 218
kokoclonekokoclone 是一个基于 Kokoro TTS 的语音克隆工具,它将语音克隆能力直接集成到 Kokoro 文本转语音引擎中。该项目解决了用户需要自然多语言★ 203
gdansk-aigdansk-ai 是一个全栈语音聊天机器人项目,旨在帮助开发者快速构建具备语音交互能力的 AI 应用。它解决了从语音输入到智能回复再到语音输出的完整链路问题,★ 199
hermes-speechhermes-speech 是一个为 Hermes Agent 设计的语音插件,同时提供 TTS(文本转语音)和 STT(语音转文本)能力。它解决的核心问题是:★ 197
jacobo-workflowsjacobo-workflows 是一个开源的 n8n 工作流集合,来自 Jacobo 多智能体 AI 系统,该系统通过 WhatsApp 和语音渠道提供自动化★ 166
telnyx-code-examplesTelnyx 官方提供的生产级代码示例合集,覆盖其 AI 通信基础设施的 Voice AI、SMS、SIP 和 IoT API。项目旨在帮助开发者快速上手 Te★ 158
neurolinkneurolink 是一个 TypeScript 编写的统一 LLM 接口层,旨在让开发者通过单一 API 对接 24+ 家主流大模型提供商,切换供应商时无需重★ 144
openclaw-voiceopenclaw-voice 是一个开源的、基于浏览器的语音聊天解决方案,专为 AI 助手设计。它解决了 AI 助手缺乏语音交互能力的问题,让用户可以通过语音与★ 126
voiceblendervoiceblender 是一个可编程的语音 AI 平台,基于 Go 语言构建,专注于解决语音通话场景中 AI 能力的集成与编排问题。它通过 REST API、★ 122
ferosferos 是一个开源的语音智能体操作系统,采用 Rust 编写运行时,强调亚秒级延迟和完全自托管。它旨在解决语音交互场景中响应速度慢、依赖云服务、难以定制等问★ 111
murf-python-sdkmurf-python-sdk 是 Murf 文本转语音 API 的 Python 封装库,旨在让开发者通过几行代码快速调用 Murf 的 AI 语音合成能力。★ 108
volocalvolocal 是一个面向 iOS 的完全本地化语音 AI 工具,基于 Swift 和 SwiftUI 构建,利用 Core ML 和 llama.cpp 在设★ 99
jargojargo 是一个基于 Go 语言、以 WebRTC 原生和音频优先的对话式 AI 框架。它解决了在实时语音交互场景中,开发者难以快速集成语音识别(STT)、语★ 98
awesome-ai-news这是一个AI新闻聚合项目,旨在帮助开发者、研究人员和爱好者每月追踪AI领域的重要动态。它解决了信息过载问题,通过人工筛选和整理,将当月最值得关注的AI/LLM资★ 96
deepgram-go-sdkdeepgram-go-sdk 是 Deepgram 语音 AI 平台的官方 Go 语言开发工具包,用于将语音识别(ASR)、语音合成(TTS)和语音代理(Vo★ 90