Android-MVVM-Architecture-Android-Voice-AI-SDK

给 Android 应用几分钟接入语音 AI 对话能力,开箱即用。

Voice AI SDK 是一个可复用的 Android 库,旨在帮助开发者快速为应用集成完整的语音驱动 AI 对话能力。它基于 Kotlin 和 MVVM 架构构建,解决了在 Android 应用中实现语音交互时面临的复杂集成问题,如音频采集、语音识别、意图理解、对话管理及语音合成等。该 SDK 提供开箱即用的语音助手功能,开发者只需简单配置即可在数分钟内为应用添加端到端的语音对话流水线,无需从零搭建底层语音处理和 AI 交互逻辑。核心能力包括语音唤醒、实时语音识别、自然语言处理、多轮对话管理、语音回复生成,并支持自定义扩展以适应不同业务场景。项目代码结构清晰,遵循 MVVM 模式,便于维护和二次开发,适合需要快速落地语音交互的 Android 应用。

开源 free 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2580
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类智能体
开发团队ahmedeltaher
所属国家
定价模式free
价格说明开源Android库,本地部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Kotlin
技术栈/模型ai,ai-agent,android,android-mvvm-architechture,mvvm,mvvm-android,mvvm-architechure,voice,voice-ai,voice-control,voice-recognition-ai
GitHub 星标★ 2580
30天Star增速
HF 下载量
上线时间2016-12-25 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 20 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Kotlin 编写的 Android 应用工程(UI 基于 Jetpack Compose)
  • 已接入 Hilt 依赖注入,可标注 @HiltAndroidApp 与 @AndroidEntryPoint
  • 可用的 Anthropic API Key
  • 设备麦克风与扬声器,用于音频采集与语音播放

安装与启动步骤

  1. 1确认工程前置条件

    README 只给出 Hilt 配置与配置项说明,未提供 Gradle 依赖坐标,需先到仓库或官网确认引入方式再动手。

  2. 2开启 Hilt 应用入口

    在自定义 Application 类上加 @HiltAndroidApp;这是 README Quick Start 中明确给出的 Hilt setup 步骤。

    @HiltAndroidApp
    class MyApp : Application()
  3. 3标记 Activity 入口

    在承载语音交互界面的 Activity 上加 @AndroidEntryPoint,Hilt 才能完成注入;README 示例为 ComponentActivity 子类。

    @AndroidEntryPoint
    class MainActivity : ComponentActivity() { ... }
  4. 4覆盖 VoiceAIConfig

    把 config { } 块传给 VoiceAISDK.Builder 覆盖默认值,anthropicApiKey 为必填;参考 README 配置表填写其他字段。

    config {
        anthropicApiKey = "sk-ant-xxxxxxxx"
        aiModel = "claude-3-5-sonnet-20241022"
    }

关键配置

配置项必填说明示例
anthropicApiKey是Anthropic API Key,所有 AI 轮次使用;禁止硬编码sk-ant-xxxxxxxx
aiModel否用于全部对话轮次的 Claude 模型 IDclaude-3-5-sonnet-20241022
systemPrompt否附加到每次会话前的系统指令You are a helpful voice assistant…
inputMode否HANDS_FREE 开启 VAD 免提;PUSH_TO_TALK 按住才录音HANDS_FREE
piiRedaction否为 true 时在发送给 AI 前抹去电话、邮箱、卡号true
emotionDetectionEnabled否开启语音情绪识别,需用户同意并设置 emotionConsentRationalefalse

如何确认成功

运行应用并授予麦克风权限,对设备说一句话;若能听到 TTS 语音回复,说明 VAD→STT→Claude→TTS 链路已打通。

常见问题

Q:Anthropic API Key 可以直接写进代码吗?

A:不可以。README 明确要求绝不硬编码,应从 BuildConfig 或加密存储中读取。

Q:HANDS_FREE 与 PUSH_TO_TALK 有什么区别?

A:HANDS_FREE 会激活 VAD 自动检测说话,PUSH_TO_TALK 只在按住按钮期间录音。

Q:怎样避免把敏感信息发给 AI?

A:把 piiRedaction 设为 true,SDK 会在转写文本发往 Claude 前移除电话号、邮箱和信用卡号。

Q:为什么一轮识别结束得比较慢?

A:由 silenceTimeoutMs 控制,默认 1200 毫秒,指说话后静音多久才结束该轮 STT。

注意事项

  • README 的 Quick Start 只展示了 Step 2(Hilt setup),缺少 Step 1 的依赖引入说明,请以仓库和官网文档为准。
  • 配置表字段均属于 VoiceAIConfig,通过传给 VoiceAISDK.Builder 的 config { } 块覆盖默认值。
  • 启用 emotionDetectionEnabled 必须先取得用户同意并填写 emotionConsentRationale。
  • certificatePins 只接受 SHA-256 证书指纹,用于 OkHttp 客户端的证书固定。

核心亮点

  • 提供完整的语音对话流水线,集成简单,可快速上线
  • 基于 MVVM 架构,代码结构清晰,易于维护和扩展
  • 支持自定义语音识别和对话逻辑,灵活适配业务需求

不足之处

  • 文档/社区待观察
  • 可能依赖特定语音服务,对离线场景支持有限

适用场景

  • 智能家居控制应用
  • 车载语音助手
  • 无障碍辅助应用

替代项目

Kaldi Android、Picovoice、Dialogflow Android SDK

项目介绍

Android-MVVM-Architecture-Android-Voice-AI-SDK 是语音识别领域的开源项目,由 ahmedeltaher 开发,2016 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,580)位列前 30%,在语音识别分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。开源Android库,本地部署,完全免费。

它主要面向的使用场景是:智能家居控制应用。同类可对比的替代方案包括 Kaldi Android、Picovoice、Dialogflow Android SDK。

上一篇:WhisperLive

下一篇:AriaType

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13