argmax-oss-swift

Mac 上离线跑语音 AI,不联网也能识别和配音

专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私友好,是 iOS 与 macOS 语音应用开发的有力工具。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6377
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队argmaxinc
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,本地部署,完全免费。
访问状态
是否开源是
开源协议MIT
主要语言Swift
技术栈/模型inference,ios,macos,pyannote,qwen3-tts,speaker-diarization,speakerkit,speech-recognition,speech-to-text,swift,text-to-speech,transformers,ttskit,whisper,whisperkit
GitHub 星标★ 6377
30天Star增速
HF 下载量
上线时间2024-01-26 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 15 分钟 部署方式:库/依赖 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • macOS 开发环境与 Xcode(含 Swift 工具链)
  • Apple Silicon 设备(框架面向 Apple 平台端侧推理)
  • 首次拉取模型需要网络,之后可离线运行
  • 熟悉 Swift Package Manager 依赖管理

安装与启动步骤

  1. 1克隆项目仓库

    把仓库拉到本地作为参考,README 未提供 pip/cocoapods 类安装命令,Swift 项目一般通过依赖管理器接入。

    git clone https://github.com/argmaxinc/argmax-oss-swift.git
  2. 2Xcode 中集成

    README 的 Installation 小节列出 Xcode Steps,可在 Xcode 中用 Add Package Dependencies 方式加入该仓库,具体界面步骤请对照仓库文档。

  3. 3声明包依赖

    README 单独列出 Package.swift 小节,说明可在 Swift 包的 Package.swift 中声明依赖;具体版本号与写法请以仓库文件为准。

  4. 4Homebrew 方式

    README 的 Installation 下另有 Homebrew 小节,说明除 SPM 外还提供 Homebrew 安装途径,公式名请查阅仓库文档。

  5. 5选择所需模块

    SDK 内含 WhisperKit(语音转文字)、SpeakerKit(Pyannote 说话人分离)、TTSKit(Qwen-TTS 语音合成),按需求引入对应框架。

  6. 6运行快速示例

    README 为 WhisperKit 提供 Quick Example 小节,先跑通最小示例确认模型可加载,再接入自己的工程。

如何确认成功

工程能编译通过并跑通 WhisperKit 快速示例,控制台输出转写文本或合成音频即表示接入成功。

常见问题

Q:开源版和 Argmax Pro SDK 有什么区别?

A:Pro 版支持带说话人的实时转写、自定义词汇、Argmax Local Server 以及 Android(Kotlin)支持;开源版仅提供 Swift 端侧基础推理能力。

Q:支持 Android 或非 Apple 平台吗?

A:不支持。开源 SDK 基于 Swift,面向 iOS 与 macOS;README 说明 Android 支持在 Argmax Pro SDK Kotlin 中提供。

Q:SDK 是否必须联网?

A:推理在设备本地完成,不依赖云端;但首次加载模型需要下载权重,之后可离线使用。

Q:具体该写什么安装命令和版本号?

A:本次 README 节选只保留了 Installation 标题与子章节名,未包含实际命令与版本,请以仓库最新 README 与 Package.swift 为准。

注意事项

  • README 节选未给出具体命令、版本号与端口,步骤中的接入方式需以仓库最新文档核对。
  • 项目是 Swift 库/框架,不是独立可执行服务,不存在 Docker 或服务端口部署。
  • 需使用 Apple 生态设备与 Xcode 开发环境,非 Apple 平台无法直接使用。
  • Pro 版额外提供实时带说话人转写、自定义词汇与 Argmax Local Server 等功能。

核心亮点

  • 专为Apple Silicon优化,充分利用神经引擎,实现低延迟、高能效的端侧语音AI
  • 集成语音识别、说话人分离和TTS,提供完整的端侧语音处理链路
  • 基于Swift构建,与iOS/macOS生态无缝集成,开发者体验友好

不足之处

  • 仅支持Apple Silicon,限制在非苹果硬件或旧款Mac上使用
  • 依赖pyannote等模型,模型体积和首次加载时间可能较大
  • 文档/社区待观察

适用场景

  • 在iOS/macOS应用中实现离线语音转写和命令控制
  • 构建隐私敏感的语音助手,数据不出设备
  • 多媒体内容自动生成字幕或说话人标记

替代项目

whisper.cpp、Vosk、speech_recognition

项目介绍

argmax-oss-swift 是语音识别领域的开源项目,由 argmaxinc 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(6,377)位列前 8%,在语音识别分类的 212 个项目里位列前 11%。

近 41 天,它的 GitHub 星标从 6,319 增加到 6,377,净增 58。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,本地部署,完全免费。

它主要面向的使用场景是:在iOS/macOS应用中实现离线语音转写和命令控制。同类可对比的替代方案包括 whisper.cpp、Vosk、speech_recognition。

上一篇:espnet

下一篇:sherpa-onnx

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13