mlx-audio

苹果设备本地搞定语音,转文字、换声音一步到位

基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,为 Mac 用户提供流畅、私密的本地语音处理体验。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 7931
维护状态 活跃
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队Blaizzy
所属国家
定价模式free
价格说明开源库,MIT 许可证,完全免费,需自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型apple-silicon,audio-processing,mlx,multimodal,speech-recognition,speech-synthesis,speech-to-text,text-to-speech,transformers
GitHub 星标★ 7931
30天Star增速
HF 下载量
上线时间2024-11-27 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Apple Silicon 芯片的 Mac(M 系列芯片),MLX 针对苹果芯片优化
  • Python 环境(使用 pip 安装)
  • 可选:uv 工具(仅安装命令行工具时使用)
  • 可选:ffmpeg(保存 MP3/FLAC/OGG/Opus/Vorbis 格式时需要)

安装与启动步骤

  1. 1确认硬件环境

    mlx-audio 基于 Apple 的 MLX 框架,只能在 Apple Silicon(M 系列芯片)设备上运行,请先确认你的 Mac 属于该范围。

  2. 2用 pip 安装

    标准安装方式,会把 mlx-audio 作为 Python 库装入当前环境,适合在 Python 项目中调用。

    pip install mlx-audio
  3. 3用 uv 装命令行

    uv tool 方式只安装命令行工具,且不加 --prerelease=allow 会装不到预发布版本。

    uv tool install --force mlx-audio --prerelease=allow
  4. 4uv 装 GitHub 最新代码

    想体验仓库最新功能而非 PyPI 发布版时,用 git+ 地址直接从 GitHub 安装。

    uv tool install --force git+https://github.com/Blaizzy/mlx-audio.git --prerelease=allow
  5. 5安装 ffmpeg

    README 明确说明保存 MP3、FLAC、OGG、Opus、Vorbis 格式必须依赖 ffmpeg,仅存 WAV 可跳过;具体命令原文未给出,请按各自系统方式安装。

如何确认成功

执行 pip show mlx-audio 能看到包名与版本号,或 uv tool list 中列出 mlx-audio,即表示安装成功。

常见问题

Q:支持 Windows 或 Linux 吗?

A:不支持。项目基于 Apple 的 MLX 框架,专为 Apple Silicon(M 系列芯片)优化,非苹果芯片平台无法运行。

Q:无法导出 MP3、FLAC 等格式怎么办?

A:这些压缩格式依赖 ffmpeg 编码,请先安装 ffmpeg;不装的话只能保存 WAV 等未压缩格式。

Q:pip 和 uv 两种安装方式怎么选?

A:pip 安装的是完整 Python 库,便于在代码中调用;uv tool 只安装命令行工具,--prerelease=allow 用于允许安装预发布版本。

Q:怎么用仓库最新代码而不是 PyPI 版本?

A:使用带 git+ 前缀的安装命令:uv tool install --force git+https://github.com/Blaizzy/mlx-audio.git --prerelease=allow。

注意事项

  • 项目面向 Apple Silicon 设备,Intel Mac 与其他平台不在支持范围内。
  • 建议在 Python 虚拟环境或虚拟工具环境中安装,避免污染系统环境。
  • 安装完成后可参考 README 的 Quick Start、Supported Models 与 Model Examples 章节了解文本转语音、语音转文本等用法。
  • 项目提供交互式 Web 界面与 OpenAI 兼容的 REST API 服务,还支持 3/4/6/8-bit 量化以降低内存占用,具体用法见 README 对应章节。

核心亮点

  • 基于Apple MLX框架深度优化,充分利用Apple Silicon统一内存与神经网络加速器,推理效率显著优于通用PyTorch方案
  • 一站式覆盖TTS、STT、STS三大语音任务,API设计统一,降低多模型集成成本
  • 支持多种主流语音模型(如Whisper、SpeechT5等)的MLX移植版本,模型加载与转换流程简化

不足之处

  • 仅支持Apple Silicon芯片,无法在NVIDIA GPU或普通x86服务器上运行,生态封闭
  • 项目处于快速迭代期,API稳定性与文档完善度可能随版本变动,需关注版本迁移成本
  • 文档/社区待观察

适用场景

  • 在Mac上本地运行高隐私要求的语音转写与会议纪要生成
  • 为macOS/iOS应用集成离线语音助手或实时字幕功能
  • 快速原型验证语音多模态模型在Apple设备上的性能表现

替代项目

whisper.cpp、Coqui TTS、SpeechBrain

项目介绍

mlx-audio 是音频音乐领域的开源项目,由 Blaizzy 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(7,931)位列前 6%,在音频音乐分类的 738 个项目里位列前 4%。

近 44 天,它的 GitHub 星标从 7,699 增加到 7,931,净增 232。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源库,MIT 许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:在Mac上本地运行高隐私要求的语音转写与会议纪要生成。同类可对比的替代方案包括 whisper.cpp、Coqui TTS、SpeechBrain。

上一篇:vits

下一篇:MeloTTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09