openai-edge-tts

免费替代 OpenAI TTS,一键部署,秒变语音合成 API

openai-edge-tts 是一个免费、高质量的文本转语音(TTS)API 端点,旨在作为 OpenAI、Azure 或 ElevenLabs 等付费 TTS 服务的替代方案。它基于微软 Edge 浏览器的内置 TTS 引擎(edge-tts),通过封装成 OpenAI 兼容的 API 接口,让开发者可以无缝替换原有的 TTS 服务,而无需修改太多代码。项目解决了付费 TTS 服务成本高、接入复杂的问题,提供了简单、快速、高质量的语音合成能力。核心能力包括:支持多种语言和声音(如中文、英文等),可调节语速、音调等参数,输出标准 MP3 音频流,并兼容 OpenAI 的 API 格式,方便集成到现有 AI 应用、聊天机器人或自动化流程中。项目用 Python 编写,部署简单,适合个人开发者和小型团队快速搭建自己的 TTS 服务。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2112
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队travisvn
所属国家
定价模式free
价格说明完全免费,提供高质量文本转语音 API 端点,无付费版本。
访问状态
是否开源是
开源协议GPL-3.0
主要语言Python
技术栈/模型ai,azure,chatgpt,claude,edge-tts,elevenlabs,gpt,llm,llm-webui,llms,local-llm,ollama,ollama-webui,open-webui,openai,self-hosted,speech,text-to-speech,tts
GitHub 星标★ 2112
30天Star增速
HF 下载量
上线时间2024-10-09 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:Docker 7 步

环境要求

  • Docker(使用 Docker / Docker Compose 方式时必须)
  • Python 与 pip(使用 Python 本地运行方式时必须)
  • 可访问微软 Edge 在线 TTS 服务的网络(edge-tts 依赖在线服务)

安装与启动步骤

  1. 1直接启动容器

    最快的方式,使用默认配置在 5050 端口启动服务,无需克隆代码。

    docker run -d -p 5050:5050 travisvn/openai-edge-tts:latest
  2. 2克隆项目代码

    需要自定义配置或本地构建时,先拉取仓库并进入目录。

    git clone https://github.com/travisvn/openai-edge-tts.git
    cd openai-edge-tts
  3. 3生成配置文件

    复制默认配置为 .env,再按需修改 API_KEY、PORT、默认声音等。

    cp .env.example .env
  4. 4Compose 启动服务

    推荐的本地运行方式,加 -d 可后台运行,不占用终端。

    docker compose up -d
  5. 5本地构建镜像

    不用 Compose 时,先构建镜像再用 --env-file 加载 .env 启动。

    docker build -t openai-edge-tts .
    docker run -d -p 5050:5050 --env-file .env openai-edge-tts
  6. 6启用 ffmpeg 支持

    默认镜像不含 ffmpeg,非 MP3 格式转换需开启该构建参数。

    INSTALL_FFMPEG_ARG=true docker compose up --build
  7. 7Python 方式运行

    建议先建虚拟环境,安装依赖后启动服务,同样监听 5050 端口。

    pip install -r requirements.txt
    python app/server.py

关键配置

配置项必填说明示例
API_KEY是调用接口时 Bearer 校验用的密钥sk-xxxxxxxx
PORT是服务监听端口,默认 50505050
DEFAULT_VOICE否默认语音,可填任意 edge-tts 声音名en-US-AvaNeural
DEFAULT_RESPONSE_FORMAT否默认输出音频格式,如 mp3、wavmp3
DEFAULT_SPEED否默认语速,范围 0.25x 至 4.0x1.0
REQUIRE_API_KEY否是否强制校验请求中的 API KeyTrue

如何确认成功

访问 http://localhost:5050 能连通,且 POST /v1/audio/speech 能返回音频即成功。

常见问题

Q:这个服务需要付费或申请密钥吗?

A:不需要。它基于 edge-tts 调用微软 Edge 在线 TTS,完全免费;API_KEY 只是你自己接口的访问口令。

Q:为什么 wav、opus、flac 等格式转换失败?

A:默认镜像未安装 ffmpeg。可用 INSTALL_FFMPEG_ARG=true 本地构建,或改用 latest-ffmpeg 版镜像。

Q:能换端口吗?

A:可以。在 .env 中修改 PORT,并同步调整 docker run 的端口映射与调用地址。

Q:支持哪些声音?

A:内置 alloy、echo、fable、onyx、nova、shimmer 映射,也可直接指定任意 edge-tts 声音名。

Q:如何做流式语音输出?

A:请求时设置 stream_format 为 sse,服务会通过 SSE 分片推送 base64 音频数据。

注意事项

  • Windows 与 Linux 均可运行,Docker 方式需要能拉取镜像。
  • 不装 ffmpeg 时仅建议使用 MP3 输出格式。
  • SSE 流式示例中需把 Authorization 换成你自己的 API_KEY。
  • edge-tts 依赖微软在线服务,离线环境不可用。

核心亮点

  • 完全免费,无需 API key,直接调用 Edge 的 TTS 引擎,成本为零
  • API 兼容 OpenAI 格式,可无缝替换现有 TTS 服务,迁移成本低
  • 支持多语言和丰富声音选择,输出音质自然,接近真人

不足之处

  • 依赖微软 Edge 服务,可能受网络或地区限制,稳定性不如商业 API
  • 文档/社区待观察,项目较新,生态和示例较少

适用场景

  • 为聊天机器人或 AI 助手添加语音回复功能,节省 TTS 费用
  • 批量生成语音内容,如播客、有声书,无需付费服务
  • 在本地或私有化部署中,作为离线 TTS 服务替代云端 API

替代项目

edge-tts、Coqui TTS、Piper TTS

项目介绍

openai-edge-tts 是音频音乐领域的开源项目,由 travisvn 开发,2024 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(2,112)位列前 30%,在音频音乐分类的 738 个项目里位列前 10%。

近 42 天,它的 GitHub 星标从 2,037 增加到 2,112,净增 75。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。完全免费,提供高质量文本转语音 API 端点,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:为聊天机器人或AI助手添加语音回复功能,节省TTS费用。同类可对比的替代方案包括 edge-tts、Coqui TTS、Piper TTS。

上一篇:WaveRNN

下一篇:RHVoice

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09