FlashLabs-Chroma

实时语音对话+声音克隆,几秒复刻你的音色

FlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音对话系统延迟高、音色不自然、无法个性化定制的问题。核心能力包括:端到端建模(从文本/音频直接生成语音,无需中间步骤)、实时低延迟交互、以及基于少量样本的声音克隆(用户只需提供几秒音频即可复制音色)。项目基于 Jupyter Notebook 开发,适合研究者和开发者快速上手,用于构建高自然度的语音助手、虚拟角色等应用。目前项目处于早期阶段,代码和文档正在完善中。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 550
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队FlashLabs-AI-Corp
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可,可免费本地部署使用,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型audio-language-model,end-to-end,real-time-audio,speech-to-speech,streaming-audio,voice-ai,voice-cloning,zero-shot-voice
GitHub 星标★ 550
30天Star增速
HF 下载量
上线时间2025-11-13 00:00:00
最近更新2026-09-09 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 端到端架构,延迟低,对话流畅自然
  • 支持个性化声音克隆,只需少量样本即可复刻音色
  • 开源且提供 Notebook 示例,上手门槛低

不足之处

  • 项目处于早期阶段,文档和社区生态待完善
  • 依赖特定硬件(如GPU),部署成本较高

适用场景

  • 构建高自然度的语音助手或客服机器人
  • 为虚拟主播、游戏角色提供个性化语音
  • 用于语音交互研究,探索端到端模型

替代项目

ChatTTS、OpenVoice、XTTS

项目介绍

FlashLabs-Chroma 是音频音乐领域的开源项目,由 FlashLabs-AI-Corp 开发,2025 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 550。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-09。Apache-2.0许可,可免费本地部署使用,无在线服务。

它主要面向的使用场景是:构建高自然度的语音助手或客服机器人。同类可对比的替代方案包括 ChatTTS、OpenVoice、XTTS。

上一篇:lalalai

下一篇:AceForge

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09