MGM-Omni

让语音大模型记住你的声音,长对话也能个性化陪伴

MGM-Omni 是一个面向个性化长时语音交互的多模态大语言模型(Omni LLM)开源项目。它解决的是现有语音大模型在长时间对话中缺乏个性化、语音与文本模态对齐不佳的问题。其核心能力包括:支持文本与语音的联合理解与生成,可处理长达数分钟的连续语音输入;通过引入说话人嵌入(speaker embedding)实现个性化音色与说话风格定制;基于大规模语音-文本数据预训练,提升跨模态语义对齐精度。项目采用Python实现,技术栈涵盖音频语言模型、多模态大模型、文本转语音(TTS)等,旨在为下一代语音助手、实时翻译、有声内容生成等场景提供统一的模型基座。目前处于早期阶段(GitHub 205星),代码和模型权重已开放,但文档和生态尚在完善中。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 204
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队JIA-Lab-research
所属国家
官网地址
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-language-model,multi-modal-large-language-model,multi-modality,multimodal,text-to-speech
GitHub 星标★ 204
30天Star增速
HF 下载量
上线时间2025-08-17 00:00:00
最近更新2026-09-13 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 首创将说话人嵌入融入Omni LLM,实现个性化音色与风格的长时语音生成
  • 支持文本+语音联合输入输出,覆盖理解与生成全链路,减少模态转换损耗
  • 开源代码与模型权重,基于主流LLM架构(如Qwen)扩展,便于二次开发

不足之处

  • 早期项目,文档和社区支持待观察
  • 模型参数量与推理资源需求较高,个人开发者部署门槛不低

适用场景

  • 开发个性化语音助手(如陪伴型AI、虚拟主播)
  • 构建多语言实时语音翻译与同传系统
  • 为有声书、播客等长音频内容生成定制化配音

替代项目

Qwen-Audio、SpeechGPT、Mini-Omni

项目介绍

MGM-Omni 是开源模型领域的开源项目,由 JIA-Lab-research 开发,2025 年首次发布。

它收录于开源模型分类,该分类目前共有 424 个项目,GitHub 星标数为 204。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-13。从国内网络环境看,可用性暂无实测数据。

它主要面向的使用场景是:开发个性化语音助手(如陪伴型AI、虚拟主播)。同类可对比的替代方案包括 Qwen-Audio、SpeechGPT、Mini-Omni。

上一篇:magvit2-pytorch

下一篇:mongolian-nlp

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10