MGM-Omni 是开源模型领域的开源项目,由 JIA-Lab-research 开发,2025 年首次发布。
它收录于开源模型分类,该分类目前共有 424 个项目,GitHub 星标数为 204。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-13。从国内网络环境看,可用性暂无实测数据。
它主要面向的使用场景是:开发个性化语音助手(如陪伴型AI、虚拟主播)。同类可对比的替代方案包括 Qwen-Audio、SpeechGPT、Mini-Omni。

让语音大模型记住你的声音,长对话也能个性化陪伴
MGM-Omni 是一个面向个性化长时语音交互的多模态大语言模型(Omni LLM)开源项目。它解决的是现有语音大模型在长时间对话中缺乏个性化、语音与文本模态对齐不佳的问题。其核心能力包括:支持文本与语音的联合理解与生成,可处理长达数分钟的连续语音输入;通过引入说话人嵌入(speaker embedding)实现个性化音色与说话风格定制;基于大规模语音-文本数据预训练,提升跨模态语义对齐精度。项目采用Python实现,技术栈涵盖音频语言模型、多模态大模型、文本转语音(TTS)等,旨在为下一代语音助手、实时翻译、有声内容生成等场景提供统一的模型基座。目前处于早期阶段(GitHub 205星),代码和模型权重已开放,但文档和生态尚在完善中。
Qwen-Audio、SpeechGPT、Mini-Omni
MGM-Omni 是开源模型领域的开源项目,由 JIA-Lab-research 开发,2025 年首次发布。
它收录于开源模型分类,该分类目前共有 424 个项目,GitHub 星标数为 204。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-13。从国内网络环境看,可用性暂无实测数据。
它主要面向的使用场景是:开发个性化语音助手(如陪伴型AI、虚拟主播)。同类可对比的替代方案包括 Qwen-Audio、SpeechGPT、Mini-Omni。
上一篇:magvit2-pytorch
下一篇:mongolian-nlp
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
awesome-ltx2
开源
找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。
All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy