FlowInOne

把多模态生成统一成图像进图像出,一个模型搞定文本、音频到图像

FlowInOne 是一个基于流匹配(Flow Matching)的统一多模态生成框架,由 ECCV 2026 论文官方开源。它创新性地将文本、图像、音频等多种模态的生成任务统一为“图像进、图像出”的视觉中心范式,即所有输入模态先编码为图像表示,再通过流匹配模型生成目标图像。该框架解决了传统多模态生成中需要为每种模态单独设计模型、训练成本高且难以跨模态协同的问题。核心能力包括:支持文本到图像、图像编辑、音频到图像等多任务统一建模,基于视觉中心表示实现模态对齐,以及利用流匹配的稳定训练特性提升生成质量。项目代码基于 Python 实现,提供完整的训练与推理流程,适合研究多模态统一生成和流匹配技术的开发者使用。目前项目处于早期阶段,星标数较少,但技术路线新颖,具有较高的研究价值。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 121
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队CSU-JPG
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型flowmatching,image-generation,vision-centric
GitHub 星标★ 121
30天Star增速
HF 下载量
上线时间2026-03-28 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 创新性地统一多模态生成任务为图像进图像出范式,简化模型设计
  • 基于流匹配技术,训练稳定且生成质量高
  • 官方论文开源,代码结构清晰,便于复现和二次开发

不足之处

  • 项目处于早期阶段,文档和社区支持待观察
  • 统一视觉中心表示可能对非视觉模态信息有损,需验证复杂场景效果

适用场景

  • 学术研究:探索多模态统一生成的新范式
  • 多模态内容创作:从文本或音频生成对应图像
  • 跨模态转换:如音频可视化、图像编辑等

替代项目

Stable Diffusion、Imagen、UniDiffuser

项目介绍

FlowInOne 是图像领域的开源项目,由 CSU-JPG 开发,是 2026 年新上线的项目。

它收录于图像分类,该分类目前共有 839 个项目,GitHub 星标数为 121。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:学术研究:探索多模态统一生成的新范式。同类可对比的替代方案包括 Stable Diffusion、Imagen、UniDiffuser。

上一篇:ImageLens

下一篇:ComfyUI-ShaderNoiseKSampler

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09