HermesFlow

一个模型搞定看图说话和文字生图,无缝切换多模态任务

HermesFlow 是一个多模态大语言模型(MLLM)项目,旨在弥合视觉理解与生成之间的鸿沟。它通过统一框架同时支持图像到文本(如描述、问答)和文本到图像(如根据提示生成图片)任务,解决传统模型在理解和生成能力上割裂的问题。核心能力包括多模态对齐、联合训练策略以及高效的推理流程,使模型能在理解与生成间无缝切换。项目基于 Python 实现,代码结构清晰,适合研究多模态统一模型的开发者。目前处于早期阶段,提供基础模型和示例,但完整生态尚在建设中。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 78
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队Gen-Verse
所属国家
官网地址
定价模式free
价格说明开源项目,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型image-to-text,multimodal-generation,multimodal-large-language-models,text-to-image
GitHub 星标★ 78
30天Star增速
HF 下载量
上线时间2025-02-11 00:00:00
最近更新2026-08-31 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 统一框架同时支持理解与生成,减少多模型拼接成本
  • 基于 NeurIPS 2025 论文,方法有学术创新性
  • 代码开源,便于研究者复现和二次开发

不足之处

  • 文档/社区待观察
  • 项目早期,功能完整性和稳定性待验证

适用场景

  • 学术研究:多模态统一模型的理论验证
  • 智能助手:结合视觉问答与图像生成
  • 创意工具:根据文字描述生成配图并理解图像内容

替代项目

LLaVA、MiniGPT-4、Emu

项目介绍

HermesFlow 是开源模型领域的开源项目,由 Gen-Verse 开发,2025 年首次发布。

它收录于开源模型分类,该分类目前共有 424 个项目,GitHub 星标数为 78。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-31。可自行部署使用,无付费版本。

它主要面向的使用场景是:学术研究:多模态统一模型的理论验证。同类可对比的替代方案包括 LLaVA、MiniGPT-4、Emu。

上一篇:unified-generative-zoo

下一篇:Image-Text-Papers

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10