u2Tokenizer

多尺度看懂胸片,自动生成放射报告

u2Tokenizer 是一个面向放射学报告生成(RRG)任务的多尺度多模态大语言模型开源项目。它要解决的问题是:传统放射报告生成模型通常只处理单一尺度图像特征,难以同时捕捉胸片中全局解剖结构与局部病灶细节,导致报告描述不完整或漏诊。项目通过多尺度视觉编码与多模态大语言模型结合,把不同分辨率的影像特征对齐到统一 token 空间,再交由语言模型生成结构化放射报告。核心能力包括多尺度图像特征提取、跨模态对齐、以及针对 RRG 任务优化的生成流程,支持在公开胸部影像数据集上训练与推理。项目以 Python 实现,代码结构围绕多模态大模型展开,适合医学影像与自然语言处理交叉方向的研究者复现和二次开发,也可作为临床辅助报告生成的实验基线。

开源 free 行业应用
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 282
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类行业应用
开发团队Siyou-Li
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型multimodal-large-language-models
GitHub 星标★ 282
30天Star增速
HF 下载量
上线时间2024-11-17 00:00:00
最近更新2026-08-19 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 针对 RRG 任务做多尺度视觉编码,能兼顾全局解剖与局部病灶细节
  • 基于多模态大语言模型,报告生成更接近自然语言表达而非模板拼接
  • 提供完整 Python 实现,便于在公开胸部影像数据集上复现与微调

不足之处

  • 项目处于早期阶段,文档与使用示例可能不够完善
  • 依赖医学影像数据与较大算力,普通开发者上手门槛较高

适用场景

  • 医学影像 AI 研究者复现放射报告生成基线
  • 医院或科研机构探索胸片辅助报告生成
  • 多模态大模型在垂直医疗领域的微调实验

替代项目

LLaVA-Med、Med-PaLM M 相关开源实现、RadFM

项目介绍

u2Tokenizer 是一个行业应用领域的开源项目,官方简介:a multiscale multimodal large language models for radiology report generation (RRG) tasks。项目使用 Python 开发,在 GitHub 上获得 282 星标。

上一篇:GenSim

下一篇:awesome-LLM-AIOps

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 101 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 668 2026-08-13