
u2Tokenizer
多尺度看懂胸片,自动生成放射报告
u2Tokenizer 是一个面向放射学报告生成(RRG)任务的多尺度多模态大语言模型开源项目。它要解决的问题是:传统放射报告生成模型通常只处理单一尺度图像特征,难以同时捕捉胸片中全局解剖结构与局部病灶细节,导致报告描述不完整或漏诊。项目通过多尺度视觉编码与多模态大语言模型结合,把不同分辨率的影像特征对齐到统一 token 空间,再交由语言模型生成结构化放射报告。核心能力包括多尺度图像特征提取、跨模态对齐、以及针对 RRG 任务优化的生成流程,支持在公开胸部影像数据集上训练与推理。项目以 Python 实现,代码结构围绕多模态大模型展开,适合医学影像与自然语言处理交叉方向的研究者复现和二次开发,也可作为临床辅助报告生成的实验基线。
项目数据
使用教程
核心亮点
- 针对 RRG 任务做多尺度视觉编码,能兼顾全局解剖与局部病灶细节
- 基于多模态大语言模型,报告生成更接近自然语言表达而非模板拼接
- 提供完整 Python 实现,便于在公开胸部影像数据集上复现与微调
不足之处
- 项目处于早期阶段,文档与使用示例可能不够完善
- 依赖医学影像数据与较大算力,普通开发者上手门槛较高
适用场景
- 医学影像 AI 研究者复现放射报告生成基线
- 医院或科研机构探索胸片辅助报告生成
- 多模态大模型在垂直医疗领域的微调实验
替代项目
LLaVA-Med、Med-PaLM M 相关开源实现、RadFM
项目介绍
上一篇:GenSim
同类项目推荐
xmgai-like
开源
换脸、艺术二维码随手玩,副业灵感一包带走。
本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···
DDC_Skills_for_AI_Agents_in_Cons···
开源
给建筑AI装上221个专业技能,让Claude秒变工地专家
221 AI skills for construction: BIM analysis, cost estimation, scheduling, document ···
spoken-to-signed-translation
开源
把口语文本一路转成手语视频的流水线
a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation
LiveTranslate
开源
直播看片实时翻译,字幕秒出,跨语言无压力
Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···