AViD 是模型训练领域的开源项目,由 levyflux 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 516 个项目,GitHub 星标数为 606。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-08-30。开源免费,需自行部署。
它主要面向的使用场景是:在医疗影像上微调模型,按报告描述定位病灶区域。同类可对比的替代方案包括 OpenGroundingDino、MMGroundingDINO。

用自定义数据微调视觉定位模型,省去搭训练管线
AViD 是一个面向视觉语言定位(visual grounding)模型的微调框架,目标用户是需要在自定义数据集上训练或适配 grounding 模型的研究者与工程师。视觉语言定位任务要求模型根据自然语言描述在图像中定位目标区域,但通用预训练模型往往在特定领域(如医疗影像、工业质检、遥感)表现不佳,而现有微调代码通常与特定模型架构强耦合、数据处理流程不统一。AViD 提供了统一的数据组织与训练流程,支持在用户自有标注数据上对 grounding 模型进行微调,涵盖数据加载、模型适配、训练循环与评估等环节,降低从零搭建训练管线的成本。项目以 Python 实现,处于早期阶段,适合作为二次开发的起点,而非开箱即用的成熟产品。
OpenGroundingDino、MMGroundingDINO
AViD 是模型训练领域的开源项目,由 levyflux 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 516 个项目,GitHub 星标数为 606。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-08-30。开源免费,需自行部署。
它主要面向的使用场景是:在医疗影像上微调模型,按报告描述定位病灶区域。同类可对比的替代方案包括 OpenGroundingDino、MMGroundingDINO。
上一篇:physicsnemo
下一篇:BloomBee
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···