APTM 是计算机视觉领域的开源项目,由 Shuyu-XJTU 开发,2023 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 177。
项目仍在小幅维护中,最近一次代码更新于 2026-08-07。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:监控视频中通过文字描述快速定位嫌疑人。同类可对比的替代方案包括 TextReID、LGPR、CFAM。

用自然语言精准找目标人物,多属性提示学习提升检索准确率
APTM 是论文《Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search Benchmark》的官方代码实现,聚焦于文本描述的人物检索任务。该项目构建了一个大规模的多属性与语言搜索基准,旨在解决现有文本-人物检索中属性粒度不足、跨模态对齐困难的问题。核心能力包括:属性提示学习(Attribute-Prompt Learning),通过将属性信息融入提示词增强模型对细粒度特征的感知;图像-文本对齐模块,优化视觉与语言特征的语义匹配;以及利用合成数据扩充训练集,提升模型泛化能力。项目提供完整的训练、评估和推理流程,支持多属性识别与自然语言查询,适用于监控视频检索、智能相册搜索等场景。作为早期开源项目,代码结构清晰,便于研究者复现和二次开发。
TextReID、LGPR、CFAM
APTM 是计算机视觉领域的开源项目,由 Shuyu-XJTU 开发,2023 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 177。
项目仍在小幅维护中,最近一次代码更新于 2026-08-07。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:监控视频中通过文字描述快速定位嫌疑人。同类可对比的替代方案包括 TextReID、LGPR、CFAM。
上一篇:mamma
下一篇:bbox-visualizer
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3