APTM

用自然语言精准找目标人物,多属性提示学习提升检索准确率

APTM 是论文《Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search Benchmark》的官方代码实现,聚焦于文本描述的人物检索任务。该项目构建了一个大规模的多属性与语言搜索基准,旨在解决现有文本-人物检索中属性粒度不足、跨模态对齐困难的问题。核心能力包括:属性提示学习(Attribute-Prompt Learning),通过将属性信息融入提示词增强模型对细粒度特征的感知;图像-文本对齐模块,优化视觉与语言特征的语义匹配;以及利用合成数据扩充训练集,提升模型泛化能力。项目提供完整的训练、评估和推理流程,支持多属性识别与自然语言查询,适用于监控视频检索、智能相册搜索等场景。作为早期开源项目,代码结构清晰,便于研究者复现和二次开发。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 177
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类计算机视觉
开发团队Shuyu-XJTU
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型attribute-prompt-learning,image-text-alignment,multi-attribute-recognition,synthetic-data,text-based-person-retrieval
GitHub 星标★ 177
30天Star增速
HF 下载量
上线时间2023-06-19 00:00:00
最近更新2026-08-07 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

核心亮点

  • 创新性地引入属性提示学习,显著提升细粒度人物特征匹配精度
  • 提供大规模多属性与语言搜索基准,填补该领域公开数据集空白
  • 包含合成数据生成流程,有效缓解真实标注数据稀缺问题

不足之处

  • 项目处于早期阶段,文档和社区支持待观察
  • 依赖特定数据集和预训练模型,复现环境配置门槛较高

适用场景

  • 监控视频中通过文字描述快速定位嫌疑人
  • 智能相册中按自然语言描述检索特定人物照片
  • 跨摄像头人物追踪中的文本辅助查询

替代项目

TextReID、LGPR、CFAM

项目介绍

APTM 是计算机视觉领域的开源项目,由 Shuyu-XJTU 开发,2023 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 177。

项目仍在小幅维护中,最近一次代码更新于 2026-08-07。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:监控视频中通过文字描述快速定位嫌疑人。同类可对比的替代方案包括 TextReID、LGPR、CFAM。

上一篇:mamma

下一篇:bbox-visualizer

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14