tokenize-anything

一个模型,提示任意视觉概念,统一分割与识别

Tokenize Anything via Prompting 是一个来自 ECCV 2024 的视觉模型,旨在通过统一的提示框架将任意视觉概念(如物体、区域、分割掩码)转化为可学习的 token。它解决了传统视觉模型只能处理单一任务(如分类或分割)的局限,让一个模型同时支持图像级、区域级和像素级的理解与生成。核心能力包括:基于文本或点提示的通用分割、可泛化的开放词汇识别,以及将视觉特征映射到语言模型可用的 token 空间,从而支持多模态交互。项目代码基于 Jupyter Notebook 提供演示,适合研究语义分割、多模态理解和视觉提示学习。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 600
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队baaivision
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可自由使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型foundation-models,multimodal,promptable,representation-learning
GitHub 星标★ 600
30天Star增速
HF 下载量
上线时间2023-12-14 00:00:00
最近更新2026-07-30 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 统一了分割、识别和生成任务,减少多模型拼接成本
  • 支持文本和点等多种提示方式,交互灵活
  • 基于 ECCV 2024 论文,方法有学术背书

不足之处

  • 项目处于早期,文档和示例覆盖有限
  • 依赖特定预训练权重,复现门槛较高

适用场景

  • 多模态视觉理解研究(如统一分割与识别)
  • 基于提示的交互式图像编辑工具
  • 开放词汇目标检测与分割原型开发

替代项目

SEEM (Segment Everything Everywhere)、SAM (Segment Anything Model)、X-Decoder

项目介绍

tokenize-anything 是计算机视觉领域的开源项目,由 baaivision 开发,2023 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 600。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-30。Apache-2.0许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:多模态视觉理解研究(如统一分割与识别)。同类可对比的替代方案包括 SEEM (Segment Everything Everywhere)、SAM (Segment Anything Model)、X-Decoder。

上一篇:EmerNeRF

下一篇:Groma

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09