markup

AI辅助文档标注,主动学习减少人工成本

markup 是一个基于网页的文档标注工具,利用 AI 技术(如 GPT-4)辅助数据标注。它主要解决机器学习项目中数据标注效率低、成本高的问题,尤其针对自然语言处理任务,如命名实体识别等。核心能力包括:提供直观的网页界面进行文档标注,支持主动学习策略,让模型参与标注过程,优先标注对模型提升最大的样本,从而减少人工标注量。该工具面向数据科学家和机器学习工程师,旨在加速高质量数据集的构建,推动模型迭代。

开源 freemium 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 269
维护状态 较活跃
是否开源 是
定价模式 freemium

项目预览

项目数据

分类数据集
开发团队samueldobbie
所属国家
定价模式freemium
价格说明提供免费版本,高级功能需付费,具体定价待确认
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型active-learning,annotation-tool,data-labeling,data-science,machine-learning,named-entity-recognition,natural-language-processing,ner,nlp,sequence-to-sequence,text-annotation,text-annotation-tool
GitHub 星标★ 269
30天Star增速
HF 下载量
上线时间2019-02-21 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-24
浏览次数5

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 集成GPT-4等AI模型,自动预标注,显著提升标注效率
  • 采用主动学习策略,智能筛选高价值样本,减少人工标注量
  • 基于网页,无需安装,易于协作和部署

不足之处

  • 项目处于早期阶段,功能可能不够完善
  • 文档和社区生态待观察

适用场景

  • NLP数据集构建,如命名实体识别标注
  • 机器学习项目中的快速数据标注与迭代
  • 需要AI辅助预标注的文档处理工作流

替代项目

Label Studio、Prodigy、Doccano

项目介绍

markup 是数据集领域的开源项目,由 samueldobbie 开发,2019 年首次发布。

它收录于数据集分类,该分类目前共有 297 个项目,GitHub 星标数为 269。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-24。提供免费版本,高级功能需付费,具体定价。从国内网络环境看,可直接访问。

它主要面向的使用场景是:NLP数据集构建,如命名实体识别标注。同类可对比的替代方案包括 Label Studio、Prodigy、Doccano。

上一篇:fastdup

下一篇:GTSinger

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10608 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1650 2026-09-20
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3409 2026-08-10