aisheets

像用表格一样批量调 AI,不写代码就能造和改数据集

aisheets 是一个基于 TypeScript 的开源工具,让用户无需编写代码即可用 AI 模型构建、丰富和转换数据集。它把表格界面与 LLM 能力结合,用户可以在类似电子表格的环境中批量调用 AI 模型,对数据进行生成、清洗、分类、翻译、摘要等操作。核心能力包括:通过自然语言指令批量处理行数据、用 AI 生成合成数据、对 LLM 输出做评估与对比、以及把非结构化文本转为结构化字段。它解决的是数据准备和标注环节中重复劳动多、脚本门槛高的问题,适合需要快速迭代数据集的产品、运营和研究人员。项目用 TypeScript 实现,技术栈覆盖 AI、LLM 评估、合成数据等方向,目前处于成长阶段,适合作为轻量级 AI 数据工作台使用。

开源 unknown 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1643
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类数据集
开发团队huggingface
所属国家
官网地址
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型ai,llm-evaluation,llms,nocode,oss,synthetic-data
GitHub 星标★ 1643
30天Star增速
HF 下载量
上线时间2025-01-16 00:00:00
最近更新2026-09-19 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-20
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:Docker 8 步

环境要求

  • Docker(选择 Docker 部署路线时)
  • Hugging Face 账号与访问令牌 HF_TOKEN(在设置页生成)
  • Node.js 与 pnpm(选择源码 pnpm 路线时需要)
  • 可选:本地 Ollama 服务,用于跑自定义/本地模型

安装与启动步骤

  1. 1获取 HF 令牌

    打开 Hugging Face 令牌设置页,新建一个访问令牌并复制保存,后面启动容器要用到。

  2. 2导出 HF_TOKEN

    在本机终端把令牌写入环境变量 HF_TOKEN,供容器或本地服务读取。请替换成自己的真实令牌。

    export HF_TOKEN=hf_xxxxxxxxxxxxxxxxxxxx
  3. 3启动 Docker 容器

    拉取并运行 aisheets/sheets 镜像,把容器 3000 端口映射到本机 3000,同时把令牌传入容器。

    docker run -p 3000:3000 
    -e HF_TOKEN=$HF_TOKEN 
    aisheets/sheets
  4. 4浏览器打开界面

    容器启动后在浏览器访问本机 3000 端口,看到表格界面即表示部署完成,可直接导入数据并用 AI 处理。

  5. 5可选:pnpm 源码启动

    不用 Docker 时可克隆仓库,导出令牌后安装依赖并启动开发服务,默认访问 5173 端口。

    git clone https://github.com/huggingface/aisheets.git
    cd sheets
    export HF_TOKEN=hf_xxxxxxxxxxxxxxxxxxxx
    pnpm install --frozen-lockfile
    pnpm dev
  6. 6可选:启动 Ollama 服务

    想用本地模型时,先启动 Ollama 服务端并关闭历史记录,保持该终端窗口一直运行。

    export OLLAMA_NOHISTORY=1
    ollama serve
  7. 7可选:指向本地模型

    另开终端运行 llama3,设置模型地址与名称后启动 AI Sheets,推理将走本地 Ollama 而不是云端。

    ollama run llama3
    export MODEL_ENDPOINT_URL=http://localhost:11434
    export MODEL_ENDPOINT_NAME=llama3
    pnpm serve
  8. 8可选:批量生成数据集

    数据量大时用 HF Jobs 跑生成脚本,指定源数据集、目标数据集和提示词配置,可用 --num-rows 限制行数。

    hf jobs uv run 
    -s HF_TOKEN=$HF_TOKEN 
    https://github.com/huggingface/aisheets/raw/refs/heads/main/scripts/extend_dataset/with_inference_client.py 
    nvidia/Nemotron-Personas dvilasuero/nemotron-kimi-qa-distilled 
    --config https://huggingface.co/datasets/dvilasuero/nemotron-personas-kimi-questions/raw/main/config.yml 
    --num-rows 100

关键配置

配置项必填说明示例
HF_TOKENHugging Face 访问令牌,用于调用 Inference Providers 上的模型。hf_xxxxxxxxxxxxxxxxxxxx
MODEL_ENDPOINT_URL自定义模型服务的地址,需兼容 OpenAI API 规范。http://localhost:11434
MODEL_ENDPOINT_NAME要调用的自定义模型名称。llama3
OLLAMA_NOHISTORYOllama 服务端变量,启动前设置可关闭历史记录。1

如何确认成功

浏览器打开 http://localhost:3000(pnpm 路线为 http://localhost:5173)能看到表格界面即启动成功。

常见问题

Q:不想本地安装,能直接体验吗?

A:可以,README 提供了在线 Space:https://huggingface.co/spaces/aisheets/sheets ,打开即可试用,无需任何安装。

Q:容器启动了但调模型失败怎么办?

A:多半是令牌没传进容器。确认先 export HF_TOKEN,再在 docker run 中用 -e HF_TOKEN=$HF_TOKEN 传入真实令牌。

Q:能用自己的模型或云端模型吗?

A:可以,只要模型服务兼容 OpenAI API 规范,设置 MODEL_ENDPOINT_URL 和 MODEL_ENDPOINT_NAME 后用 pnpm serve 启动即可。

Q:要生成很大的数据集怎么做?

A:用 README 给出的 hf jobs uv run 脚本批量跑,先加 --num-rows 100 小规模验证,确认无误后去掉该参数跑全量。

注意事项

  • README 中 docker run 写的是 -e HF_TOKEN=HF_TOKEN,疑为笔误,实际应写成 -e HF_TOKEN=$HF_TOKEN 传入已导出的变量。
  • pnpm 路线默认端口是 5173,Docker 路线是 3000,两者不要混淆。
  • README 里 clone 后写的是 cd sheets,若目录名实际为 aisheets,请按实际克隆出的目录名进入。
  • HF Jobs 示例命令原文带有行内注释,复制时已去掉,请勿手动加回 # 注释以免命令报错。

核心亮点

  • 表格化界面降低 LLM 批量处理门槛,非工程师也能直接操作
  • 支持合成数据生成与 LLM 评估,覆盖数据构建到验证的链路
  • 基于 TypeScript,前端集成和二次开发相对友好

不足之处

  • 项目仍处成长阶段,功能深度和稳定性有待更多验证
  • 大规模数据集下的性能和成本控制策略文档较少

适用场景

  • 运营人员批量生成商品描述或营销文案
  • 研究人员快速构造和标注合成数据集用于模型评估
  • 产品团队把用户反馈等非结构化文本批量转成结构化标签

替代项目

LangChain、Dify、Flowise

项目介绍

aisheets 是一个数据集领域的开源项目,官方简介:Build, enrich, and transform datasets using AI models with no code。项目使用 TypeScript 开发,在 GitHub 上获得 1643 星标。

上一篇:PEOD

下一篇:没有了!

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
stopes 开源

一键准备多语言翻译数据,从清洗到挖掘平行语料

A library for preparing data for machine translation research (monolingual preproces···

★ 313 2026-08-10