
aisheets
像用表格一样批量调 AI,不写代码就能造和改数据集
aisheets 是一个基于 TypeScript 的开源工具,让用户无需编写代码即可用 AI 模型构建、丰富和转换数据集。它把表格界面与 LLM 能力结合,用户可以在类似电子表格的环境中批量调用 AI 模型,对数据进行生成、清洗、分类、翻译、摘要等操作。核心能力包括:通过自然语言指令批量处理行数据、用 AI 生成合成数据、对 LLM 输出做评估与对比、以及把非结构化文本转为结构化字段。它解决的是数据准备和标注环节中重复劳动多、脚本门槛高的问题,适合需要快速迭代数据集的产品、运营和研究人员。项目用 TypeScript 实现,技术栈覆盖 AI、LLM 评估、合成数据等方向,目前处于成长阶段,适合作为轻量级 AI 数据工作台使用。
项目数据
使用教程
环境要求
- Docker(选择 Docker 部署路线时)
- Hugging Face 账号与访问令牌 HF_TOKEN(在设置页生成)
- Node.js 与 pnpm(选择源码 pnpm 路线时需要)
- 可选:本地 Ollama 服务,用于跑自定义/本地模型
安装与启动步骤
-
1获取 HF 令牌
打开 Hugging Face 令牌设置页,新建一个访问令牌并复制保存,后面启动容器要用到。
-
2导出 HF_TOKEN
在本机终端把令牌写入环境变量 HF_TOKEN,供容器或本地服务读取。请替换成自己的真实令牌。
export HF_TOKEN=hf_xxxxxxxxxxxxxxxxxxxx -
3启动 Docker 容器
拉取并运行 aisheets/sheets 镜像,把容器 3000 端口映射到本机 3000,同时把令牌传入容器。
docker run -p 3000:3000 -e HF_TOKEN=$HF_TOKEN aisheets/sheets -
4浏览器打开界面
容器启动后在浏览器访问本机 3000 端口,看到表格界面即表示部署完成,可直接导入数据并用 AI 处理。
-
5可选:pnpm 源码启动
不用 Docker 时可克隆仓库,导出令牌后安装依赖并启动开发服务,默认访问 5173 端口。
git clone https://github.com/huggingface/aisheets.git cd sheets export HF_TOKEN=hf_xxxxxxxxxxxxxxxxxxxx pnpm install --frozen-lockfile pnpm dev -
6可选:启动 Ollama 服务
想用本地模型时,先启动 Ollama 服务端并关闭历史记录,保持该终端窗口一直运行。
export OLLAMA_NOHISTORY=1 ollama serve -
7可选:指向本地模型
另开终端运行 llama3,设置模型地址与名称后启动 AI Sheets,推理将走本地 Ollama 而不是云端。
ollama run llama3 export MODEL_ENDPOINT_URL=http://localhost:11434 export MODEL_ENDPOINT_NAME=llama3 pnpm serve -
8可选:批量生成数据集
数据量大时用 HF Jobs 跑生成脚本,指定源数据集、目标数据集和提示词配置,可用 --num-rows 限制行数。
hf jobs uv run -s HF_TOKEN=$HF_TOKEN https://github.com/huggingface/aisheets/raw/refs/heads/main/scripts/extend_dataset/with_inference_client.py nvidia/Nemotron-Personas dvilasuero/nemotron-kimi-qa-distilled --config https://huggingface.co/datasets/dvilasuero/nemotron-personas-kimi-questions/raw/main/config.yml --num-rows 100
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
HF_TOKEN | 是 | Hugging Face 访问令牌,用于调用 Inference Providers 上的模型。 | hf_xxxxxxxxxxxxxxxxxxxx |
MODEL_ENDPOINT_URL | 否 | 自定义模型服务的地址,需兼容 OpenAI API 规范。 | http://localhost:11434 |
MODEL_ENDPOINT_NAME | 否 | 要调用的自定义模型名称。 | llama3 |
OLLAMA_NOHISTORY | 否 | Ollama 服务端变量,启动前设置可关闭历史记录。 | 1 |
如何确认成功
浏览器打开 http://localhost:3000(pnpm 路线为 http://localhost:5173)能看到表格界面即启动成功。
常见问题
Q:不想本地安装,能直接体验吗?
A:可以,README 提供了在线 Space:https://huggingface.co/spaces/aisheets/sheets ,打开即可试用,无需任何安装。
Q:容器启动了但调模型失败怎么办?
A:多半是令牌没传进容器。确认先 export HF_TOKEN,再在 docker run 中用 -e HF_TOKEN=$HF_TOKEN 传入真实令牌。
Q:能用自己的模型或云端模型吗?
A:可以,只要模型服务兼容 OpenAI API 规范,设置 MODEL_ENDPOINT_URL 和 MODEL_ENDPOINT_NAME 后用 pnpm serve 启动即可。
Q:要生成很大的数据集怎么做?
A:用 README 给出的 hf jobs uv run 脚本批量跑,先加 --num-rows 100 小规模验证,确认无误后去掉该参数跑全量。
注意事项
- README 中 docker run 写的是 -e HF_TOKEN=HF_TOKEN,疑为笔误,实际应写成 -e HF_TOKEN=$HF_TOKEN 传入已导出的变量。
- pnpm 路线默认端口是 5173,Docker 路线是 3000,两者不要混淆。
- README 里 clone 后写的是 cd sheets,若目录名实际为 aisheets,请按实际克隆出的目录名进入。
- HF Jobs 示例命令原文带有行内注释,复制时已去掉,请勿手动加回 # 注释以免命令报错。
核心亮点
- 表格化界面降低 LLM 批量处理门槛,非工程师也能直接操作
- 支持合成数据生成与 LLM 评估,覆盖数据构建到验证的链路
- 基于 TypeScript,前端集成和二次开发相对友好
不足之处
- 项目仍处成长阶段,功能深度和稳定性有待更多验证
- 大规模数据集下的性能和成本控制策略文档较少
适用场景
- 运营人员批量生成商品描述或营销文案
- 研究人员快速构造和标注合成数据集用于模型评估
- 产品团队把用户反馈等非结构化文本批量转成结构化标签
替代项目
LangChain、Dify、Flowise
项目介绍
上一篇:PEOD
下一篇:没有了!
同类项目推荐
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
stopes
开源
一键准备多语言翻译数据,从清洗到挖掘平行语料
A library for preparing data for machine translation research (monolingual preproces···