bigset-oss 是数据集领域的开源项目,由 tinyfish-io 开发,是 2026 年新上线的项目。
在全站 12,822 个收录项目中,它的 GitHub 星标数(1,703)位列前 30%,在数据集分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费,可自托管。
它主要面向的使用场景是:竞品价格与动态监控,数据集自动刷新。同类可对比的替代方案包括 Firecrawl、Crawlee。

自托管实时数据集,网页 agent 自动抓取持续更新
bigset-oss 是 TinyFish 开源的 BigSet 自托管版本,用于构建和托管实时数据集。它解决的核心问题是:传统数据集往往静态、更新滞后,而很多业务场景需要持续从网页抓取最新信息并结构化存储。项目通过 TinyFish 的 web agents 自动浏览、提取网页内容,把结果写入可查询的数据集,让数据集像活水一样持续刷新。技术栈为 TypeScript,支持自行部署,数据不出自己的服务器。核心能力包括:定义抓取目标与字段、由 agent 执行采集、增量更新数据集、对外提供查询接口。适合需要实时网页情报、竞品监控、线索聚合等场景的团队,用开源方式替代闭源数据服务。
1安装 BigSet CLI
README 的 Quick Start 第一步,全局安装官方 npm 包,安装后即可使用 bigset 命令。
npm install --global @adamexu/bigset2启动 BigSet
该命令会下载当前本地版 BigSet release,并启动 Convex、后端、前端和本地凭证桥,随后打印应用地址。首次运行会较慢。
bigset3打开浏览器访问
在浏览器中打开终端打印的应用地址,默认即 127.0.0.1:3500,即可进入 BigSet 界面。
4完成首次配置
首次启动会进入 setup 页面,需依次连接 TinyFish 和 OpenRouter 两个服务并填入各自的 API Key,Key 会保存到操作系统钥匙串。
5试用或临时运行
若不想全局安装,可用 npx 一次性运行;需要重新拉取最新缓存版本时加 --force。
npx @adamexu/bigset| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
TinyFish API Key | 是 | 用于网页搜索和页面抓取,在 setup 页面填写 | tf-xxxxxxxxxxxxxxxx |
OpenRouter API Key | 是 | 用于 schema 推断和 agent 的 LLM 调用 | sk-or-v1-xxxxxxxx |
--app-port | 否 | 指定前端应用端口,默认 3500 | 4500 |
--backend-port | 否 | 指定后端端口,需与 app 端口区分开 | 4501 |
--home | 否 | 指定本地缓存目录,默认 ~/.bigset | ~/.bigset-dev |
终端会打印应用 URL,浏览器打开 127.0.0.1:3500 能看到 setup/界面即成功。
Q:不想全局安装怎么办?
A:使用 npx @adamexu/bigset 可直接运行,无需全局安装,命令与全局安装后一致。
Q:3500 端口被占用了怎么办?
A:用 bigset --app-port 4500 --backend-port 4501 指定其他端口后重新启动。
Q:如何重新拉取最新版本?
A:执行 bigset --force,会重新下载最新的缓存 release。
Q:缓存文件存在哪里?
A:默认缓存在 ~/.bigset 目录,也可以用 --home 指定其他缓存目录,例如 ~/.bigset-dev。
Q:API Key 会保存在哪里?
A:本地 API Key 存放于操作系统的钥匙串(keychain)中,不上传。
Firecrawl、Crawlee
bigset-oss 是数据集领域的开源项目,由 tinyfish-io 开发,是 2026 年新上线的项目。
在全站 12,822 个收录项目中,它的 GitHub 星标数(1,703)位列前 30%,在数据集分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费,可自托管。
它主要面向的使用场景是:竞品价格与动态监控,数据集自动刷新。同类可对比的替代方案包括 Firecrawl、Crawlee。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models