bigset-oss

自托管实时数据集,网页 agent 自动抓取持续更新

bigset-oss 是 TinyFish 开源的 BigSet 自托管版本,用于构建和托管实时数据集。它解决的核心问题是:传统数据集往往静态、更新滞后,而很多业务场景需要持续从网页抓取最新信息并结构化存储。项目通过 TinyFish 的 web agents 自动浏览、提取网页内容,把结果写入可查询的数据集,让数据集像活水一样持续刷新。技术栈为 TypeScript,支持自行部署,数据不出自己的服务器。核心能力包括:定义抓取目标与字段、由 agent 执行采集、增量更新数据集、对外提供查询接口。适合需要实时网页情报、竞品监控、线索聚合等场景的团队,用开源方式替代闭源数据服务。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1703
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队tinyfish-io
所属国家
官网地址
定价模式free
价格说明开源免费,可自托管
访问状态
是否开源
开源协议AGPL-3.0
主要语言TypeScript
技术栈/模型bigset,open-source,tinyfish
GitHub 星标★ 1703
30天Star增速
HF 下载量
上线时间2026-05-15 00:00:00
最近更新2026-09-20 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

难度:入门 约 3 分钟 部署方式:命令行工具 5 步

环境要求

  • Node.js 22 或更高版本(自带 npm)
  • 访问 https://agent.tinyfish.ai/api-keys 获取 TinyFish API Key(用于网页搜索与抓取)
  • 访问 https://openrouter.ai/settings/keys 获取 OpenRouter API Key(用于 LLM 调用)
  • 无需 Docker

安装与启动步骤

  1. 1安装 BigSet CLI

    README 的 Quick Start 第一步,全局安装官方 npm 包,安装后即可使用 bigset 命令。

    npm install --global @adamexu/bigset
  2. 2启动 BigSet

    该命令会下载当前本地版 BigSet release,并启动 Convex、后端、前端和本地凭证桥,随后打印应用地址。首次运行会较慢。

    bigset
  3. 3打开浏览器访问

    在浏览器中打开终端打印的应用地址,默认即 127.0.0.1:3500,即可进入 BigSet 界面。

  4. 4完成首次配置

    首次启动会进入 setup 页面,需依次连接 TinyFish 和 OpenRouter 两个服务并填入各自的 API Key,Key 会保存到操作系统钥匙串。

  5. 5试用或临时运行

    若不想全局安装,可用 npx 一次性运行;需要重新拉取最新缓存版本时加 --force。

    npx @adamexu/bigset

关键配置

配置项必填说明示例
TinyFish API Key用于网页搜索和页面抓取,在 setup 页面填写tf-xxxxxxxxxxxxxxxx
OpenRouter API Key用于 schema 推断和 agent 的 LLM 调用sk-or-v1-xxxxxxxx
--app-port指定前端应用端口,默认 35004500
--backend-port指定后端端口,需与 app 端口区分开4501
--home指定本地缓存目录,默认 ~/.bigset~/.bigset-dev

如何确认成功

终端会打印应用 URL,浏览器打开 127.0.0.1:3500 能看到 setup/界面即成功。

常见问题

Q:不想全局安装怎么办?

A:使用 npx @adamexu/bigset 可直接运行,无需全局安装,命令与全局安装后一致。

Q:3500 端口被占用了怎么办?

A:用 bigset --app-port 4500 --backend-port 4501 指定其他端口后重新启动。

Q:如何重新拉取最新版本?

A:执行 bigset --force,会重新下载最新的缓存 release。

Q:缓存文件存在哪里?

A:默认缓存在 ~/.bigset 目录,也可以用 --home 指定其他缓存目录,例如 ~/.bigset-dev。

Q:API Key 会保存在哪里?

A:本地 API Key 存放于操作系统的钥匙串(keychain)中,不上传。

注意事项

  • BigSet 目前是实验性项目,README 明确提示可能存在粗糙之处、功能会变动。
  • 首次运行需下载并缓存 release 文件到 ~/.bigset,之后启动通常只需几秒。
  • 项目采用 AGPL-3.0 许可证,商用或二次分发前请确认合规。
  • README 未提供 Docker 部署方式,官方推荐即本机 Node.js 运行。

核心亮点

  • 支持自托管,数据留在自己服务器,隐私与合规更可控
  • 用 web agent 自动抓取网页并结构化,减少人工维护数据集的成本
  • TypeScript 编写,前端/Node 团队易读易改,便于二次开发

不足之处

  • 依赖 TinyFish 的 web agent 能力,脱离其生态后抓取效果可能受限
  • 项目较新、社区和文档仍在成长,生产级稳定性待验证

适用场景

  • 竞品价格与动态监控,数据集自动刷新
  • 行业线索聚合,从多个网页持续采集并结构化
  • 自建实时情报库,供内部搜索或分析使用

替代项目

Firecrawl、Crawlee

项目介绍

bigset-oss 是数据集领域的开源项目,由 tinyfish-io 开发,是 2026 年新上线的项目。

在全站 12,822 个收录项目中,它的 GitHub 星标数(1,703)位列前 30%,在数据集分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费,可自托管。

它主要面向的使用场景是:竞品价格与动态监控,数据集自动刷新。同类可对比的替代方案包括 Firecrawl、Crawlee。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09