ai.robots.txt

一行配置,批量屏蔽 AI 爬虫抓取你的网站

ai.robots.txt 是一个面向网站所有者的开源 robots.txt 规则集合,专门用于屏蔽各类 AI 爬虫与自动化代理。项目维护者收集并持续更新主流 AI 公司(如 OpenAI、Anthropic、Google、Common Crawl 等)的爬虫 User-Agent,提供可直接复制到网站根目录 robots.txt 的屏蔽规则,也附带 Nginx、Apache、Cloudflare 等常见服务器的配置示例。它解决的核心问题是:网站内容被大模型训练数据抓取却难以逐一识别和拦截,站长只需一次配置即可批量拒绝 AI 抓取,保护原创内容与隐私数据。项目以 Python 脚本自动同步上游爬虫清单,降低人工维护成本,适合个人博客、内容站、企业官网等希望控制数据被 AI 使用的场景。

开源 free 自动化工作流
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4131
维护状态 活跃
是否开源
定价模式 free

项目数据

分类自动化工作流
开发团队ai-robots-txt
所属国家
定价模式free
价格说明开源免费,MIT许可证
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,crawlers,crawling,privacy
GitHub 星标★ 4131
30天Star增速
HF 下载量
上线时间2024-03-27 00:00:00
最近更新2026-09-19 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 7 步

环境要求

  • 一台已运行的网站服务器,可写入站点根目录
  • 支持 Apache httpd / Nginx / Caddy / HAProxy / lighttpd 之一
  • 已安装 git(用于获取仓库文件)

安装与启动步骤

  1. 1获取规则文件

    克隆仓库,得到 robots.txt 及各服务器屏蔽配置示例文件,后续按需复制。

    git clone https://github.com/ai-robots-txt/ai.robots.txt
  2. 2部署 robots.txt

    把仓库中的 robots.txt 复制到网站根目录,实现 RFC 9309 的爬虫排除声明。

    cp ai.robots.txt/robots.txt /your/path/robots.txt
  3. 3配置 Apache 屏蔽

    使用 .htaccess 让列出的 AI 爬虫请求返回错误页;README 提示还有性能更好的方式。

    cp ai.robots.txt/.htaccess /your/path/.htaccess
  4. 4配置 Nginx 屏蔽

    在虚拟主机 server {} 块中通过 include 指令引入该配置片段。

    include /your/path/nginx-block-ai-bots.conf;
  5. 5配置 Caddy 屏蔽

    复制或导入 Caddyfile 中的 Header Regex matcher 组,再用 abort 拒绝请求。

    abort @aibots
  6. 6配置 HAProxy 屏蔽

    把文件放入 HAProxy 配置目录,并在 frontend 段添加 acl 与拒绝规则。

    acl ai_robot hdr_sub(user-agent) -i -f /etc/haproxy/haproxy-block-ai-bots.txt
    http-request deny if ai_robot
  7. 7配置 lighttpd 屏蔽

    在 lighttpd 全局或条件段中用 include 引入该片段文件。

    include "fragments/lighttpd-block-ai-bots.conf"

关键配置

配置项必填说明示例
robots.txt 存放路径站点根目录下的 robots.txt 路径,按实际站点替换/your/path/robots.txt
nginx include 路径Nginx server 块中 include 的配置片段路径include /your/path/nginx-block-ai-bots.conf;
haproxy 规则文件路径HAProxy acl 引用的屏蔽列表文件路径,环境不同可修改/etc/haproxy/haproxy-block-ai-bots.txt
lighttpd include 路径lighttpd 配置中引入的片段相对路径fragments/lighttpd-block-ai-bots.conf

如何确认成功

访问 https://你的域名/robots.txt 能看到屏蔽规则;用被屏蔽的 User-Agent 请求,服务器应返回错误页或直接拒绝。

常见问题

Q:只放 robots.txt 就够了吗?

A:robots.txt 是声明式协议,爬虫可自行忽略;若要强制拦截,需配合 .htaccess、Nginx、Caddy、HAProxy 或 lighttpd 的服务器层屏蔽。

Q:.htaccess 会不会影响性能?

A:README 引用 Apache httpd 文档指出,存在比 .htaccess 更高性能的配置方式,流量大时建议改用服务器主配置。

Q:HAProxy 按 README 的路径报错怎么办?

A:README 已说明该路径可能因环境不同而不同,请把 acl 中的文件路径改成你自己环境里存放该文件的真实路径。

Q:Bing 抓取的数据也会用于训练吗?

A:README 指出 Bing 会把抓取数据用于 AI 与训练,可在网站 head 中添加 meta 标签选择退出,详见 docs/additional-steps/bing.md。

Q:如何新增一个 AI 爬虫?

A:见仓库 README 的 Contributing 章节,欢迎提交贡献。

注意事项

  • 仓库提供多种配置模板,按你实际使用的 Web 服务器选择其一即可
  • Caddy 需先复制或导入 Caddyfile 里的 Header Regex matcher 组,abort 才可用
  • 所有示例路径均为占位,请替换为实际站点或配置目录路径
  • 如需退出 Bing 的 AI 训练使用,另加 head 中的 meta 标签

核心亮点

  • 提供可直接复制的 robots.txt 规则,覆盖 OpenAI、Anthropic、Google 等主流 AI 爬虫,开箱即用
  • 附 Nginx、Apache、Cloudflare 等服务器配置示例,不限于 robots.txt 单一方式
  • 用 Python 脚本自动同步上游爬虫清单,规则更新及时,减少人工维护

不足之处

  • robots.txt 本身是君子协定,恶意爬虫可无视规则,无法真正强制拦截
  • 部分 AI 爬虫使用动态或伪装 User-Agent,仅靠 UA 屏蔽可能漏网

适用场景

  • 个人博客站长希望阻止内容被大模型训练抓取
  • 企业官网需满足合规要求,限制 AI 爬虫访问敏感页面
  • 内容平台批量配置服务器层拦截规则,降低 AI 抓取带宽消耗

替代项目

ai-robots-txt、robots.txt、darkvisitors

项目介绍

ai.robots.txt 是一个自动化工作流领域的开源项目,官方简介:A list of AI agents and robots to block.。项目使用 Python 开发,在 GitHub 上获得 4109 星标。

上一篇:hatchet

下一篇:openwork

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 205363 2026-08-10
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 299 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95591 2026-08-10
customermates 开源

比 Pipedrive 直观 10 倍的现代开源 CRM,轻松管理客户与自动化流程。

Building a modern alternative to Pipedrive that is 10x more intuitive.

★ 227 2026-08-10