
ai.robots.txt
一行配置,批量屏蔽 AI 爬虫抓取你的网站
ai.robots.txt 是一个面向网站所有者的开源 robots.txt 规则集合,专门用于屏蔽各类 AI 爬虫与自动化代理。项目维护者收集并持续更新主流 AI 公司(如 OpenAI、Anthropic、Google、Common Crawl 等)的爬虫 User-Agent,提供可直接复制到网站根目录 robots.txt 的屏蔽规则,也附带 Nginx、Apache、Cloudflare 等常见服务器的配置示例。它解决的核心问题是:网站内容被大模型训练数据抓取却难以逐一识别和拦截,站长只需一次配置即可批量拒绝 AI 抓取,保护原创内容与隐私数据。项目以 Python 脚本自动同步上游爬虫清单,降低人工维护成本,适合个人博客、内容站、企业官网等希望控制数据被 AI 使用的场景。
项目数据
使用教程
环境要求
- 一台已运行的网站服务器,可写入站点根目录
- 支持 Apache httpd / Nginx / Caddy / HAProxy / lighttpd 之一
- 已安装 git(用于获取仓库文件)
安装与启动步骤
-
1获取规则文件
克隆仓库,得到 robots.txt 及各服务器屏蔽配置示例文件,后续按需复制。
git clone https://github.com/ai-robots-txt/ai.robots.txt -
2部署 robots.txt
把仓库中的 robots.txt 复制到网站根目录,实现 RFC 9309 的爬虫排除声明。
cp ai.robots.txt/robots.txt /your/path/robots.txt -
3配置 Apache 屏蔽
使用 .htaccess 让列出的 AI 爬虫请求返回错误页;README 提示还有性能更好的方式。
cp ai.robots.txt/.htaccess /your/path/.htaccess -
4配置 Nginx 屏蔽
在虚拟主机 server {} 块中通过 include 指令引入该配置片段。
include /your/path/nginx-block-ai-bots.conf; -
5配置 Caddy 屏蔽
复制或导入 Caddyfile 中的 Header Regex matcher 组,再用 abort 拒绝请求。
abort @aibots -
6配置 HAProxy 屏蔽
把文件放入 HAProxy 配置目录,并在 frontend 段添加 acl 与拒绝规则。
acl ai_robot hdr_sub(user-agent) -i -f /etc/haproxy/haproxy-block-ai-bots.txt http-request deny if ai_robot -
7配置 lighttpd 屏蔽
在 lighttpd 全局或条件段中用 include 引入该片段文件。
include "fragments/lighttpd-block-ai-bots.conf"
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
robots.txt 存放路径 | 是 | 站点根目录下的 robots.txt 路径,按实际站点替换 | /your/path/robots.txt |
nginx include 路径 | 否 | Nginx server 块中 include 的配置片段路径 | include /your/path/nginx-block-ai-bots.conf; |
haproxy 规则文件路径 | 否 | HAProxy acl 引用的屏蔽列表文件路径,环境不同可修改 | /etc/haproxy/haproxy-block-ai-bots.txt |
lighttpd include 路径 | 否 | lighttpd 配置中引入的片段相对路径 | fragments/lighttpd-block-ai-bots.conf |
如何确认成功
访问 https://你的域名/robots.txt 能看到屏蔽规则;用被屏蔽的 User-Agent 请求,服务器应返回错误页或直接拒绝。
常见问题
Q:只放 robots.txt 就够了吗?
A:robots.txt 是声明式协议,爬虫可自行忽略;若要强制拦截,需配合 .htaccess、Nginx、Caddy、HAProxy 或 lighttpd 的服务器层屏蔽。
Q:.htaccess 会不会影响性能?
A:README 引用 Apache httpd 文档指出,存在比 .htaccess 更高性能的配置方式,流量大时建议改用服务器主配置。
Q:HAProxy 按 README 的路径报错怎么办?
A:README 已说明该路径可能因环境不同而不同,请把 acl 中的文件路径改成你自己环境里存放该文件的真实路径。
Q:Bing 抓取的数据也会用于训练吗?
A:README 指出 Bing 会把抓取数据用于 AI 与训练,可在网站 head 中添加 meta 标签选择退出,详见 docs/additional-steps/bing.md。
Q:如何新增一个 AI 爬虫?
A:见仓库 README 的 Contributing 章节,欢迎提交贡献。
注意事项
- 仓库提供多种配置模板,按你实际使用的 Web 服务器选择其一即可
- Caddy 需先复制或导入 Caddyfile 里的 Header Regex matcher 组,abort 才可用
- 所有示例路径均为占位,请替换为实际站点或配置目录路径
- 如需退出 Bing 的 AI 训练使用,另加 head 中的 meta 标签
核心亮点
- 提供可直接复制的 robots.txt 规则,覆盖 OpenAI、Anthropic、Google 等主流 AI 爬虫,开箱即用
- 附 Nginx、Apache、Cloudflare 等服务器配置示例,不限于 robots.txt 单一方式
- 用 Python 脚本自动同步上游爬虫清单,规则更新及时,减少人工维护
不足之处
- robots.txt 本身是君子协定,恶意爬虫可无视规则,无法真正强制拦截
- 部分 AI 爬虫使用动态或伪装 User-Agent,仅靠 UA 屏蔽可能漏网
适用场景
- 个人博客站长希望阻止内容被大模型训练抓取
- 企业官网需满足合规要求,限制 AI 爬虫访问敏感页面
- 内容平台批量配置服务器层拦截规则,降低 AI 抓取带宽消耗
替代项目
ai-robots-txt、robots.txt、darkvisitors
项目介绍
同类项目推荐
n8n
开源
拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。
Fair-code workflow automation platform with native AI capabilities. Combine visual b···
robotcode
开源
让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。
Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···
puppeteer
开源
用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。
JavaScript API for Chrome and Firefox
customermates
开源
比 Pipedrive 直观 10 倍的现代开源 CRM,轻松管理客户与自动化流程。
Building a modern alternative to Pipedrive that is 10x more intuitive.