Awesome-llms-txt

一站收集全网 llms.txt,做 AI 抓取与语料的种子库

Awesome-llms-txt 是一个收集并索引互联网上各类 llms.txt 文件的开源数据集项目。llms.txt 是一种新兴的网站根目录约定文件,用于向大语言模型和 AI 爬虫声明网站内容结构、可抓取范围与关键资源链接,帮助模型更准确高效地理解站点。本项目把分散在各站点的 llms.txt 汇总成索引,作为种子数据供开发者训练、测试或构建 AI 抓取与检索工具。核心能力包括:按站点整理 llms.txt 链接、提供可复用的结构化清单、方便快速拉取样本做语料实验。项目用 Python 组织数据,体量轻,适合作为研究 AI 网站协议、构建 llms.txt 生成器或爬虫的起点。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 106
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类数据集
开发团队SecretiveShell
所属国家
官网地址
定价模式free
价格说明开源免费,无付费计划
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 106
30天Star增速
HF 下载量
上线时间2025-02-05 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-06
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 聚焦 llms.txt 这一新兴协议,填补了公开种子数据集的空白
  • 以清单形式组织,结构简单,可直接用于爬虫或模型训练实验
  • Python 项目便于二次加工,可快速扩展成生成器或校验工具

不足之处

  • 星标仅 106,社区规模小,数据更新与维护依赖少数贡献者
  • 收录站点数量和覆盖范围有限,作为数据集样本量偏小

适用场景

  • 研究 llms.txt 协议、分析网站如何向 AI 声明内容结构
  • 为 AI 爬虫或检索系统准备种子 URL 与站点清单
  • 开发 llms.txt 生成器或校验工具时用作测试样本

替代项目

llms-txt、Awesome-LLM、awesome-ai-agents

项目介绍

Awesome-llms-txt 是数据集领域的开源项目,由 SecretiveShell 开发,2025 年首次发布。

它收录于数据集分类,该分类目前共有 297 个项目,GitHub 星标数为 106。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-28。开源免费,无付费计划。

它主要面向的使用场景是:研究llms.txt协议、分析网站如何向AI声明内容结构。同类可对比的替代方案包括 llms-txt、Awesome-LLM、awesome-ai-agents。

上一篇:IKEA3DAssemblyDataset

下一篇:synthoseis

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10597 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1648 2026-09-20
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3408 2026-08-10