data
本站收录 60 个带「data」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
llama_indexLlamaIndex 是一个开源的数据框架,旨在连接大语言模型(LLM)与外部数据源,解决 LLM 无法访问实时或私有数据的问题。它提供了一整套工具,用于数据摄★ 52,361
metabaseMetabase 是一款开源的商业智能与嵌入式分析工具,旨在让非技术人员也能轻松探索数据、创建图表和仪表盘。它解决了传统 BI 工具部署复杂、使用门槛高的问题,★ 49,458
pandas-aiPandasAI 是一个将大语言模型与数据分析结合的开源库,让你可以用自然语言与数据对话。它支持 SQL、CSV、Parquet 等多种数据源,通过 LLM 和★ 23,813
airbyteAirbyte 是一个开源数据集成平台,专注于 ELT 管道和 AI 应用的数据搬运。它解决的核心问题是:企业数据散落在 API、数据库、文件等数百种来源中,要★ 22,140
SeleniumBaseSeleniumBase 是一个基于 Python 的浏览器自动化框架,在原生 Selenium 之上做了大量封装,用于网页抓取、端到端测试和自动化工作流。它最★ 13,047
DataFlowDataFlow 是一个面向大模型时代的数据准备框架,目标是让数据清洗、合成与加工像搭积木一样简单。它把数据处理的每个环节抽象成可复用的 Operator(算子★ 8,214
data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105
browser-compat-databrowser-compat-data 是 MDN 官方维护的浏览器兼容性数据集,以 JSON 格式存储 Web 技术(如 CSS、JavaScript、HTM★ 5,759
Edit-BananaEdit-Banana 是一个将统计格式(如 PDF、图像中的表格)转换为可编辑内容的开源框架。它解决的是数据提取与编辑的痛点,让用户能从非结构化文档中提取结构★ 5,502
superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327
mimesisMimesis 是一个 Python 库,用于生成逼真的假数据,支持多种语言和地区(locale)。它解决了开发、测试和演示阶段需要大量真实感测试数据的问题,无★ 4,840
llm-datasetsllm-datasets 是一个精选的大语言模型后训练数据集与工具清单,旨在帮助研究者和工程师快速找到高质量的数据资源。它系统梳理了用于指令微调、偏好对齐、持续★ 4,794
DeepAnalyzeDeepAnalyze 是一个基于 Agent 架构的自主数据科学分析工具,定位为你的 AI 数据分析师。它能够自动处理大规模数据集,完成从数据清洗、探索性分析★ 4,663
datasetsTFDS(TensorFlow Datasets)是一个开源的机器学习数据集库,旨在为 TensorFlow、JAX 等框架提供即用型数据集。它解决了研究人员和★ 4,594
cognitaCognita 是一个由 TrueFoundry 开源的模块化 RAG(检索增强生成)框架,旨在帮助开发者快速构建生产级、可扩展的 RAG 应用。它解决了 RA★ 4,419
preswaldPreswald 是一个面向 Python 交互式数据应用的 WASM 打包工具。它解决的核心问题是:传统数据应用(如仪表盘、报告)依赖服务器或 Python ★ 4,268
docetlDocETL 是一个面向智能体 LLM 的数据处理与 ETL 系统。它解决传统 ETL 管道无法灵活处理非结构化数据(如文本、日志、文档)的痛点,将大语言模型作★ 4,110
LazyLLMLazyLLM 是一个面向多智能体 LLM 应用开发的低代码框架,旨在让开发者以最懒的方式快速构建复杂的 AI 应用。它解决了传统 LLM 应用开发中流程编排繁★ 3,887
AnyCrawlAnyCrawl 是一个基于 Node.js/TypeScript 的开源爬虫工具,主要解决将网站内容转化为大语言模型(LLM)可用的结构化数据,以及从 Goo★ 3,464
pandas-datareaderpandas-datareader 是一个 Python 库,用于从多种互联网数据源获取金融和经济数据,并将其直接转换为 pandas DataFrame 格式★ 3,271
quant-mindQuantMind 是一个面向量化金融的智能体原生知识抽取与检索框架。它解决的是量化研究过程中信息过载和知识分散的问题,能够从海量研报、财报、新闻等非结构化文本★ 3,032
rillRill 是一个面向人类和 AI 代理的极速商业智能(BI)工具,用 Go 语言编写。它旨在解决传统 BI 工具在数据准备、查询性能和交互体验上的痛点,让数据分★ 2,916
DataFlexDataFlex 是一个数据为中心的 LLM 训练工具,它嵌入在 LLaMA-Factory 训练流程中,通过动态样本选择、领域混合优化和示例重加权来提升模型训★ 2,875
colourColour 是一个专注于色彩科学的 Python 库,为研究人员、开发者和艺术家提供全面的颜色处理、转换和分析工具。它解决了色彩空间中颜色表示不一致、转换复杂★ 2,658
DeepBIDeepBI 是一个基于大语言模型的 AI 原生数据应用,旨在将自然语言交互引入商业智能(BI)领域。它解决传统 BI 工具使用门槛高、分析流程繁琐的问题,让用★ 2,382
TigerBotTigerBot 是一个多语言、多任务的大语言模型开源项目,由虎博科技开发。它旨在提供高性能的对话、生成、理解等能力,并针对中文场景做了优化。项目包含模型权重、★ 2,262
CuratorCurator 是一个面向大型语言模型(LLM)的可扩展数据预处理与清洗工具包。它旨在解决 LLM 训练和微调中数据质量参差不齐、处理流程繁琐低效的问题。Cur★ 1,788
lotusLotus 是一个专注于大规模数据处理的开源框架,旨在为代理(Agent)和大型语言模型(LLM)提供高效的批量处理能力。它解决了传统 LLM 在处理海量数据时★ 1,707
synthetic-data-kitsynthetic-data-kit 是一个用于生成高质量合成数据集的 Python 工具,旨在解决真实数据获取成本高、隐私风险大、样本不均衡等问题。它通过可复★ 1,641
data-prep-kitdata-prep-kit 是一个面向生成式 AI(GenAI)应用的数据准备开源项目。它解决的是大模型训练和微调前数据清洗、转换、增强的繁琐问题,提供了一套模★ 966
dataset-viewerdataset-viewer 是 Hugging Face 官方开源的后端服务,为数据集页面上的在线预览功能提供公共 API。它解决的核心问题是:用户无需下载动★ 902
vectordbEpsilla 是一个高性能的向量数据库管理系统,专为 AI 应用设计。它解决了大语言模型应用中知识库检索和语义记忆的痛点,提供向量存储、索引和相似性搜索的核心★ 875
NeumAINeumAI 是一个专注于大规模向量嵌入创建与同步的框架,旨在解决 RAG(检索增强生成)应用中数据管道复杂、难以维护的痛点。它提供了一套声明式配置,让开发者能★ 869
FinanceMCPFinanceMCP 是一个面向金融领域的 MCP(Model Context Protocol)服务器,用 TypeScript 编写。它把 Tushare ★ 860
opendataopendata 是美国国家美术馆(National Gallery of Art)推出的开放数据项目,旨在将馆藏艺术品元数据以结构化格式(如 CSV)公开,供★ 832
firecrawl-app-examplesFirecrawl 是一个将网站内容转换为 LLM 可读格式的爬虫服务,本仓库则收录了基于 Firecrawl 构建的完整应用示例,包括网站和其他项目。它解决了★ 826
swiftideswiftide 是一个基于 Rust 的流式索引、查询与智能体 LLM 应用框架。它旨在解决构建 LLM 应用时数据管道复杂、性能瓶颈和开发效率低的问题。核心★ 787
awesome-open-source-data-engineering这是一个精选开源数据工程工具列表,旨在帮助数据工程师和分析平台构建者快速找到合适的开源组件。项目按功能分类整理了数据摄取、存储、处理、查询、调度、可视化等环节的★ 604
aqueductAqueduct 是一个已停止维护的开源基础设施项目,旨在帮助用户在任意云基础设施上运行大语言模型(LLM)和机器学习(ML)工作负载。它通过提供统一的接口和编★ 518
awesome-pythonawesome-python 是一个精选的 Python 库和框架资源清单,按类别组织,涵盖数据科学、机器学习、深度学习、自然语言处理、Jupyter 生态等多★ 468
encord-activeencord-active 是一个用于模型测试、验证与评估的开源工具包,旨在帮助机器学习团队高效管理数据标注流程。它解决的核心问题是:在模型开发中,如何从海量未★ 460
awesome-chemistry-datasetsawesome-chemistry-datasets 是一个面向化学机器学习的数据集汇总清单,系统整理了可用于训练和评测模型的化学数据集,覆盖分子性质、反应、量★ 425
awesome-data-centric-ai这是一个关于数据为中心AI(Data-Centric AI)的精选资源列表,汇集了开源软件、教程和研究论文。它旨在解决AI开发中数据质量、标注、增强等问题,强调★ 357
feathubFeatHub 是一个面向实时机器学习的流批统一特征存储系统,旨在解决特征工程中训练与推理不一致、特征复用困难、实时与离线特征割裂等问题。它提供统一的 API ★ 352
flytekitflytekit 是 Flyte 平台的 Python 开发套件,用于编写和编排机器学习及数据处理工作流。它解决的是复杂数据管道和模型训练流程中任务编排难、可重★ 320
DataMindDataMind 是一个基于 LlamaIndex 构建的一体化智能助手框架,目标是把 RAG、GraphRAG、NL2SQL、技能系统和记忆机制整合到同一个可★ 272
data_science_blogs这是一个数据科学博客的配套代码仓库,作者将博客文章中涉及的所有代码集中管理。项目主要解决博客读者无法直接获取可运行代码的问题,提供从数据预处理、机器学习建模到可★ 252
unitxtUnitxt 是一个面向企业级 AI 性能评估的 Python 库,提供全球最大的工具和数据目录,用于端到端的 AI 基准测试。它解决了 AI 评估流程中数据准★ 216
lookerbotLookerbot 是一个将 Looker 数据查询能力接入 Slack 的开源聊天机器人。它解决的是数据分析师和业务人员在不离开 Slack 的情况下,快速获★ 173
One-EvalOne-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 LLM 评测往往需要人工配置数据集、编写推理脚本、跑★ 164