data-analysis
本站收录 42 个带「data-analysis」标签的 AI 开源项目
TrendRadarTrendRadar 是一个基于 AI 驱动的开源舆情监控与热点趋势分析工具,旨在解决信息过载问题。它通过聚合多平台热点新闻、RSS 订阅源,利用 AI 进行智★ 62,616
metabaseMetabase 是一款开源的商业智能与嵌入式分析工具,旨在让非技术人员也能轻松探索数据、创建图表和仪表盘。它解决了传统 BI 工具部署复杂、使用门槛高的问题,★ 49,458
streamlitStreamlit 是一个开源的 Python 应用框架,专为数据科学家和机器学习工程师设计,旨在将数据脚本快速转化为可交互的 Web 应用。它解决了传统数据应★ 45,850
BettaFish微舆(BettaFish)是一个基于Python从零实现的多Agent舆情分析助手,不依赖任何现成框架。它通过多个智能体协作,自动完成舆情信息的采集、清洗、分析★ 42,315
reflexReflex 是一个基于纯 Python 的全栈 Web 应用开发框架,让你无需编写任何 JavaScript、HTML 或 CSS 代码,就能构建交互式 We★ 28,924
best-of-ml-python这是一个精选的机器学习Python库排行榜,每周自动更新,按GitHub星标数排序,帮助开发者快速发现和评估优秀的ML工具。它解决了机器学习生态中库数量庞大、质★ 23,828
pandas-aiPandasAI 是一个将大语言模型与数据分析结合的开源库,让你可以用自然语言与数据对话。它支持 SQL、CSV、Parquet 等多种数据源,通过 LLM 和★ 23,813
airbyteAirbyte 是一个开源数据集成平台,专注于 ELT 管道和 AI 应用的数据搬运。它解决的核心问题是:企业数据散落在 API、数据库、文件等数百种来源中,要★ 22,157
flyteFlyte 是一个开源的云原生编排平台,专注于数据、机器学习和 AI 工作流的自动化。它解决的是在复杂生产环境中,数据管道、模型训练和推理任务难以统一调度和可靠★ 7,602
ChatLabChatLab 是一个本地优先的 AI 聊天记录分析工具,用 TypeScript 构建。它解决的是用户聊天数据分散、难以挖掘价值的问题。核心能力包括:自动导入★ 7,457
lancelance 是一个面向多模态 AI 数据的开源列式存储格式,基于 Rust 和 Apache Arrow 构建。它解决了传统 Parquet 格式在随机访问、向★ 7,123
data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105
TaskWeaverTaskWeaver 是一个以代码为先的智能体框架,专为数据分析和任务自动化设计。它通过将用户请求转化为可执行的 Python 代码,实现规划与执行的无缝衔接,★ 6,167
SenseNova-SkillsSenseNova-Skills 是一个基于 JavaScript 的模块化技能库,旨在帮助开发者快速构建 AI 驱动的办公助手和生产力工作流。它解决了从零搭建★ 5,724
DeepAnalyzeDeepAnalyze 是一个基于 Agent 架构的自主数据科学分析工具,定位为你的 AI 数据分析师。它能够自动处理大规模数据集,完成从数据清洗、探索性分析★ 4,663
Data-Science-Roadmap这是一个面向数据科学学习者的从零到一路线图,覆盖数据分析、数据工程、机器学习、深度学习、大数据、数据可视化等核心领域,并提供面试准备、简历模板和速查表等实用资源★ 4,380
pandas-datareaderpandas-datareader 是一个 Python 库,用于从多种互联网数据源获取金融和经济数据,并将其直接转换为 pandas DataFrame 格式★ 3,271
rillRill 是一个面向人类和 AI 代理的极速商业智能(BI)工具,用 Go 语言编写。它旨在解决传统 BI 工具在数据准备、查询性能和交互体验上的痛点,让数据分★ 2,916
evadbEvaDB 是一个专为 AI 应用设计的数据库系统,旨在简化 AI 功能的集成。它允许开发者通过类似 SQL 的查询语言,在数据库内部直接调用机器学习模型,处理★ 2,674
hamiltonHamilton 是一个帮助数据科学家和工程师定义可测试、模块化、自文档化数据流的开源框架。它通过纯 Python 函数声明数据转换逻辑,自动构建数据流图,并生★ 2,601
nannymlnannyml 是一个用于机器学习模型部署后监控的 Python 库。它解决的是模型上线后性能下降、数据漂移等问题难以发现和定位的痛点。核心能力包括:检测特征和★ 2,156
DATAGENDATAGEN 是一个基于 AI 的多智能体研究助手,旨在自动化科研流程中的假设生成、数据分析和报告撰写。它利用 LangChain 等框架构建多个智能体,协同★ 1,809
ktxktx 是一个为数据和智能体设计的可执行上下文层,旨在解决 AI 智能体(如 Claude Code、Codex 等)在查询分析型数据库时缺乏业务上下文、准确率★ 1,605
DataProfilerDataProfiler 是一个开源的数据分析工具,用于快速提取数据集的模式(schema)、统计信息和实体标签。它解决的核心问题是帮助数据科学家和工程师在拿到★ 1,591
pgbotpgbot 是一个用 Go 编写的 PostgreSQL 智能层,专为 AI Agent 和应用设计。它把数据库从被动的存储变成可主动查询、分析和推理的数据源,★ 1,347
Ultimate-Data-Science-Toolkit---From-Python-Basics-to-GenerativeAI这是一个面向数据科学和生成式AI学习者的开源课程/资源库,以Jupyter Notebook形式提供从Python基础到生成式AI的完整学习路径。项目旨在解决数★ 973
bacalhauBacalhau 是一个社区驱动的分布式计算框架,专注于在数据所在位置执行计算,实现快速、低成本的‘数据计算’(Compute over Data)。它解决了传★ 873
BambooAIBambooAI 是一个由大语言模型驱动的数据分析智能体,核心特点是让 LLM 在持久化的 Python 内核中执行代码,而不是每次问答都重新启动环境。用户通过★ 791
Auto-AnalystAuto-Analyst 是一个开源的 AI 驱动数据科学平台,旨在通过自然语言交互简化数据分析全流程。它解决了传统数据科学工作中门槛高、流程繁琐、工具分散的问★ 707
advanced-machine-learning-engineer-roadmap-2024这是一个面向2024年的全栈机器学习工程师学习路线图,旨在帮助学习者系统掌握从数据处理、模型开发到部署运维的完整技能链。项目以结构化的路线图形式,梳理了成为全栈★ 703
ScienceClawScienceClaw 是一个基于 LangChain DeepAgents 和 AIO Sandbox 基础设施构建的个人科研助手,采用全新架构,强调安全性、★ 668
dsh-desktopdsh-desktop 是 DeepSeek Harness(DSH)的本地桌面客户端,基于 Electron 构建,把 AI 智能体会话、项目管理、文件操作、★ 591
popmonpopmon 是一个用于监控 Pandas 或 Spark 数据框稳定性的开源库。它通过自动计算数据分布、统计指标和相关性等特征,并基于历史数据或预期值进行对比★ 511
datdat 是一个面向智能体(Agent)的自然语言数据查询与分析框架,旨在让用户通过对话方式直接与数据库交互,无需编写 SQL 或了解底层数据模型。它通过预建模(★ 259
Auto-Research-SkillsAuto-Research-Skills 是一个精选的自主科研技能与智能体资源库,旨在帮助研究人员从研究灵感到论文全文的生成实现全程自动化。该项目聚合了多种学术★ 181
One-EvalOne-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 LLM 评测往往需要人工配置数据集、编写推理脚本、跑★ 164
DataMindDataMind 是一个基于大语言模型的开源数据分析智能体框架,目标是为用户提供从自然语言到数据洞察的端到端解决方案。它解决的是传统数据分析门槛高、流程繁琐的问★ 147
image-rankerimage-ranker 是一个在浏览器中通过两两对比来给图像排序的开源工具,基于 TrueSkill 算法。它主要解决图像数据集构建和排序中的主观评估问题,让★ 92
csv-ai-analyzercsv-ai-analyzer 是一个基于浏览器的自托管 AI CSV 分析工具,主要解决用户在不离开本地环境的情况下,快速理解、分析和可视化 CSV 数据的问★ 86
dbxlitedbxlite 是一个开源的 SQL 工作台,基于 DuckDB 构建,运行在浏览器中。它解决了本地数据文件(如 CSV、Parquet)和云端数据仓库(Big★ 86
FDAbenchFDABench 是一个用于评估数据智能体(Data Agents)在异构数据上执行分析查询能力的基准测试平台,源自 KDD'26 论文。它解决的核心问题是:当★ 82
aws-data-science-data-engineering-mlops-infra这是一个基于AWS的端到端数据科学与MLOps参考架构项目,以航班延误预测为业务场景,完整展示了数据工程、数据科学、MLOps和基础设施即代码的最佳实践。项目通★ 58