spark
本站收录 23 个带「spark」标签的 AI 开源项目
ChuanhuChatGPT支持 ChatGPT API 与众多 LLM 的图形化客户端。内置 Agent、文件问答、GPT 微调与联网搜索功能,界面简洁美观,让大模型应用更顺手、更高效。★ 15,276
cube-studiocube-studio 是一个开源的云原生一站式 AI 平台,覆盖机器学习、深度学习和 LLMOps 全链路。它解决了 AI 开发中环境搭建复杂、资源利用率低、★ 5,079
spark-nlpspark-nlp 是一个基于 Apache Spark 和 Spark ML 构建的自然语言处理库,提供生产级、可扩展的 NLP 解决方案。它解决了在大数据环★ 4,158
deequDeequ 是 AWS 开源、构建在 Apache Spark 之上的数据质量校验库,核心思路是把数据质量约束写成类似单元测试的断言,在超大规模数据集上批量扫描★ 3,648
luceboxlucebox 是一个面向异构硬件与消费级 GPU 的 LLM 投机推理服务器,用 C++ 编写并深度依赖 CUDA 与自定义内核。它要解决的问题是:在非数据中★ 2,885
around-dataengineeringaround-dataengineering 是一个数据工程与机器学习知识中心,旨在为数据从业者提供系统化的学习路径和实战参考。它聚合了数据工程、数据管道、数据★ 1,146
data-prep-kitdata-prep-kit 是一个面向生成式 AI(GenAI)应用的数据准备开源项目。它解决的是大模型训练和微调前数据清洗、转换、增强的繁琐问题,提供了一套模★ 966
GPT-WEB-JAVAGPT-WEB-JAVA 是一个基于 JDK8 的 AI 聊天机器人项目,旨在为开发者提供一套多平台集成的 AI 应用解决方案。它解决了单一 AI 服务接入复杂★ 778
dingoDingo 是一个面向 AI 数据、模型与应用的质量评测工具,用 Python 编写。它要解决的问题是:大模型项目里数据质量参差不齐、模型输出难以量化评估,团队★ 757
chatgpt-vue3-light-mvp这是一个基于 Vue 3、Vite 8、TypeScript、Naive UI、Pinia 和 UnoCSS 等主流技术构建的 Chat Bot 单轮对话 We★ 578
tracemltraceml 是 Polyaxon 生态下的 AI/ML 数据追踪与可视化引擎,专注于解决机器学习实验中的指标跟踪、数据漂移检测和模型可解释性问题。它提供了一★ 534
popmonpopmon 是一个用于监控 Pandas 或 Spark 数据框稳定性的开源库。它通过自动计算数据分布、统计指标和相关性等特征,并基于历史数据或预期值进行对比★ 511
dbldatagendbldatagen 是 Databricks Labs 推出的开源合成数据生成工具,专为 Databricks 环境设计,也可在 Spark 集群上运行。它解★ 498
Spark-X2.5Spark-X2.5 是一个面向端侧设备的开源大模型系列,目标是在手机、笔记本等本地硬件上把智能体(Agent)能力推到极限。它解决的核心问题是:云端大模型调用★ 498
flytekitflytekit 是 Flyte 平台的 Python 开发套件,用于编写和编排机器学习及数据处理工作流。它解决的是复杂数据管道和模型训练流程中任务编排难、可重★ 320
fastapifastapi 是一个用 Go 编写的企业级 LLM API 快速集成网关,旨在统一接入 OpenAI、Azure、文心一言、讯飞星火、通义千问、智谱 GLM、★ 300
fastapi-adminfastapi-admin 是一个用 Go 语言构建的企业级 LLM API 快速集成系统,旨在统一管理并代理多种主流大语言模型接口。它解决了企业在接入 Ope★ 258
data_science_blogs这是一个数据科学博客的配套代码仓库,作者将博客文章中涉及的所有代码集中管理。项目主要解决博客读者无法直接获取可运行代码的问题,提供从数据预处理、机器学习建模到可★ 252
whylogs-javawhylogs-java 是 whylogs 的 Java 实现,用于对机器学习数据管道进行端到端的画像(profiling)和监控。它解决的是 ML 数据质量★ 177
skardiSkardi 是一个用 Rust 编写的自改进上下文框架,面向 AI 智能体(agent)场景。它要解决的核心问题是:智能体在长期运行中,上下文(记忆、检索结果★ 104
mloperatormloperator 是一个面向 Kubernetes 的机器学习/AI 训练、推理服务及智能体沙箱的 Operator 和控制器。它解决了在 Kubernet★ 95
sales-forecast-mlops-at-scale这是一个面向需求预测的云原生机器学习全栈系统,旨在解决大规模、实时场景下的预测难题。它整合了数据流处理、模型推理、自动重训闭环等核心能力,支持从数据接入到预测结★ 88
TimeSeriesGANTimeSeriesGAN 是一个基于生成对抗网络(GAN)的时间序列分析工具,专注于合成数据生成、异常检测和插值。它利用 GAN 的生成能力来模拟真实时间序列★ 70