unstructured-data

本站收录 17 个带「unstructured-data」标签的 AI 开源项目

fiftyoneFiftyOne 是一个面向计算机视觉团队的开源数据集管理与模型评估工具,由 Voxel51 开发。它解决了视觉 AI 开发中数据质量差、模型错误难以定位、数据★ 11,130llm-graph-builderllm-graph-builder 是一个利用大语言模型从非结构化数据自动构建 Neo4j 知识图谱的开源工具。它解决了传统知识图谱构建依赖人工建模和清洗的痛点★ 5,269docetlDocETL 是一个面向智能体 LLM 的数据处理与 ETL 系统。它解决传统 ETL 管道无法灵活处理非结构化数据(如文本、日志、文档)的痛点,将大语言模型作★ 4,110towheeTowhee 是一个专注于神经数据处理的 Python 框架,旨在让构建和运行 AI 驱动的数据管道变得简单高效。它解决的是从原始数据(文本、图像、音视频等)到★ 3,450datachaindatachain 是一个面向非结构化数据的上下文层,它将存储在 S3、GCS、Azure Blob 等对象存储中的文件(如图片、视频、文档)抽象为类型化、版本★ 2,818bootcampBootcamp 是一个专注于非结构化数据搜索与分析的教程型开源项目,涵盖反向图像搜索、音频搜索、分子搜索、视频分析、问答系统及 NLP 等主题。它通过 Jup★ 2,445instill-coreInstill Core 是一个全栈式 AI 基础设施工具,专注于数据、模型和流水线的编排,旨在简化构建 AI 原生应用的各个环节。它解决了 AI 开发中数据预★ 2,321docextdocext 是一个本地部署的、无需 OCR 的非结构化数据提取与 Markdown 转换工具包,同时提供基准测试能力。它主要解决企业从 PDF、Word、扫描★ 2,086contextgemContextGem 是一个专注于从文档中提取结构化信息的 Python 库,旨在简化 LLM 在文档解析和信息抽取任务中的使用流程。它解决了传统 LLM 提取★ 2,005extractousextractous 是一个用 Rust 编写的高性能非结构化数据提取库,旨在解决从 PDF、Word、HTML、图片等各类文件中快速提取文本和元数据的问题。它★ 1,780lotusLotus 是一个专注于大规模数据处理的开源框架,旨在为代理(Agent)和大型语言模型(LLM)提供高效的批量处理能力。它解决了传统 LLM 在处理海量数据时★ 1,707thepipethepipe 是一个基于视觉语言模型(VLM)的文档数据清洗工具,专门解决从复杂文档(如扫描件、PDF、PPT、表格、手写笔记等)中提取干净结构化数据的问题。★ 1,529OpenContractsOpenContracts 是一个面向构建者和开发者的开源文档智能平台,定位为智能体世界的文档管理系统(DMS)。它解决的是非结构化文档(如 PDF、扫描件)在★ 1,492spotlightSpotlight 是一个基于 TypeScript 的开源交互式数据探索工具,专为处理非结构化数据集而设计。在机器学习和数据科学工作中,图像、音频、视频等非结★ 1,276nucliadbNucliaDB 是一个专为 RAG(检索增强生成)设计的 AI 搜索数据库。它解决了传统数据库在非结构化数据(如文本、PDF、视频等)上难以进行语义检索和向量★ 721RAG-QA-GeneratorRAG-QA-Generator 是一个面向检索增强生成(RAG)系统的自动化知识库构建与管理工具。它主要解决 RAG 应用中知识库构建耗时、人工标注成本高的问★ 277open-extractopen-extract 是一个面向 AI 代理的结构化数据提取工具,旨在让代理通过一次工具调用,从文档或网页中搜索特定数据,并以 JSON 或 Markdow★ 189