chunkr

复杂文档一键变 RAG 可用的结构化分块数据

Chunkr 是一个用 Rust 构建的文档解析与视觉基础设施,专门把复杂文档(PDF、扫描件、表格、图文混排)转换成 RAG 和 LLM 可直接使用的结构化数据。它解决的核心问题是:传统文本抽取工具面对版面复杂、含图片表格的文档时,容易丢结构、丢上下文,导致检索和问答效果差。Chunkr 通过视觉模型识别版面元素,做智能分块(chunking)、表格提取、图片描述和 OCR,输出带层级和语义边界的 chunk,方便直接灌入向量库或大模型。项目提供 API 和自托管方式,强调高吞吐与可扩展,适合需要批量处理企业文档、构建知识库的团队。Rust 实现带来较好的性能和资源效率。

开源 freemium 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4152
维护状态 较活跃
是否开源 是
定价模式 freemium

项目数据

分类搜索知识
开发团队lumina-ai-inc
所属国家
官网地址https://chunkr.ai
定价模式freemium
价格说明提供免费额度,付费按量计费,定价信息待确认
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Rust
技术栈/模型
GitHub 星标★ 4152
30天Star增速
HF 下载量
上线时间2024-08-24 00:00:00
最近更新2026-09-25 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-26
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:Docker 6 步

环境要求

  • 已安装 Docker 与 Docker Compose
  • GPU 部署需安装 NVIDIA Container Toolkit(可选,CPU 部署不需要)
  • 本地已克隆仓库(git clone 后进入 chunkr 目录)

安装与启动步骤

  1. 1准备 Docker 环境

    按 README 前置要求安装 Docker 和 Docker Compose;若要 GPU 加速,还需额外安装 NVIDIA Container Toolkit。

  2. 2克隆项目仓库

    从 GitHub 拉取 chunkr 源码并进入项目目录,后续 compose 命令都在此目录执行。

    git clone https://github.com/lumina-ai-inc/chunkr
    cd chunkr
  3. 3配置 LLM

    README 给出两种方式:models.yaml 文件(可配多个 LLM 及高级选项)或环境变量(只配单个 LLM)。

  4. 4启动服务(GPU)

    有 NVIDIA GPU 时,直接用默认 compose 配置后台启动全部服务。

    docker compose up -d
  5. 5启动服务(CPU)

    没有 GPU 时,叠加 compose.cpu.yaml 以纯 CPU 方式后台启动。

    docker compose -f compose.yaml -f compose.cpu.yaml up -d
  6. 6停止服务

    需要关闭时,按对应的部署方式执行 down;CPU 部署记得带上 compose.cpu.yaml。

    docker compose down
    docker compose -f compose.yaml -f compose.cpu.yaml down

关键配置

配置项必填说明示例
models.yaml否高级 LLM 配置:可配置多个 LLM 及额外选项models.yaml
环境变量否简单 LLM 配置方式,仅用于配置单个 LLM(README 未列出具体变量名)在部署环境中注入 LLM 相关环境变量

如何确认成功

README 未提供验证命令,可用 docker compose ps 查看容器是否处于运行状态,确认服务已启动。

常见问题

Q:没有 GPU 可以部署吗?

A:可以。README 明确支持 CPU-only 部署,只需在 compose 命令后叠加 compose.cpu.yaml 文件即可,GPU 相关的 NVIDIA Container Toolkit 是可选项。

Q:开源自托管版和官网云 API 有什么区别?

A:README 说明两者不同:开源 AGPL 版使用社区/开源模型,云 API 使用自研专有模型,在准确率、速度和可靠性上更高。

Q:如何配置使用的 LLM?

A:支持两种方式:models.yaml 文件用于配置多个 LLM 及高级选项,环境变量方式用于简单配置单个 LLM,按需二选一。

Q:怎么关闭已经启动的服务?

A:执行 docker compose down;如果是 CPU 部署,需要写成 docker compose -f compose.yaml -f compose.cpu.yaml down 才能正确停止。

注意事项

  • 开源版与 chunkr.ai 云 API 是两套不同实现,模型来源不同,效果存在差异。
  • GPU 部署前请先确认 NVIDIA Container Toolkit 已正确安装,否则容器无法使用显卡。
  • CPU 与 GPU 两种启动方式必须使用不同的 compose 组合,不要混用。
  • README 未给出具体环境变量名、端口号和服务地址,配置前建议查看仓库内 models.yaml 与 compose 文件。

核心亮点

  • 用视觉模型理解版面,表格、图片、多栏排版也能保留结构,比纯文本抽取更适合 RAG
  • Rust 实现,性能和资源效率较好,适合批量文档处理
  • 输出带语义边界的 chunk,可直接对接向量库和 LLM,减少二次清洗

不足之处

  • 依赖视觉模型,本地部署对 GPU 或推理服务有要求,轻量场景成本偏高
  • 项目仍在成长期,生态集成和周边工具相比成熟方案还不够丰富

适用场景

  • 企业把合同、财报、扫描件批量转成知识库供 RAG 问答
  • 开发者构建文档问答应用时,需要高质量分块和表格提取
  • 研究或数据团队处理图文混排 PDF,抽取结构化内容做分析

替代项目

Unstructured、LlamaParse、Docling

项目介绍

chunkr 是搜索知识领域的开源项目,由 lumina-ai-inc 开发,2024 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(4,152)位列前 10%,在搜索知识分类的 586 个项目里位列前 12%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-25。提供免费额度,付费按量计费。

它主要面向的使用场景是:企业把合同、财报、扫描件批量转成知识库供RAG问答。同类可对比的替代方案包括 Unstructured、LlamaParse、Docling。

上一篇:medical-rag

下一篇:没有了!

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
qiaomu-youtube-ai-podcast 开源

一站式索引AI播客,快速找到有文字稿和总结的节目

AI 播客索引:整理 AI 播客、中文简介、Transcript 状态和总结入口 | Curated AI podcast ···

★ 70 2026-08-09