adaptive-chunking

自动为每篇文档挑最佳分块法,提升 RAG 检索准确率

Adaptive Chunking 是一个用于 RAG(检索增强生成)的智能文本分块工具,核心思想是根据每篇文档的自身特点自动选择最优的分块策略,而不是对所有文档使用统一的固定分块方法。它解决了 RAG 系统中因分块不当导致的检索质量下降问题,例如固定长度切分可能切断语义完整段落或引入噪声。该项目基于文档的多种特征(如结构、长度、主题一致性等)进行动态评估,并自动匹配最合适的分块算法(如递归字符分割、语义分割等),从而提升检索准确率和生成质量。该研究已被 LREC 2026 会议接收,具备学术严谨性。项目提供 Python 接口,易于集成到现有 RAG 流程中。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 394
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队ekimetrics
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型chunking,information-retrieval,llm,nlp,rag,text-splitting
GitHub 星标★ 394
30天Star增速
HF 下载量
上线时间2026-03-26 00:00:00
最近更新2026-09-24 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 针对不同文档自适应选择分块策略,避免一刀切导致的语义割裂
  • 基于学术研究(LREC 2026),方法有理论支撑
  • Python 接口简洁,易集成到 LangChain 等 RAG 框架

不足之处

  • 项目处于早期,文档和社区支持尚待完善
  • 自适应选择可能带来额外计算开销,影响处理速度

适用场景

  • 处理混合类型文档的 RAG 系统(如网页、PDF、论文混合)
  • 需要高精度检索的企业知识库问答场景
  • 长文档与短文本并存,需要动态调整分块粒度的场景

替代项目

LangChain Text Splitters、LlamaIndex Node Parser、Semantic Chunking (e.g., semantic-text-splitter)

项目介绍

adaptive-chunking 是搜索知识领域的开源项目,由 ekimetrics 开发,是 2026 年新上线的项目。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 394。

项目仍在小幅维护中,最近一次代码更新于 2026-09-24。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:处理混合类型文档的RAG系统(如网页、PDF、论文混合)。同类可对比的替代方案包括 LangChain Text Splitters、LlamaIndex Node Parser、Semantic Chunking (e.g.,。

上一篇:advanced-rag

下一篇:VectorDB-Plugin

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09