smart-llm-loader

把任意文档变成 LLM 能吃的块,省下预处理时间,专注做应用。

smart-llm-loader 是一个轻量级 Python 包,用于将各种文档(PDF、Markdown 等)转换为适合 LLM 处理的文本块。它解决了 RAG、聊天机器人和文档问答等应用中常见的文档预处理痛点,如格式解析、文本清洗和智能分块。核心能力包括:自动识别文档结构、基于语义的分块策略、与 LangChain 和 LlamaIndex 等主流框架无缝集成,并支持 OpenAI、Claude、Gemini 等模型。通过简单的 API,开发者可以快速将原始文档转换为高质量的 LLM 输入,减少预处理时间,专注于核心应用逻辑。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 291
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队drmingler
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型chatbot,chunking,claude,gemini,langchain,llama-index,markdown,openai,pdf-converter,pdf-parser,pdf-to-markdown,rag
GitHub 星标★ 291
30天Star增速
HF 下载量
上线时间2025-02-13 00:00:00
最近更新2026-09-24 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 自动解析 PDF 和 Markdown,保留标题、列表等结构,分块更智能
  • 与 LangChain、LlamaIndex 直接集成,无需额外适配代码
  • 支持多模型(OpenAI/Claude/Gemini),灵活适配不同 LLM 场景

不足之处

  • 早期项目,文档和社区支持待观察
  • 对复杂表格和扫描版 PDF 的解析效果可能有限

适用场景

  • 构建 RAG 系统,快速处理本地文档库
  • 开发文档问答机器人,需要精准引用原文
  • 批量转换 PDF 报告为结构化 Markdown 供 LLM 分析

替代项目

unstructured、LlamaParse、langchain-text-splitters

项目介绍

smart-llm-loader 是搜索知识领域的开源项目,由 drmingler 开发,2025 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 291。

项目仍在小幅维护中,最近一次代码更新于 2026-09-24。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:构建RAG系统,快速处理本地文档库。同类可对比的替代方案包括 unstructured、LlamaParse、langchain-text-splitters。

上一篇:ThinkRAG

下一篇:DataChad

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09