question-answering
本站收录 47 个带「question-answering」标签的 AI 开源项目
WeKnora腾讯开源的 LLM 知识平台,将原始文档转化为可查询的 RAG、自主推理 Agent 与自动维护的 Wiki。构建企业级知识中枢,让知识自动沉淀、检索与推理,助★ 31,212
PaddleNLPPaddleNLP 是百度飞桨生态下的自然语言处理库,定位为易用且强大的大模型与小模型库,内置丰富的模型动物园。它解决从文本分类、序列标注到大规模预训练模型微调★ 12,981
R2RR2R 是一个面向生产环境的 AI 检索系统,专注于智能体检索增强生成(Agentic RAG)。它解决了传统 RAG 系统在部署和集成上的痛点,将文档摄取、分★ 8,012
DeepPavlovDeepPavlov 是一个开源的深度学习对话系统库,旨在帮助开发者和研究人员快速构建端到端的聊天机器人和对话助手。它解决了从零搭建对话系统时面临的工程复杂性和★ 6,995
AdalFlowAdalFlow 是一个用于构建和自动优化大语言模型(LLM)应用的开源 Python 库。它旨在解决 LLM 应用开发中提示词调试繁琐、流程编排复杂以及性能调★ 4,218
spark-nlpspark-nlp 是一个基于 Apache Spark 和 Spark ML 构建的自然语言处理库,提供生产级、可扩展的 NLP 解决方案。它解决了在大数据环★ 4,158
bootcampBootcamp 是一个专注于非结构化数据搜索与分析的教程型开源项目,涵盖反向图像搜索、音频搜索、分子搜索、视频分析、问答系统及 NLP 等主题。它通过 Jup★ 2,445
alan-sdk-webAlan AI SDK for Web 是一个为网页应用提供对话式AI能力的开发工具包,它允许开发者通过简单的集成,为网站或Web应用添加语音和文本交互界面。该★ 2,427
fastRAGfastRAG是一个专注于高效检索增强生成(RAG)的开源框架,旨在解决企业落地RAG时面临的性能瓶颈和部署复杂性问题。它基于Haystack构建,但针对生产环★ 1,787
awesome-ai-web-search这是一个精选AI驱动的网页搜索工具列表,收录了各种利用大语言模型增强搜索体验的开源项目和商业服务。它解决了传统搜索引擎结果冗余、难以直接获取答案的问题,通过整理★ 1,459
GraphGenGraphGen 是一个面向大语言模型监督微调的数据合成框架,核心思路是用知识图谱驱动合成数据生成。它从给定知识源(如文档、知识库)中抽取实体与关系,构建知识图★ 1,226
insuranceqa-corpus-zh这是一个面向保险行业的中文语料库,专为训练聊天机器人和自然语言处理模型而设计。它解决了保险领域缺乏高质量、结构化问答数据的问题,提供了大量真实的保险咨询问题和对★ 1,068
PIXIUPIXIU 是一个开源金融大语言模型资源库,包含首个金融领域的大语言模型(FinMA)、指令微调数据集(FLARE)和评估基准(FLUE)。它解决金融领域缺乏专★ 890
rag-demystifiedrag-demystified 是一个从零开始构建的、由 LLM 驱动的进阶 RAG(检索增强生成)管道开源项目。它旨在揭开 RAG 技术的神秘面纱,通过清晰、★ 859
RAG-FiTRAG-FiT 是一个用于增强大语言模型在检索增强生成(RAG)任务中表现的微调框架。它解决了通用微调方法未针对 RAG 场景优化、导致模型在检索上下文利用和答★ 767
llmflowsLLMFlows 是一个用于构建大型语言模型(LLM)应用的 Python 框架,强调简单、明确和透明。它解决了 LLM 应用开发中常见的复杂性和不可控性问题,★ 708
chatchat 是一个基于 Python 的聊天机器人项目,利用自然语言理解与机器学习技术,为开发者提供可自定义的多轮对话能力。它解决了从零构建对话系统的复杂度问题,★ 702
rag-chatbotrag-chatbot 是一个基于 RAG(检索增强生成)技术的本地 PDF 对话工具,允许用户直接与多个 PDF 文档进行自然语言交互。它解决了传统 PDF ★ 688
RankifyRankify 是一个面向检索、重排序和检索增强生成(RAG)的综合性 Python 工具包,旨在为信息检索和 RAG 研究提供一站式解决方案。它集成了 40 ★ 685
MiniSearchMiniSearch 是一个极简的网页搜索平台,内置 AI 助手,完全在浏览器中运行,无需后端服务器。它解决了传统搜索依赖云端服务、隐私易泄露的问题,通过本地化★ 598
MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597
EnterpriseRAG-BenchEnterpriseRAG-Bench 是一个专为企业内部文档场景设计的 RAG(检索增强生成)评测基准与数据集。它解决的核心问题是:通用 RAG 评测集(如自★ 576
ArXivChatGuruArXivChatGuru 是一个基于 LangChain、OpenAI、Streamlit 和 Redis 构建的科研论文对话工具。它允许用户直接与 ArXi★ 561
KoalaQAKoalaQA 是一个基于 AI 大模型的开源售后服务社区平台,主要解决企业售后客服响应慢、人工成本高、知识复用难等问题。它提供 AI 自动回答、AI 搜索、A★ 555
wdocwdoc 是一个面向异构文档的智能知识管理与检索工具,旨在解决从大量格式各异的文档中快速提取和查询信息的痛点。它支持接入任意 LLM 提供商(如 OpenAI、★ 545
ai-powered-search这是 Manning 出版社 2025 年出版的《AI-Powered Search》一书的配套代码库,同时服务于同名 Maven 课程。项目聚焦现代检索系统,★ 411
Stream-OmniStream-Omni 是一个类似 GPT-4o 的多模态对话助手,能够同时处理文本、语音和视觉输入,并支持多种模态组合的交互。它解决了传统对话系统只能处理单一★ 392
megabotsmegabots 是一个旨在让 LLM 应用开发变得极其简单的开源框架,主打“生产就绪”和“开箱即用”。它解决了开发者从零构建聊天机器人时面临的高复杂度问题,通★ 350
dialogbotdialogbot 是一个面向中文场景的开源对话机器人框架,旨在提供开箱即用的多类型对话能力。它整合了问答型、任务型和生成型三种主流对话模式,并支持网络检索问答★ 328
RAG-QA-GeneratorRAG-QA-Generator 是一个面向检索增强生成(RAG)系统的自动化知识库构建与管理工具。它主要解决 RAG 应用中知识库构建耗时、人工标注成本高的问★ 277
aixploraAIxplora 是一个开源工具,让你能够查询各种类型的文件,不受长度或格式限制。它基于 TypeScript 构建,支持音频、PDF 等格式,利用嵌入模型和生★ 272
chatbot这是一个俄语生成式聊天机器人项目,旨在提供带用户画像和事实记忆的对话体验。它基于Python构建,综合运用机器学习、自然语言处理与理解、神经网络等技术,核心能力★ 259
Gossiping-Chinese-Corpus这是一个从台湾PTT八卦版抓取并整理的问答中文语料库,用于训练中文聊天机器人。项目将论坛中的帖子标题作为问题、回帖内容作为回答,构建了大规模的中文对话数据集,解★ 245
awesome-NLP-resources这是一个精选的自然语言处理(NLP)资源和工具集合,汇总了从基础到前沿的各类NLP项目,涵盖文本分类、命名实体识别、机器翻译、问答系统、知识图谱、语音处理等多个★ 239
raggoraggo 是一个用 Go 编写的轻量级、生产可用的 RAG(检索增强生成)库。它旨在解决开发者在 Go 生态中构建 RAG 应用时缺乏成熟、易用库的问题,提供★ 227
OnDevice-RAG-AndroidOnDevice-RAG-Android 是一个运行在 Android 设备上的本地 RAG(检索增强生成)流水线,专门用于从 PDF 和 DOCX 文档中实现★ 201
prontoqaProntoQA 是一个用于正式分析大语言模型在推理任务中思维链输出的合成问答数据集。它通过生成结构化的推理问题,帮助研究者和开发者评估模型在复杂逻辑推理上的表★ 168
LLM-KG4QALLM-KG4QA 是一个将大语言模型与知识图谱结合用于问答系统的开源项目。它解决的是纯大模型在回答事实性问题时容易产生幻觉、缺乏可解释性的痛点,通过知识图谱提★ 165
LoongLoong 是 EMNLP 2024 的 Oral 论文项目,专注于长上下文大语言模型(LLM)的评测基准。它针对现有长文本评测任务中“文档被截断”或“仅需单文★ 154
chatbotDBpedia Chatbot 是一个基于 Java 的对话助手项目,源自 Google Summer of Code(GSoC),旨在通过自然语言问答方式与 ★ 120
automixautomix 是一个用于混合语言模型的开源项目,核心思路是通过自验证(self-verification)和元验证(meta-verification)机制,★ 119
OkapiOkapi 是一个面向多语言场景的指令微调大语言模型项目,核心解决非英语语言(如中文、西班牙语、印地语等)在指令跟随和对话质量上表现不足的问题。项目基于 LLa★ 96
fuzi-nlu夫子的自然语言理解模块,是聊天机器人项目的核心组件。它基于PyTorch实现,专注于解决中文对话场景中的意图识别、槽位填充和问答匹配问题。项目采用联合NLU(J★ 88
napolabNapolab 是一个专注于葡萄牙语自然语言处理的基准测试项目,旨在系统评估和追踪葡萄牙语语言模型的最新进展。它通过精心策划的葡萄牙语任务集,为研究者、开发者和★ 72
VisualWebBenchVisualWebBench 是一个针对多模态大语言模型(MLLMs)在网页理解与定位(Grounding)任务上的评估框架,源自同名论文。它解决的核心问题是:★ 68
ATM-BenchATM-Bench 是一个用于评估 AI 智能体长期个性化记忆能力的基准测试平台。它解决了当前 AI 在跨长时间跨度、多模态数据(如图像、视频、邮件)中,难以准★ 67
slack-knowledge-assistant这是一个开源的 Slack 知识助手,旨在解决团队信息分散在各工具中难以快速检索的问题。它通过 Airweave 连接并索引公司内部的各种工具(如文档、工单、代★ 59