nlp
本站收录 366 个带「nlp」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817
LlamaFactory统一的 LLM 高效微调框架,支持 100+ 主流模型(LLM 与 VLM),集成 LoRA 等前沿技术,被 ACL 2024 收录,是微调领域最流行的开源工具★ 75,189
AI-For-Beginners微软出品的AI入门教程,专为初学者设计,用12周24课时的结构系统讲解人工智能核心知识。课程覆盖神经网络基础、计算机视觉(CNN)、自然语言处理(RNN)、生成★ 69,261
ai-engineering-from-scratch这是一个面向AI工程师的免费开源课程,旨在帮助学习者从零开始掌握AI工程的核心技能。项目内容涵盖机器学习、深度学习、生成式AI、计算机视觉、大语言模型和智能体等★ 61,160
BettaFish微舆(BettaFish)是一个基于Python从零实现的多Agent舆情分析助手,不依赖任何现成框架。它通过多个智能体协作,自动完成舆情信息的采集、清洗、分析★ 42,315
langextractlangextract 是一个 Python 库,旨在利用大型语言模型从非结构化文本中提取结构化信息,并具备精确的源定位和交互式可视化能力。它解决了传统文本提取★ 38,918
500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code这是一个收录了约500个AI、机器学习、深度学习、计算机视觉和自然语言处理项目的代码合集仓库,本质上是面向学习者和开发者的资源索引。它解决的核心问题是:初学者面★ 37,051
stormSTORM是一个基于大语言模型的知识整理系统,能够针对用户给定的主题进行自主研究,并生成带有引用的完整长篇报告。它通过多智能体协作模拟人类写作流程,包括资料收集★ 31,536
RAG_TechniquesRAG_Techniques 是一个专注于检索增强生成(RAG)技术的开源教程仓库,汇集了从基础到前沿的多种 RAG 实现方法。它通过一系列详细的 Jupyte★ 29,631
CV这是一份已完结的深度学习综合学习笔记,整合了多个知名课程的精髓,包括土堆的Pytorch教程、李沐的《动手学深度学习》、吴恩达的《深度学习》以及大飞的《大模型A★ 23,851
best-of-ml-python这是一个精选的机器学习Python库排行榜,每周自动更新,按GitHub星标数排序,帮助开发者快速发现和评估优秀的ML工具。它解决了机器学习生态中库数量庞大、质★ 23,828
Awesome-Chinese-LLMAwesome-Chinese-LLM 是一个精选中文大语言模型资源的开源项目,旨在整理和汇总国内开源的中文大模型,尤其侧重规模较小、可私有化部署、训练成本较低★ 22,774
unilmUniLM是微软开源的大规模自监督预训练模型系列,旨在统一处理自然语言理解与生成任务。它基于Transformer架构,通过掩码语言建模、序列到序列建模等预训练★ 22,226
datasetsdatasets 是 Hugging Face 推出的开源数据集库,旨在成为 AI 模型就绪数据集的中心枢纽。它解决了机器学习从业者在数据获取、处理和加载过程中★ 22,016
rasaRasa 是一个开源的对话式 AI 框架,用于构建文本和语音驱动的聊天机器人与语音助手。它拆分为两个核心模块:Rasa NLU 负责意图识别和实体抽取,Rasa★ 21,331
FinGPTFinGPT 是一个开源的金融大语言模型项目,旨在为金融领域提供可定制、可访问的 LLM 解决方案。它解决了金融文本处理中数据隐私、高成本和领域适配难题,通过数★ 21,303
Chinese-LLaMA-AlpacaChinese-LLaMA-Alpaca 是一个专注于中文大语言模型的开源项目,旨在将 Meta 的 LLaMA 和 Stanford 的 Alpaca 模型进★ 18,939
memvidmemvid 是一个为 AI 代理提供记忆层的开源项目,旨在用无服务器、单文件的记忆层替代复杂的 RAG 流水线。它解决了 AI 代理在长期对话或任务中缺乏持久★ 16,566
nano-vllmnano-vllm 是一个轻量级的大语言模型推理引擎,旨在以极简的代码实现 vLLM 的核心功能。它解决了 vLLM 等大型推理框架依赖重、部署复杂的问题,让开★ 15,661
unstructuredUnstructured 是一个开源的 ETL 工具,专注于将复杂文档(如 PDF、Word、PPT、图片等)转换为干净、结构化的数据,以便直接用于大语言模型(★ 15,519
botpressBotpress 是一个开源的对话式 AI 平台,用于构建和部署 GPT/LLM 驱动的智能体。它解决了从零搭建聊天机器人的复杂性问题,提供可视化的流程设计器、★ 14,925
txtaitxtai 是一个全栈 AI 框架,旨在将语义搜索、大语言模型编排和语言模型工作流整合到一个统一的工具中。它解决了从非结构化文本中高效检索信息、构建 RAG 应★ 12,988
PaddleNLPPaddleNLP 是百度飞桨生态下的自然语言处理库,定位为易用且强大的大模型与小模型库,内置丰富的模型动物园。它解决从文本分类、序列标注到大规模预训练模型微调★ 12,981
presidioPresidio 是一个开源的敏感数据检测与匿名化框架,用于在文本、图像和结构化数据中识别、脱敏、遮蔽和匿名化个人身份信息(PII)。它通过 NLP 实体识别、★ 11,095
openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935
petalsPetals 是一个去中心化的 LLM 推理与微调框架,采用 BitTorrent 风格的点对点网络,将大型语言模型(如 Llama、Falcon、BLOOM)★ 10,592
stanford-tensorflow-tutorials这是一个斯坦福大学课程《TensorFlow for Deep Learning Research》的配套代码仓库,由课程讲师Chinmay Halbe维护。它★ 10,373
LLMsPracticalGuideLLMsPracticalGuide 是一个精心策划的实用指南资源列表,专注于大语言模型(LLMs)的实践应用。它汇集了 LLMs 的树状结构、示例和论文,旨在★ 10,211
LLM-Agent-Paper-List这是一个关于大语言模型智能体(LLM Agent)的论文清单,源自一篇发表在《中国科学:信息科学》封面上的86页综述论文《The Rise and Potent★ 8,221
Chinese-LLaMA-Alpaca-2Chinese-LLaMA-Alpaca-2 是面向中文场景的 LLaMA-2 和 Alpaca-2 大语言模型二期开源项目,旨在解决原版 LLaMA-2 中文★ 7,114
DeepPavlovDeepPavlov 是一个开源的深度学习对话系统库,旨在帮助开发者和研究人员快速构建端到端的聊天机器人和对话助手。它解决了从零搭建对话系统时面临的工程复杂性和★ 6,995
trafilaturaTrafilatura 是一个用 Python 编写的网页文本与元数据抓取工具,同时提供命令行接口。它解决的核心问题是:从杂乱无章的 HTML 页面中精准提取正★ 6,890
nlp.jsnlp.js 是一个用 JavaScript 编写的自然语言处理库,专为构建聊天机器人而设计。它解决了开发者在创建对话式 AI 时面临的常见痛点,如意图识别、实★ 6,583
argos-translateArgos Translate 是一个基于 Python 的开源离线翻译库,利用 OpenNMT 等神经网络模型实现高质量的机器翻译。它解决了在线翻译服务依赖网★ 6,519
courses这是一个精选的AI学习资源集合,收录了关于人工智能、机器学习、深度学习、计算机视觉、自然语言处理、多模态、生成模型和MLOps等领域的课程与资料链接。项目以Ma★ 6,487
smileSmile是一个基于Java的统计机器智能与学习引擎,专注于提供全面、高效的机器学习与数据挖掘工具。它解决了Java生态中缺乏功能完整且性能优异的ML库的问题,★ 6,414
TagUITagUI 是由 AI Singapore 开发的一款免费开源 RPA(机器人流程自动化)工具,旨在帮助用户通过自然语言或可视化方式快速构建自动化流程。它解决了★ 6,338
awesome-pretrained-chinese-nlp-models这是一个高质量中文预训练模型、大模型、多模态模型及大语言模型的精选集合,旨在为中文NLP从业者提供一站式模型资源导航。项目系统整理了从BERT、GPT到LLaM★ 5,593
openmedopenmed 是一个本地优先的医疗 AI 开源项目,专注于临床命名实体识别(NER)和 HIPAA 合规的 PII 去标识化,所有处理完全在设备端运行,无需云★ 5,436
EasyR1EasyR1 是一个基于 veRL 的高效、可扩展的多模态强化学习训练框架,专注于解决视觉-语言模型(VLM)在强化学习训练中的效率与扩展性问题。它支持大规模并★ 5,176
Bard-APIBard-API 是一个非官方的 Python 库,通过用户提供的 Cookie 值直接调用 Google Bard(现为 Gemini)的底层接口,从而获取 ★ 5,172
argillaArgilla 是一个面向 AI 工程师和领域专家的协作工具,专注于构建高质量数据集。它解决了 LLM 项目中数据标注、反馈收集和数据集管理的痛点,提供直观的 ★ 5,128
SynonymsSynonyms 是一个专注于中文近义词处理的开源工具包,主要面向聊天机器人和智能问答场景。它解决了中文自然语言处理中同义表达识别困难的问题,通过提供高效的近义★ 5,110
AutoGPTQAutoGPTQ 是一个基于 GPTQ 算法的 LLM 量化工具包,提供简洁易用的 API,帮助开发者将大语言模型压缩为低比特(如 4-bit)表示,从而大幅降★ 5,067
Huatuo-Llama-Med-Chinese本草(原名华驼)是一个基于中文医学知识的大语言模型指令微调项目,旨在构建具备专业医学问答能力的开源模型。它通过收集中文医学语料,对Llama等基础模型进行指令微★ 4,996
ml-roadml-road 是一个面向机器学习和智能体 AI 的学习资源与实践项目,旨在为开发者提供从基础到前沿的系统化学习路径。项目整合了深度学习、计算机视觉、自然语言处★ 4,942
Learn_PromptingLearn_Prompting 是一个专注于提示工程(Prompt Engineering)、生成式 AI 和大语言模型(LLM)的开源学习指南。它由 Lear★ 4,740
PromptifyPromptify 是一个专注于提示工程(Prompt Engineering)的 Python 库,旨在帮助开发者更高效地使用 GPT 等大语言模型,并获取结★ 4,641
LLMBook-zh.github.io《大语言模型》是一本由中国人民大学赵鑫教授团队编写的中文开源教材,旨在系统性地介绍大语言模型的技术原理、架构设计与应用实践。全书覆盖从基础概念到前沿进展的完整知★ 4,584
Awesome-AIGC-TutorialsAwesome-AIGC-Tutorials 是一个精选的 AIGC 学习资源合集,涵盖大语言模型、AI 绘画、多模态等领域。它解决了 AIGC 领域信息分散、★ 4,548