llm-reasoning

本站收录 12 个带「llm-reasoning」标签的 AI 开源项目

rllmrllm是一个致力于将强化学习(RL)技术普及到大型语言模型(LLM)训练与推理中的开源框架。它主要解决当前LLM在复杂推理、决策和智能体任务中依赖监督微调、泛★ 5,851AReaLAReaL 是一个面向 LLM Agent 应用的开源强化学习框架,旨在简化并灵活地桥接强化学习与基于大语言模型的智能体应用。它解决了将 RL 技术应用于复杂 ★ 5,802FoundryFoundry 是一个面向智能体(Agent)的底层基础设施项目,定位为“智能体智能的基础层”。它提供了一套 Python 编写的智能体框架和运行时环境,旨在解★ 872buffer-of-thought-llmBuffer of Thoughts(BoT)是一个NeurIPS 2024 Spotlight开源项目,旨在通过“思想缓冲”机制增强大语言模型的多步推理能力。★ 678Awesome-Reasoning-Foundation-ModelsAwesome-Reasoning-Foundation-Models 是一个精选列表,收录了关于推理基础模型的最新论文和基准测试。该项目旨在为研究人员和开发者★ 660dLLM-RLdLLM-RL 是 ICLR 2026 论文 TraceRL 的官方代码库,专注于扩散大语言模型(Diffusion LLMs)的后训练强化学习。扩散模型在生成★ 524Awesome-Attention-Heads这是一个关于大语言模型注意力头可解释性的精选资源库与综述项目。它系统性地整理了针对LLM中注意力头(attention heads)的解读、分析和可视化相关的研★ 416Awesome-LLM-Reasoning-Failures这是一个围绕《Large Language Model Reasoning Failures》论文整理的开源资源库,系统收集大语言模型在推理任务中出错的案例、分★ 223SearchLMSearchLM 是 NeurIPS 2025 论文的官方实现,提出“迭代自我激励”机制,让大语言模型作为智能体进行搜索。它解决的是传统检索系统依赖外部评分器、★ 216pydantic-ai-todopydantic-ai-todo 是一个为 Pydantic AI 智能体设计的任务规划与跟踪工具集。它主要解决 AI 智能体在执行复杂任务时缺乏结构化任务管理★ 76PhyT2VPhyT2V 是一个面向物理感知文本生成视频(Text-to-Video)的官方开源实现,对应 CVPR 2025 论文。它解决的是现有视频生成模型在物理规律遵★ 67AMPOAMPO是一个面向语言智能体的自适应社会学习框架,通过模式策略优化(Mode Policy Optimization)让智能体在动态社会环境中学习协作与决策。它★ 52