gpt-oss

本站收录 18 个带「gpt-oss」标签的 AI 开源项目

ollama最流行的本地大模型运行工具,用 Go 编写,一条命令即可在本地跑起 Kimi、DeepSeek、Qwen、Gemma、GLM 等主流开源模型,无需复杂配置,兼顾★ 181,923vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594LEANNLEANN 是一个面向个人设备的轻量级 RAG(检索增强生成)引擎,旨在解决传统 RAG 系统在存储和隐私方面的痛点。它通过创新的索引压缩技术,将向量索引的存储★ 12,970oumioumi 是一个专注于开源大语言模型(LLM)微调、评估和部署的全流程工具包。它旨在简化从模型选择到生产部署的复杂流程,支持 Qwen、Gemma、Llama ★ 9,392GenieXGenieX 是一个专为高通设备设计的开源推理引擎,旨在让开发者通过几行代码即可在本地运行前沿的大语言模型(LLM)和视觉语言模型(VLM)。它充分利用高通芯片★ 8,406xtunerXTuner 是一个专为超大规模 MoE(混合专家)模型设计的下一代训练引擎。它解决了传统训练框架在 MoE 模型上显存占用高、训练效率低、扩展性差的问题,提供★ 5,205SidekickSidekick 是一款原生 macOS 应用,让你无需安装任何额外软件,就能在本地与 LLM 对话,并让它基于你 Mac 上的文件、文件夹和网页内容来回答。它★ 3,315papersgpt-for-zoteroPapersGPT for Zotero 是一款专为 Zotero 文献管理工具打造的 AI 对话与 MCP 插件,旨在解决科研人员在阅读和管理文献时信息获取效★ 2,662tokenspeedTokenSpeed 是一个主打极致推理速度的 LLM 推理引擎,目标是让大模型在现有硬件上跑出“光速”级别的 token 生成速度。它通过优化内存访问、算子融★ 2,186Atomic-ChatAtomic-Chat 是一款面向本地智能体的 AI 对话应用与推理引擎,旨在让用户完全离线、私密地运行开源大模型。它基于 TypeScript 构建,深度集成★ 1,650AutomodelAutomodel 是一个基于 PyTorch 分布式原生的 LLM/VLM 训练库,目标是让大模型微调像调用 Hugging Face 一样简单。它直接兼容 ★ 985codexiacodexia 是一个轻量级的智能体工作站,专为 Codex CLI 和 Claude Code 设计,旨在提升 AI 编码代理的使用效率。它解决了多任务并行、★ 920BigMoeOnEdgeBigMoeOnEdge 是一个让 MoE(混合专家)大模型跑在内存不足设备上的推理方案,核心思路是流式加载专家权重:模型的总参数量可以远超设备 RAM,但每次★ 595awesome-codex-cli这是一个精选资源列表,汇集了围绕 OpenAI Codex CLI 的各类工具、教程和资源。Codex CLI 是 OpenAI 推出的开源命令行 AI 编程助★ 117mcore-bridgemcore-bridge 是一个面向 Megatron-Core 的模型定义桥接库,目标是把 Megatron 的训练能力包装成类似 HuggingFace T★ 102gguf-loadergguf-loader 是一个专注于本地离线运行大语言模型的开源工具,旨在简化 GGUF 格式模型的加载与管理。它解决了普通用户在使用 Ollama、llama★ 69hummingbirdhummingbird 是一个轻量级、零依赖的 C 语言运行时,专为大规模开源混合专家(MoE)语言模型设计。它通过统一 SSD、RAM 和 VRAM 为单一智★ 58