quantization

本站收录 56 个带「quantization」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

LlamaFactory统一的 LLM 高效微调框架,支持 100+ 主流模型(LLM 与 VLM),集成 LoRA 等前沿技术,被 ACL 2024 收录,是微调领域最流行的开源工具★ 75,189Chinese-LLaMA-AlpacaChinese-LLaMA-Alpaca 是一个专注于中文大语言模型的开源项目,旨在将 Meta 的 LLaMA 和 Stanford 的 Alpaca 模型进★ 18,939turbovecturbovec 是一个基于 TurboQuant 构建的向量索引库,使用 Rust 编写并提供 Python 绑定。它旨在解决大规模向量检索场景下的性能瓶颈问★ 17,262kimi-k3-in-ckimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78★ 8,795bitsandbytesbitsandbytes 是一个为 PyTorch 提供 k-bit 量化支持的开源库,旨在让大语言模型(LLM)的部署和微调更加高效、可访问。它解决了大模型显★ 8,505AutoGPTQAutoGPTQ 是一个基于 GPTQ 算法的 LLM 量化工具包,提供简洁易用的 API,帮助开发者将大语言模型压缩为低比特(如 4-bit)表示,从而大幅降★ 5,067CTranslate2CTranslate2 是一个专为 Transformer 类模型设计的高性能推理引擎,用 C++ 编写,支持 CPU(含 AVX、AVX2、NEON 等指令集★ 4,690nunchakununchaku 是 ICML 2025 Spotlight 论文 SVDQuant 的官方开源实现,专注于 4-bit 扩散模型的量化推理与微调。它通过低秩组★ 3,958SageAttention清华开源的量化注意力算子,相较 FlashAttention 可实现 2~5 倍加速,在语言、图像与视频模型上均保持端到端指标不损失,被 ICLR 2025、I★ 3,953llm-compressorllm-compressor 是 vLLM 团队推出的 LLM 压缩工具库,与 Hugging Face Transformers 无缝兼容。它解决的核心问题是★ 3,825ai-engineering-interview-questions这是一个面向AI工程师的面试准备资源库,以Markdown格式提供问答式速查表。它系统梳理了AI工程领域的核心知识点,涵盖大语言模型、智能体、微调、量化、MCP★ 3,242neural-compressorneural-compressor 是英特尔开源的模型压缩工具库,专注于低比特量化与稀疏化技术,支持 INT8、FP8、MXFP8、INT4、MXFP4、NVF★ 2,710xTuringxTuring 是一个面向个人和团队的开源大语言模型(LLM)个性化工具,旨在简化从数据预处理到模型微调的全流程。它解决了普通开发者难以快速上手 LLM 微调的★ 2,675AI-Engineering.academyAI-Engineering.academy 是一个专注于应用人工智能教育的开源项目,以 Jupyter Notebook 为载体,通过循序渐进的方式讲解 AI★ 2,384mixtral-offloadingmixtral-offloading 是一个让 Mixtral-8x7B 大模型在消费级硬件(如 Colab 免费版或个人桌面)上运行的工具。它通过智能的层卸载★ 2,334picolmpicolm 是一个极轻量级的开源大语言模型推理引擎,专为在超低资源设备上运行 10 亿参数模型而设计,例如仅 256MB 内存、10 美元成本的开发板。它用 ★ 2,200AngelSlimAngelSlim 是一个面向大语言模型的开源压缩工具包,旨在让模型压缩更易用、更全面、更高效。它解决了模型部署中体积大、推理慢、成本高的问题,提供从剪枝、量化★ 1,668rwkv.cpprwkv.cpp 是一个专注于在 CPU 上高效运行 RWKV 语言模型的推理引擎,支持 INT4、INT5、INT8 和 FP16 等多种量化精度。它解决了 ★ 1,583gpu_poorgpu_poor 是一个用于估算任意大语言模型(LLM)在本地部署时所需 GPU 显存和推理速度(token/s)的命令行工具。它通过解析模型的参数量、量化方式★ 1,400getigeti 是英特尔推出的计算机视觉模型训练平台,旨在用更少的数据和更短的时间构建高性能视觉模型。它解决了传统深度学习模型开发中数据标注成本高、训练周期长、调参复★ 1,344SpargeAttnSpargeAttn 是一个训练无关的稀疏注意力加速库,旨在加速任意模型(尤其是视频生成模型)的推理过程。它通过利用注意力分数中的稀疏性,动态跳过不重要的计算,★ 1,257nncfNNCF(Neural Network Compression Framework)是 Intel 开源的神经网络压缩框架,专为提升 OpenVINO 推理性能★ 1,204z80aiZ80-μLM 是一个极致的微型语言模型项目,通过2比特量化技术,将对话模型压缩到能在8位Z80处理器上运行的程度。它解决了复古计算机无法运行现代AI模型的问题★ 1,127OmniQuantOmniQuant 是一个针对大型语言模型(LLM)的量化技术,发表于 ICLR 2024 并被评为 spotlight。它旨在解决 LLM 在部署时内存和计算★ 954Awesome-Quantization-Papers这是一个精选神经网络量化相关论文的列表项目,持续跟踪AI顶会和期刊的最新研究成果。它系统整理了模型压缩、低比特量化、量化感知训练、后训练量化等方向的关键论文,帮★ 855haloHalo 是由 White Circle 开源的大语言与多模态模型训练框架,用 Python 编写。它面向从微调到强化学习后训练的完整流程,核心能力包括分布式训★ 798LightCompressLightCompress 是一个面向大模型压缩的开源工具包,由 EMNLP 2024 和 AAAI 2026 论文支撑,支持对 LLM(大语言模型)、VLM(★ 749SINQSINQ 是一个全新的 LLM 量化方法,目标是在不显著损失精度的情况下让任意大语言模型变得更小、运行更快。它已被 ICML 2026 接收,属于学术前沿的模型★ 630ARIS-in-AI-OfferARIS-in-AI-Offer 是一个面向 AI 领域秋招的中英双语面试速查表项目,由 ARIS 工具链自动生成。它解决 AI 求职者备考资料分散、更新不及时★ 559KIVIKIVI 是一个针对大语言模型 KV Cache 的免调优非对称 2bit 量化工具,由 ICML 2024 论文提出。它解决的是长上下文场景下 KV Cach★ 434quick-start-guide-to-llms这是《大型语言模型快速入门指南》一书的官方代码仓库,配套书籍内容,提供了一系列 Jupyter Notebook 示例,帮助读者从零开始理解大语言模型的核心概念★ 397q-diffusionQ-Diffusion 是 ICCV 2023 收录的扩散模型量化工具,主要解决 Stable Diffusion 等扩散模型在部署时内存占用大、推理速度慢的问★ 381franken_ocrfranken_ocr 是一个用纯 Rust 实现的 CPU 端 OCR 推理引擎,目标模型是百度 Unlimited-OCR——一个基于 DeepSeek-O★ 332pmetalPMetal 是一个面向 Apple Silicon 的高性能本地大模型框架,用 Rust 编写,目标是在 Mac 上把 LLM 推理、LoRA/QLoRA 微★ 321picollmpicollm 是一个专注于设备端(on-device)大语言模型推理的开源项目,通过 X-Bit 量化技术实现高效的模型压缩与推理。它支持 Gemma、Lla★ 318skillsskills 是 Qdrant 官方推出的智能体技能包,旨在为 AI 编程助手(如 Claude Code、Codex、Cursor)提供关于 Qdrant 向★ 253modern-llm-notebook这是一个从零开始构建现代大语言模型的实战课程,基于 PyTorch 和 Jupyter Notebook 实现。项目包含 26 个可运行的 Notebook,覆★ 219Awesome-Efficient-AIGCAwesome-Efficient-AIGC 是一个专注于高效 AIGC(人工智能生成内容)领域的精选资源列表,收录了相关论文、文档和代码。该项目旨在为高效 A★ 209spectralquantSpectralQuant 是一个针对大语言模型推理时 KV-Cache 压缩的开源工具库。它通过特征基旋转(Eigenbasis Rotation)和基于注水★ 203alpamayo-recipesalpamayo-recipes 是 NVIDIA Alpamayo 的开发者中心,面向自动驾驶与物理 AI 场景,提供一整套可直接运行的模型配方。它解决的核心★ 193DuQuantDuQuant 是一个针对大型语言模型(LLM)的量化方法,其核心创新在于通过双重变换(Dual Transformation)来重新分布激活值中的异常值(ou★ 188oreilly-hands-on-gpt-llm这是一个配套O'Reilly书籍《Hands-On GPT-LLM》的实战代码仓库,专注于大规模、高效AI模型部署。项目以Jupyter Notebook形式提★ 145mono-pixmono-pix 是一个将像素艺术图像转换为真实感图像的浏览器端工具。它利用人工智能技术,在本地浏览器中快速将低分辨率、像素化的图像(如游戏精灵图、复古图标)升★ 137model-serving-minefieldmodel-serving-minefield 是一个社区维护的 LLM 推理服务“踩坑登记册”,专门收集那些会让测量结果看似正常、实则自信地给出错误结论的陷阱★ 134sndr_core_engineSNDR Core Engine (Genesis) 是一个针对消费级 NVIDIA GPU(如 RTX 3090、A5000)的 vLLM 运行时补丁覆盖层,★ 132agentic-rlagentic-rl 是一个面向中文零基础学习者的 Agentic RL 教程项目,共 25 章,从强化学习与智能体基础概念讲起,逐步过渡到 GRPO 实战,并★ 114TFMQ-DMTFMQ-DM 是 CVPR 2024 Highlight 和 TPAMI 2025 论文的官方 PyTorch 实现,专注于扩散模型的训练后量化(PTQ)。扩★ 110aarambh-studioaarambh-studio 是一个完全用 Rust 和 Candle 框架从零构建的 decoder-only 大语言模型项目,不依赖 Python 或 Py★ 110docker-whisperdocker-whisper 是一个把 Whisper 语音识别服务打包成 Docker 镜像的开源项目,目标是让用户在自己的服务器上快速搭建一套兼容 Open★ 108kernel-skillskernel-skills 是一个面向 AI 编程代理的开源技能库,专注于高性能计算内核的编写、优化与调试,覆盖 CUDA、Triton 以及量化负载场景。它解★ 80