optillm

给 LLM 推理加个外挂,自动优化提示词和采样策略,提升答案质量与效率。

optillm 是一个面向大语言模型(LLM)推理场景的优化代理服务。它位于客户端与模型服务之间,通过集成多种前沿推理优化技术,如思维链(CoT)、自我一致性、重复采样、树状搜索等,自动或按策略选择最优的推理路径,从而在不改变模型本身的前提下,提升输出质量、准确率和推理效率。项目旨在解决 LLM 在实际应用中推理成本高、结果不稳定、复杂任务处理能力不足等问题,为开发者提供一套即插即用的优化层,支持与主流模型 API 兼容,并可通过简单的配置或 REST API 接入现有系统。核心能力包括多策略调度、动态提示词优化、结果聚合与评估,以及可扩展的插件式架构。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4304
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队algorithmicsuperintelligence
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自行部署使用,完全免费。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agent,agentic-ai,agentic-framework,agentic-workflow,agents,api-gateway,chain-of-thought,genai,large-language-models,llm,llm-inference,llmapi,mixture-of-experts,moa,monte-carlo-tree-search,openai,openai-api,optimization,prompt-engineering,proxy-server
GitHub 星标★ 4304
30天Star增速
HF 下载量
上线时间2024-08-22 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • Python 3 环境(需支持 python3 -m venv)
  • pip 包管理工具
  • 可选:Docker,用于容器化部署
  • 上游模型服务的 API Key(如 OPENAI_API_KEY、GEMINI_API_KEY)

安装与启动步骤

  1. 1安装 OptiLLM

    使用 pip 从 PyPI 安装官方包,这是 README 给出的最快方式。建议在独立虚拟环境中安装,避免依赖冲突。

    pip install optillm
  2. 2源码安装

    需要二次开发时用源码方式:克隆仓库、建虚拟环境、激活后安装 requirements.txt 里的依赖。

    git clone https://github.com/algorithmicsuperintelligence/optillm.git
    cd optillm
    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
  3. 3Docker 启动服务

    拉取官方镜像并映射 8000 端口启动代理服务。镜像变体:latest 为完整版,latest-proxy 仅代理,latest-offline 可离线。

    docker pull ghcr.io/algorithmicsuperintelligence/optillm:latest
    docker run -p 8000:8000 ghcr.io/algorithmicsuperintelligence/optillm:latest
  4. 4设置模型密钥

    代理需要调用上游模型,把对应服务的 API Key 写入环境变量。OpenAI 与 Azure OpenAI 都使用 OPENAI_API_KEY。

    export OPENAI_API_KEY=sk-xxxxxxxx
  5. 5客户端调用

    把 OpenAI 客户端的 base_url 指向 http://localhost:8000/v1,模型名前加 slug(如 moa)即可启用对应优化技术。

    import os
    from openai import OpenAI
    
    OPENAI_KEY = os.environ.get("OPENAI_API_KEY")
    OPENAI_BASE_URL = "http://localhost:8000/v1"
    client = OpenAI(api_key=OPENAI_KEY, base_url=OPENAI_BASE_URL)
    
    response = client.chat.completions.create(
      model="moa-gpt-4o",
      messages=[{"role": "user", "content": "Write a Python program to build an RL model to recite text from any position that the user provides, using only numpy."}],
      temperature=0.2
    )
    
    print(response)

关键配置

配置项必填说明示例
OPENAI_API_KEY上游 OpenAI / Azure OpenAI 服务的调用密钥sk-xxxxxxxx
GEMINI_API_KEY使用 Gemini 等非 OpenAI 模型时设置对应密钥your-gemini-api-key
OPENAI_BASE_URL客户端 base_url,指向本地代理服务地址http://localhost:8000/v1
extra_body.optillm_approach在请求体中直接指定优化技术,可用 | 或 & 组合bon|moa|mcts
~/.optillm/mcp_config.jsonMCP 服务配置文件路径,transport 默认 stdio~/.optillm/mcp_config.json

如何确认成功

启动日志出现 Loaded plugin 与 "Starting server with approach: auto",客户端请求返回 HTTP 200 即成功。

常见问题

Q:如何指定使用哪种优化技术?

A:三种方式:模型名前加 slug(如 moa-gpt-4o);请求体 extra_body 传 optillm_approach;或在 prompt 中用 标签。注意 slug 方式要求服务以 auto 模式启动。

Q:可以同时使用多种技术吗?

A:可以。用 & 按从左到右顺序组成管道,前一阶段结果作为后一阶段输入;用 | 并行执行并返回多个结果组成的列表。

Q:支持 OpenAI 以外的模型吗?

A:支持,通过封装 LiteLLM SDK 接入各家模型。例如设置 GEMINI_API_KEY 后调用 moa-gemini/gemini-1.5-flash-002。

Q:Docker 镜像有哪些版本可选?

A:latest 为包含本地推理与插件的完整版;latest-proxy 为不含本地推理的轻量代理版;latest-offline 预下载模型可完全离线运行。

注意事项

  • README 节选未给出 pip 安装后的服务启动命令,具体启动方式请查阅仓库最新文档。
  • 使用 {slug}-model-name 前缀方式时,optillm 服务必须以 auto 推理模式启动,否则 model 字段只能填模型名。
  • optillm 是透明代理,可对接任何具备 OpenAI 兼容 chat completions 端点的服务。
  • 关闭 SSL 校验仅适用于开发环境或自签证书/企业代理场景。

核心亮点

  • 集成多种推理优化策略(CoT、自一致性、树搜索等),开箱即用
  • 作为代理层,无需修改模型即可提升性能,兼容现有 API
  • 提供 REST API 和可配置策略,易于集成到现有应用

不足之处

  • 项目处于成长阶段,文档和社区生态尚待完善
  • 优化策略可能增加推理延迟,需权衡质量与速度

适用场景

  • 需要提升 LLM 回答准确率的复杂问答场景
  • 对推理成本敏感,希望通过优化减少无效计算
  • 希望在不改动模型的情况下快速实验多种推理策略

替代项目

vLLM、Text Generation Inference、SGLang

项目介绍

optillm 是基础设施领域的开源项目,由 algorithmicsuperintelligence 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,304)位列前 10%,在基础设施分类的 1,130 个项目里位列前 15%。

近 42 天,它的 GitHub 星标从 4,236 增加到 4,304,净增 68。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可自行部署使用,完全免费。

它主要面向的使用场景是:需要提升LLM回答准确率的复杂问答场景。同类可对比的替代方案包括 vLLM、Text Generation Inference、SGLang。

上一篇:agentos

下一篇:deepflow

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09