Gym

把模型丢进环境里跑,边评测边改进智能体

Gym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境中。传统 benchmark 通常只给固定题目和标准答案,难以衡量模型在多轮决策、工具调用和状态变化下的真实能力;Gym 提供统一的环境接口,让模型或智能体在环境中执行动作、获得反馈并累积奖励,从而支持强化学习式训练和更贴近实际的评测。项目用 Python 实现,覆盖 agents、benchmarks、environments、evaluation、llm、reinforcement-learning 等方向,适合研究者搭建自定义任务环境、跑基准测试、对比不同策略,也适合工程团队把评测流程标准化。它把环境、模型和评测指标解耦,便于复用和扩展,是连接 LLM 智能体与强化学习评测的中间层工具。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1197
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队NVIDIA-NeMo
所属国家
定价模式free
价格说明开源免费,NVIDIA NeMo Gym 框架
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agents,benchmarks,environments,evaluation,gym,llm,reinforcement-learning,reinforcement-learning-environments,rl-environment,rl-training
GitHub 星标★ 1197
30天Star增速
HF 下载量
上线时间2025-08-25 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.13.14 及以上版本(x86_64 或 ARM64)
  • 操作系统:Linux、macOS,Windows 需通过 WSL2
  • 已安装 uv 包管理器
  • 无需 GPU;示例使用 OpenAI,需要对应的 API Key

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 NeMo Gym 源码并进入项目目录。README 给出的是 SSH 地址,需已配置 GitHub SSH 密钥。

    git clone git@github.com:NVIDIA-NeMo/Gym.git
    cd Gym
  2. 2创建虚拟环境

    用 uv 创建 Python 3.13.14 的虚拟环境并激活。后续所有命令都要在此环境下执行。

    uv venv --python 3.13.14 && source .venv/bin/activate
  3. 3同步依赖

    在项目根目录下用 uv sync 安装项目依赖,完成后即可使用 gym 命令。

    uv sync
  4. 4创建模型配置文件

    在项目根目录新建 env.yaml,填入模型服务的 base URL、API Key 和模型名。示例使用 OpenAI。

  5. 5启动本地服务

    启动资源服务、智能体和模型三类本地服务。需保持该终端运行,不要关闭。

    gym env start 
        --resources-server mcqa 
        --model-type openai_model
  6. 6运行评测

    新开一个终端并激活虚拟环境,用 --no-serve 复用已启动的服务,先跑 5 条任务验证流程。

    source .venv/bin/activate
    
    gym eval run --no-serve 
        --agent mcqa_simple_agent 
        --input resources_servers/mcqa/data/example.jsonl 
        --output results/mcqa_rollouts.jsonl 
        --limit 5 
        --num-repeats 1

关键配置

配置项必填说明示例
policy_base_url模型服务的基础地址,示例为 OpenAI 官方接口https://api.openai.com/v1
policy_api_key调用模型服务的 API 密钥sk-xxxxxxxx
policy_model_name评测使用的模型名称gpt-4.1-2025-04-14

如何确认成功

启动服务后终端会列出 mcqa、mcqa_simple_agent、policy_model 三个实例;评测结束会打印 mean/reward、accuracy 等聚合指标。

常见问题

Q:运行 Gym 需要 GPU 吗?

A:不需要。README 明确说明 No GPU required,普通 CPU 环境即可完成安装和示例评测。

Q:只能用 OpenAI 的模型吗?

A:不是。快速开始示例用 OpenAI,README 同时说明支持本地与托管推理,包括 vLLM、Fireworks、OpenRouter 等,详见 Configure Model 文档。

Q:可以在 Windows 上直接运行吗?

A:README 要求 Windows 通过 WSL2 运行,不支持原生 Windows 环境,同时必须是 x86_64 或 ARM64 架构。

Q:为什么跑评测时要加 --no-serve?

A:因为模型、智能体和资源服务已经由 gym env start 单独启动,评测命令加 --no-serve 表示复用这些已运行的服务,而不是重新拉起一套。

注意事项

  • 必须先启动 servers,再在新终端执行评测命令,两个终端不要混用。
  • 评测前记得执行 source .venv/bin/activate 激活虚拟环境。
  • env.yaml 需放在项目根目录,API Key 属于敏感信息,不要提交到代码仓库。
  • 仓库克隆地址为 SSH 形式,未配置 SSH 密钥时需自行改用 HTTPS 地址。

核心亮点

  • 提供统一的环境接口,模型、智能体和评测逻辑解耦,方便替换和复用
  • 同时覆盖评测与强化学习训练场景,不只是打分,还能用反馈持续优化策略
  • Python 实现且标签覆盖 agents、benchmarks、RL 等方向,便于研究者快速接入自定义任务

不足之处

  • 项目仍处于成长阶段,星标约 1.2k,生态和第三方环境数量有限
  • 文档与社区成熟度待观察,复杂自定义环境的接入成本可能较高

适用场景

  • 研究团队搭建多轮决策任务,对比不同 LLM 智能体的表现
  • 开发者用环境反馈做强化学习微调,提升智能体在特定任务上的成功率
  • 工程团队把评测流程标准化,接入 CI 持续监控模型能力变化

替代项目

OpenAI Gym、PettingZoo

项目介绍

Gym 是评测安全领域的开源项目,由 NVIDIA-NeMo 开发,2025 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(1,197)位列前 30%,在评测安全分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,NVIDIA NeMo Gym 框架。

它主要面向的使用场景是:研究团队搭建多轮决策任务,对比不同LLM智能体的表现。同类可对比的替代方案包括 OpenAI Gym、PettingZoo。

上一篇:guardrail

下一篇:awesome-ai-security-tools

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1354 2026-08-24