Gym 是评测安全领域的开源项目,由 NVIDIA-NeMo 开发,2025 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(1,197)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,NVIDIA NeMo Gym 框架。
它主要面向的使用场景是:研究团队搭建多轮决策任务,对比不同LLM智能体的表现。同类可对比的替代方案包括 OpenAI Gym、PettingZoo。

把模型丢进环境里跑,边评测边改进智能体
Gym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境中。传统 benchmark 通常只给固定题目和标准答案,难以衡量模型在多轮决策、工具调用和状态变化下的真实能力;Gym 提供统一的环境接口,让模型或智能体在环境中执行动作、获得反馈并累积奖励,从而支持强化学习式训练和更贴近实际的评测。项目用 Python 实现,覆盖 agents、benchmarks、environments、evaluation、llm、reinforcement-learning 等方向,适合研究者搭建自定义任务环境、跑基准测试、对比不同策略,也适合工程团队把评测流程标准化。它把环境、模型和评测指标解耦,便于复用和扩展,是连接 LLM 智能体与强化学习评测的中间层工具。
1克隆仓库
从 GitHub 拉取 NeMo Gym 源码并进入项目目录。README 给出的是 SSH 地址,需已配置 GitHub SSH 密钥。
git clone git@github.com:NVIDIA-NeMo/Gym.git
cd Gym2创建虚拟环境
用 uv 创建 Python 3.13.14 的虚拟环境并激活。后续所有命令都要在此环境下执行。
uv venv --python 3.13.14 && source .venv/bin/activate3同步依赖
在项目根目录下用 uv sync 安装项目依赖,完成后即可使用 gym 命令。
uv sync4创建模型配置文件
在项目根目录新建 env.yaml,填入模型服务的 base URL、API Key 和模型名。示例使用 OpenAI。
5启动本地服务
启动资源服务、智能体和模型三类本地服务。需保持该终端运行,不要关闭。
gym env start
--resources-server mcqa
--model-type openai_model6运行评测
新开一个终端并激活虚拟环境,用 --no-serve 复用已启动的服务,先跑 5 条任务验证流程。
source .venv/bin/activate
gym eval run --no-serve
--agent mcqa_simple_agent
--input resources_servers/mcqa/data/example.jsonl
--output results/mcqa_rollouts.jsonl
--limit 5
--num-repeats 1| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
policy_base_url | 是 | 模型服务的基础地址,示例为 OpenAI 官方接口 | https://api.openai.com/v1 |
policy_api_key | 是 | 调用模型服务的 API 密钥 | sk-xxxxxxxx |
policy_model_name | 是 | 评测使用的模型名称 | gpt-4.1-2025-04-14 |
启动服务后终端会列出 mcqa、mcqa_simple_agent、policy_model 三个实例;评测结束会打印 mean/reward、accuracy 等聚合指标。
Q:运行 Gym 需要 GPU 吗?
A:不需要。README 明确说明 No GPU required,普通 CPU 环境即可完成安装和示例评测。
Q:只能用 OpenAI 的模型吗?
A:不是。快速开始示例用 OpenAI,README 同时说明支持本地与托管推理,包括 vLLM、Fireworks、OpenRouter 等,详见 Configure Model 文档。
Q:可以在 Windows 上直接运行吗?
A:README 要求 Windows 通过 WSL2 运行,不支持原生 Windows 环境,同时必须是 x86_64 或 ARM64 架构。
Q:为什么跑评测时要加 --no-serve?
A:因为模型、智能体和资源服务已经由 gym env start 单独启动,评测命令加 --no-serve 表示复用这些已运行的服务,而不是重新拉起一套。
OpenAI Gym、PettingZoo
Gym 是评测安全领域的开源项目,由 NVIDIA-NeMo 开发,2025 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(1,197)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,NVIDIA NeMo Gym 框架。
它主要面向的使用场景是:研究团队搭建多轮决策任务,对比不同LLM智能体的表现。同类可对比的替代方案包括 OpenAI Gym、PettingZoo。
上一篇:guardrail
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents