llm-colosseum

让大模型打街霸,用对战胜负测实力

llm-colosseum 是一个通过让大语言模型在《街头霸王3》中互相对战来评估其能力的开源基准测试项目。它解决了传统基准测试(如问答、代码生成)难以衡量模型在实时决策、策略规划和反应速度等动态能力的问题。其核心能力包括:提供一个可复现的对战环境,将LLM接入游戏角色控制,通过胜负结果量化模型表现;支持多种主流LLM接口,方便对比;并可视化对战过程,直观展示模型行为差异。该项目为AI评估提供了新颖、有趣且更具挑战性的视角。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1482
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队OpenGenerativeAI
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型benchmark,genai,llm,streetfighterai
GitHub 星标★ 1482
30天Star增速
HF 下载量
上线时间2024-03-23 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • 按 https://docs.diambra.ai/#installation 完成 Diambra 环境安装
  • 《街头霸王3》ROM 文件,放在 ~/.diambra/roms 目录(无需解压)
  • Python 环境(可选:新建并激活独立的 venv)
  • 准备一份 .env 文件,内容参照项目内的 .env.example
  • 可选:已安装 Docker / docker-compose

安装与启动步骤

  1. 1安装 Diambra 环境

    先按 Diambra 官方安装文档 https://docs.diambra.ai/#installation 完成前置环境安装,这是跑游戏模拟器的基础。

  2. 2放置游戏 ROM

    下载《街头霸王3》ROM,放进 ~/.diambra/roms 目录,不需要解压压缩包内容。

  3. 3创建虚拟环境

    可选步骤:用 Python 自带 venv 建独立环境,避免依赖冲突,创建后需激活再装依赖。

    python3 -m venv .venv
    source .venv/bin/activate
  4. 4安装项目依赖

    在项目根目录安装 requirements.txt 中的依赖,直接用 make install 即可,也可用 pip 安装。

    make install
  5. 5配置 .env 文件

    参照项目中的 .env.example 创建 .env,并按其内容填写(如模型接口等配置项)。

    cp .env.example .env
  6. 6启动对战程序

    执行启动命令后,程序会加载 Diambra 环境并让 LLM 在游戏中对战。

    make run
  7. 7Docker 构建与运行

    不想本地装依赖可用 Docker:先构建镜像,再运行容器并把本机 ROM 目录挂载进去。

    docker build -t diambra-app .
    docker run --name diambra-container -v ~/.diambra/roms:/app/roms diambra-app
  8. 8Compose 跑 Ollama

    想用本地 Ollama 作为模型后端时,用 docker-compose 一键启动相关服务。

    docker-compose up

如何确认成功

执行 make run(或 docker run)后,能加载 Diambra 环境并出现《街头霸王3》对战画面,即表示启动成功。

常见问题

Q:报错说找不到 ROM 怎么办?

A:确认 ROM 已放到 ~/.diambra/roms 目录,且按 README 要求不需要解压压缩包内容。

Q:一定要创建 .env 文件吗?

A:README 要求创建 .env 并填入内容,参照项目里的 .env.example 填写即可,缺少可能导致程序无法启动。

Q:本地装 Diambra 依赖太麻烦怎么办?

A:可以改用 Docker:docker build -t diambra-app . 构建镜像,再 docker run 并挂载 ~/.diambra/roms 目录运行。

Q:docker run 提示容器名已存在?

A:先执行 docker rm diambra-container 删除同名容器,再重新运行 docker run 命令。

Q:docker-compose up 是干什么的?

A:它用于在本地 Ollama 上启动服务,适合不想依赖外部模型接口的场景。

注意事项

  • ROM 放入 ~/.diambra/roms 时无需解压,直接放压缩文件即可
  • README 未列出 .env 的具体配置项,请以项目内 .env.example 为准
  • 遇到容器名冲突可用 docker rm diambra-container 清理后再运行
  • 使用 Docker 方式时记得用 -v 挂载本机 ROM 目录,否则容器内找不到 ROM

核心亮点

  • 创新评估方式:通过格斗游戏对战,动态测试模型的实时决策和策略能力,超越静态基准。
  • 可视化对战过程:直观展示模型行为,便于观察和分析其优劣势。
  • 社区活跃:项目成长迅速,星标数已超1400,吸引开发者参与和贡献。

不足之处

  • 评估场景单一:仅限格斗游戏,可能无法全面反映模型在真实任务中的通用能力。
  • 文档/社区待观察:项目尚在早期,文档和社区支持可能不够完善。

适用场景

  • AI能力对比:通过游戏对战直观比较不同LLM的决策和策略水平。
  • 强化学习研究:作为环境,测试和训练模型的实时决策能力。
  • 技术演示与教育:展示LLM在复杂交互场景中的应用潜力。

替代项目

Chatbot Arena、LMSYS Chatbot Arena、OpenAI Evals

项目介绍

llm-colosseum 是评测安全领域的开源项目,由 OpenGenerativeAI 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,482)位列前 30%,在评测安全分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:AI能力对比:通过游戏对战直观比较不同LLM的决策和策略水平。同类可对比的替代方案包括 Chatbot Arena、LMSYS Chatbot Arena、OpenAI Evals。

上一篇:rebuff

下一篇:oss-fuzz-gen

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12