llm_chess

让大模型下棋,测出推理和守规则的真实水平

llm_chess 是一个通过模拟国际象棋对局来评测大语言模型推理与指令遵循能力的开源项目。它不依赖传统静态题库,而是让模型在真实棋盘规则下走子,观察其能否理解局面、规划多步策略、遵守合法走法约束并完成整局对弈。项目以 HTML 为主要语言,提供可交互的网页界面,方便研究者直观查看模型每一步决策与对局过程,从而暴露模型在长程推理、规则遵守和状态跟踪上的短板。核心能力包括:生成合法走法、维持棋盘状态、记录对局历史、对比不同模型的胜率与失误模式。它适合作为 LLM 评测的补充工具,尤其关注模型在动态、规则严格环境中的表现,而非仅靠文本问答打分。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 129
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队maxim-saplin
所属国家
定价模式free
价格说明开源免费项目,无付费信息
访问状态
是否开源
开源协议Apache-2.0
主要语言HTML
技术栈/模型
GitHub 星标★ 129
30天Star增速
HF 下载量
上线时间2024-09-28 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 用真实对局替代静态问答,能暴露模型多步推理和状态跟踪的缺陷
  • 规则严格,可检验模型是否真正遵守合法走法约束
  • 提供网页交互界面,对局过程直观可回放,便于人工分析

不足之处

  • 项目早期,星标仅128,评测维度和基准覆盖有限
  • 以 HTML 为主,工程化和自动化评测流程可能不够完善

适用场景

  • 研究者对比不同 LLM 在规则约束下的推理能力
  • 开发者用对局日志分析模型指令遵循失败模式
  • 教学演示中展示大模型在棋类任务上的表现边界

替代项目

gpt-chess、chess-llm-eval

项目介绍

llm_chess 是一个评测安全领域的开源项目,官方简介:LLM Chess - evaluating Large Language Models' reasoning and instruction-following abilities by simulating chess games。项目使用 HTML 开发,在 GitHub 上获得 128 星标。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24