geobench

用 GeoGuessr 游戏场景,测出 AI 的地理定位智商。

geobench 是一个专门为语言模型设计的 GeoGuessr 基准测试工具,旨在评估 AI 模型在地理定位和空间推理方面的能力。它通过模拟 GeoGuessr 游戏场景,让模型根据街景图像或环境描述推断地理位置,从而量化模型的视觉-语言理解、常识推理和地理知识水平。该工具支持多种主流 LLM(如 ChatGPT、Claude、Gemini、Llama),提供标准化测试流程和评分机制,帮助研究者和开发者横向对比不同模型的地理感知能力。核心能力包括自动生成测试用例、管理 API 调用、计算准确率与误差距离,并输出结构化结果,便于集成到模型评估管线中。解决的核心问题是:现有基准多聚焦文本或代码,缺乏对空间智能和地理常识的系统性评测,geobench 填补了这一空白。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 65
维护状态 活跃
是否开源
定价模式 free

项目数据

分类对话助手
开发团队ccmdi
所属国家
定价模式free
价格说明开源基准测试项目,提供在线网站,完全免费使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型benchmark,chatgpt,claude,gemini,geoguessr,llama,llm
GitHub 星标★ 65
30天Star增速
HF 下载量
上线时间2025-03-22 00:00:00
最近更新2026-09-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 首创将 GeoGuessr 游戏转化为 LLM 空间推理基准,评测维度新颖
  • 支持多模型接入(ChatGPT/Claude/Gemini/Llama),对比方便
  • 输出误差距离和准确率,量化指标直观可复现

不足之处

  • 项目处于早期,测试场景覆盖度和文档完善度有限
  • 依赖外部地图数据,可能受 API 配额和版权限制

适用场景

  • 评估多模态 LLM 的地理常识和视觉定位能力
  • 对比不同模型在空间推理任务上的表现差异
  • 作为地理相关 AI 应用(如导航、旅游推荐)的预测试

替代项目

GeoBench、SpatialBench、VQA-Geo

项目介绍

geobench 是评测安全领域的开源项目,由 ccmdi 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 65。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。开源基准测试项目,提供在线网站,完全免费使用。从国内网络环境看,可直接访问。

它主要面向的使用场景是:评估多模态LLM的地理常识和视觉定位能力。同类可对比的替代方案包括 GeoBench、SpatialBench、VQA-Geo。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24