geobench 是评测安全领域的开源项目,由 ccmdi 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 65。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。开源基准测试项目,提供在线网站,完全免费使用。从国内网络环境看,可直接访问。
它主要面向的使用场景是:评估多模态LLM的地理常识和视觉定位能力。同类可对比的替代方案包括 GeoBench、SpatialBench、VQA-Geo。

用 GeoGuessr 游戏场景,测出 AI 的地理定位智商。
geobench 是一个专门为语言模型设计的 GeoGuessr 基准测试工具,旨在评估 AI 模型在地理定位和空间推理方面的能力。它通过模拟 GeoGuessr 游戏场景,让模型根据街景图像或环境描述推断地理位置,从而量化模型的视觉-语言理解、常识推理和地理知识水平。该工具支持多种主流 LLM(如 ChatGPT、Claude、Gemini、Llama),提供标准化测试流程和评分机制,帮助研究者和开发者横向对比不同模型的地理感知能力。核心能力包括自动生成测试用例、管理 API 调用、计算准确率与误差距离,并输出结构化结果,便于集成到模型评估管线中。解决的核心问题是:现有基准多聚焦文本或代码,缺乏对空间智能和地理常识的系统性评测,geobench 填补了这一空白。
GeoBench、SpatialBench、VQA-Geo
geobench 是评测安全领域的开源项目,由 ccmdi 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 65。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。开源基准测试项目,提供在线网站,完全免费使用。从国内网络环境看,可直接访问。
它主要面向的使用场景是:评估多模态LLM的地理常识和视觉定位能力。同类可对比的替代方案包括 GeoBench、SpatialBench、VQA-Geo。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···