MathVista 是评测安全领域的开源项目,由 lupantech 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 367。
项目仍在小幅维护中,最近一次代码更新于 2026-09-16。提供数据、代码和评估工具,完全免费。
它主要面向的使用场景是:多模态大模型数学推理能力基准测试。同类可对比的替代方案包括 MathQA、Geometry3K、TabMWP。

测测AI看图算数行不行,一套基准见分晓
MathVista 是一个专注于视觉数学推理的开源项目,提供数据集、代码和评估工具,用于测试和提升 AI 模型在包含图表、几何图形、数学表达式等视觉场景下的数学推理能力。它解决了当前多模态大模型在数学视觉任务上评估标准缺失的问题,通过构建涵盖多种题型和难度级别的基准测试集,帮助研究者客观衡量模型性能。项目核心能力包括:提供标准化评估流程、丰富的可视化数学问题样本、以及模型性能对比基线。其数据覆盖图表解读、几何计算、函数图像分析等真实场景,能够有效暴露模型在视觉与数学结合任务中的短板,推动多模态推理技术的发展。
MathQA、Geometry3K、TabMWP
MathVista 是评测安全领域的开源项目,由 lupantech 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 367。
项目仍在小幅维护中,最近一次代码更新于 2026-09-16。提供数据、代码和评估工具,完全免费。
它主要面向的使用场景是:多模态大模型数学推理能力基准测试。同类可对比的替代方案包括 MathQA、Geometry3K、TabMWP。
上一篇:MMMU
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.