MathVista

测测AI看图算数行不行,一套基准见分晓

MathVista 是一个专注于视觉数学推理的开源项目,提供数据集、代码和评估工具,用于测试和提升 AI 模型在包含图表、几何图形、数学表达式等视觉场景下的数学推理能力。它解决了当前多模态大模型在数学视觉任务上评估标准缺失的问题,通过构建涵盖多种题型和难度级别的基准测试集,帮助研究者客观衡量模型性能。项目核心能力包括:提供标准化评估流程、丰富的可视化数学问题样本、以及模型性能对比基线。其数据覆盖图表解读、几何计算、函数图像分析等真实场景,能够有效暴露模型在视觉与数学结合任务中的短板,推动多模态推理技术的发展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 367
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队lupantech
所属国家
定价模式free
价格说明开源项目,提供数据、代码和评估工具,完全免费。
访问状态
是否开源是
开源协议CC-BY-SA-4.0
主要语言Jupyter Notebook
技术栈/模型ai4math,large-language-models,large-multimadality-models,machine-learning,mathematics,mathqa,science,visual-question-answering
GitHub 星标★ 367
30天Star增速
HF 下载量
上线时间2023-10-04 00:00:00
最近更新2026-09-16 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 提供标准化视觉数学推理基准,覆盖图表、几何、函数等多样题型
  • 配套完整评估代码,可复现模型性能对比结果
  • 数据标注精细,支持细粒度错误分析

不足之处

  • 当前数据规模有限,主要面向研究验证,生产环境适用性待观察
  • 文档偏学术化,上手门槛较高

适用场景

  • 多模态大模型数学推理能力基准测试
  • 教育场景下AI解题能力评估
  • 视觉问答模型在数学领域的专项优化

替代项目

MathQA、Geometry3K、TabMWP

项目介绍

MathVista 是评测安全领域的开源项目,由 lupantech 开发,2023 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 367。

项目仍在小幅维护中,最近一次代码更新于 2026-09-16。提供数据、代码和评估工具,完全免费。

它主要面向的使用场景是:多模态大模型数学推理能力基准测试。同类可对比的替代方案包括 MathQA、Geometry3K、TabMWP。

上一篇:MMMU

下一篇:ScienceAgentBench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12