llm-srbench

测测大模型能不能发现科学公式,一测便知

LLM-SRBench 是一个用于评估大语言模型在科学方程发现任务上能力的基准测试,发表于 ICML 2025 Oral。该基准旨在解决现有符号回归基准未能充分测试 LLM 在真实科学发现场景中表现的问题。它包含来自物理、化学、生物等领域的多样化方程,并设计了从数据中直接生成符号表达式的任务。核心能力包括:提供标准化评估协议、支持多种 LLM 后端(如 GPT-4)、内置基线方法对比,以及可视化分析工具。通过该基准,研究者可以系统比较不同 LLM 在科学发现上的潜力,推动 AI for Science 的发展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 125
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队deep-symbolic-mathematics
所属国家
官网地址
定价模式free
价格说明开源基准测试项目,完全免费,无付费版本。
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型ai4code,ai4math,ai4science,large-language-models,llm-agent,scientific-discovery
GitHub 星标★ 125
30天Star增速
HF 下载量
上线时间2025-01-30 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 首个专门针对 LLM 科学方程发现的基准,填补空白
  • 涵盖多学科方程,任务设计贴近真实科研场景
  • 提供标准化评估和基线,便于横向对比

不足之处

  • 项目早期,文档和社区支持待观察
  • 基准规模有限,可能未覆盖所有科学领域

适用场景

  • 评估 LLM 在科学发现任务中的能力
  • 对比不同 LLM 或提示策略在符号回归上的表现
  • 作为 AI for Science 研究的参考基准

替代项目

SRBench、Feynman Symbolic Regression Benchmark、AI Feynman

项目介绍

llm-srbench 是评测安全领域的开源项目,由 deep-symbolic-mathematics 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 125。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。开源基准测试项目,完全免费,无付费版本。

它主要面向的使用场景是:评估LLM在科学发现任务中的能力。同类可对比的替代方案包括 SRBench、Feynman Symbolic Regression Benchmark、AI Feynman。

上一篇:alpaca_eval

下一篇:MisguidedAttention

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24