benchmark
本站收录 122 个带「benchmark」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
opencompassOpenCompass 是一个大语言模型评估平台,旨在解决 LLM 评测标准不一、流程复杂的问题。它支持超过 100 个公开数据集(如 MMLU、C-Eval、★ 7,485
lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437
Baichuan2Baichuan2 是百川智能推出的系列大语言模型,包括基座模型和对话模型,覆盖 7B、13B 等参数规模。它旨在提供高质量的中英文双语能力,解决通用对话、内容★ 4,084
FlashRAGFlashRAG 是一个面向高效检索增强生成(RAG)研究的 Python 工具包,由 WWW2025 资源论文支持。它旨在解决 RAG 研究和应用中存在的复现★ 3,586
OSWorldOSWorld 是一个用于评估多模态 AI 智能体在真实计算机环境中执行开放式任务能力的基准测试平台,发表于 NeurIPS 2024。它解决了现有基准测试环境★ 3,165
promptbenchPromptBench 是一个面向大语言模型的统一评估框架,旨在解决当前 LLM 评估碎片化、缺乏标准化的问题。它提供了一套模块化、可扩展的工具,支持对模型进行★ 2,822
little-coderlittle-coder 是一个用 TypeScript 编写的编码智能体运行框架(harness),专门针对参数量较小的本地大模型做优化。它解决的核心问题是:★ 2,630
InternVideoInternVideo 是一个面向多模态理解的开源视频基础模型项目,由上海人工智能实验室发布,相关论文发表于 ECCV2024。它旨在解决视频理解中模型泛化能力★ 2,398
beirBEIR是一个异构信息检索基准测试平台,旨在解决IR模型评估碎片化的问题。它整合了超过15个多样化的检索数据集,覆盖问答、生物医学、金融、法律等多个领域,并提供★ 2,305
Awesome-LLM-Long-Context-ModelingAwesome-LLM-Long-Context-Modeling 是一个精选资源列表,聚焦于大语言模型的长上下文建模技术。它系统整理了相关论文、博客和开源工具★ 2,175
tau2-benchτ-Bench 是一个用于评估工具调用型智能体(Tool-Agent)在真实世界领域中人机交互能力的基准测试框架。它针对当前大模型智能体在复杂业务场景中需要与用★ 2,145
tapnetTapNet 是 DeepMind 开源的「追踪任意点」(Tracking Any Point, TAP)基准与算法实现,目标是在视频中持续追踪用户指定的任意像★ 1,996
evalplusevalplus 是一个用于严格评估大语言模型生成代码质量的基准测试框架,源自 NeurIPS 2023 与 COLM 2024 论文。它针对现有代码生成评测(★ 1,821
VBenchVBench 是一个专为视频生成模型设计的综合评估基准,由 CVPR 2024 Highlight 论文提出。它解决了视频生成领域缺乏统一、细粒度、自动化评估标★ 1,800
fastRAGfastRAG是一个专注于高效检索增强生成(RAG)的开源框架,旨在解决企业落地RAG时面临的性能瓶颈和部署复杂性问题。它基于Haystack构建,但针对生产环★ 1,787
ADRADR 是一个面向企业级 AI 智能体的安全防护框架,由 Uber 部署并开源。它解决的核心问题是:随着 AI Agent 在企业中承担越来越多的自动化任务,其★ 1,614
LLM-eval-surveyLLM-eval-survey 是大语言模型评估领域权威综述论文《A Survey on Evaluation of Large Language Models★ 1,611
llm-colosseumllm-colosseum 是一个通过让大语言模型在《街头霸王3》中互相对战来评估其能力的开源基准测试项目。它解决了传统基准测试(如问答、代码生成)难以衡量模型★ 1,485
GLM-5.3-Flash-J-Space-Capability-Realization-Report这是一个围绕 GLM-5.3-Flash 与 J-Space 认知套件的能力实现报告型开源项目,核心是把 J-Space Cognition Suite 的评测★ 1,025
ClawBenchClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表现。它解决了当前浏览器智能体缺乏统一、贴近真实场景★ 904
agentdojoagentdojo 是一个用于评估 LLM 智能体攻击与防御的动态环境。它解决的核心问题是:随着 LLM 智能体被赋予调用外部工具和访问敏感数据的权限,针对这些★ 881
OpenCUAOpenCUA 是一个为计算机使用智能体(Computer-Use Agents)提供开放基础的开源项目,入选 NeurIPS 2025 Spotlight。它★ 849
ClawProBenchClawProBench 是一个面向 LLM Agent 的评测基准框架,专门针对 OpenClaw 运行时环境设计。它解决的核心问题是:当前多数 Agent ★ 824
mobilegymMobileGym 是一个面向移动端 GUI 智能体研究的可验证、高并行仿真平台,论文已被 EMNLP 2026 收录。它把安卓模拟器搬进浏览器,无需真机或本地★ 801
LightCompressLightCompress 是一个面向大模型压缩的开源工具包,由 EMNLP 2024 和 AAAI 2026 论文支撑,支持对 LLM(大语言模型)、VLM(★ 749
long-form-factuality这是一个用于评估大语言模型长文本事实性(long-form factuality)的基准测试工具,来自论文《Long-form factuality in la★ 693
VLM2VecVLM2Vec 是一个将视觉语言模型(VLM)适配为多功能嵌入模型的开源项目,核心解决多模态内容(图像、文本、视频等)的统一向量化表示问题。它提出了 MMEB(★ 689
SkillCorpusSkillCorpus 是一个开源基础设施,旨在将分散的 SKILL.md 文件转化为经过整理、可直接用于检索的智能体技能语料库。它解决了 AI 智能体在技能管★ 673
Awesome-LLM-EvalAwesome-LLM-Eval 是一个精选资源列表,专注于大语言模型(LLM)的评测领域。它系统性地整理了评测工具、数据集/基准、演示、排行榜、论文、文档和模★ 658
TrustLLMTrustLLM 是一个针对大语言模型可信度的系统性研究项目,源自 ICML 2024 论文。它定义了一个包含真实性、安全性、公平性、鲁棒性、隐私性、机器伦理与★ 633
inspect-robotsinspect-robots 是一个面向物理 AI(具身智能)的开源评测框架,目标是把机器人策略与视觉-语言-动作(VLA)模型的评估标准化。它解决的核心问题是★ 627
ParseBenchParseBench 是一个面向 AI Agent 的文档解析基准测试工具,旨在解决 LLM 应用中文档解析能力难以量化评估的问题。它提供了一套标准化的评测流程★ 592
EnterpriseRAG-BenchEnterpriseRAG-Bench 是一个专为企业内部文档场景设计的 RAG(检索增强生成)评测基准与数据集。它解决的核心问题是:通用 RAG 评测集(如自★ 576
meta-agents-research-environmentsMeta Agents Research Environments 是一个用于评估 AI 智能体的动态仿真平台。与静态基准测试不同,它构建了信息持续变化的环境,★ 559
bigcodebenchBigCodeBench 是一个面向代码生成任务的基准测试框架,旨在评估和推动大语言模型在真实编程场景中的能力,其目标直指 AGI。它解决了现有代码基准测试过于★ 517
Static-to-Dynamic-LLMEvalStatic-to-Dynamic-LLMEval 是论文《Recent advances in large language model benchmarks★ 500
DG-PHMDG-PHM 是一个聚焦于工业设备故障诊断与剩余寿命预测的开源资源库,核心主题是“领域泛化”(Domain Generalization)。在真实工业场景中,设★ 467
Awesome-Evaluation-of-Visual-Generation这是一个聚焦视觉生成模型评测领域的精选资源列表,系统整理了相关的评估指标、评估模型和评估系统。它解决了视觉生成领域缺乏统一、全面评测参考的问题,为研究人员和工程★ 464
keystone-benchkeystone-bench 是一个面向临床决策支持的评测基准,基于 OpenAI 的 HealthBench 构建。它要解决的问题是:医疗问答里模型给出的答案★ 453
OpenRCAOpenRCA 是一个研究项目,旨在探索大语言模型(LLM)能否自动定位软件故障的根因。它基于 ICLR'25 论文,提供了完整的实验框架和数据集,用于评估 L★ 429
CRUD_RAGCRUD-RAG 是一个专为中文检索增强生成(RAG)技术设计的综合评测基准。它针对大语言模型在知识密集型任务中的表现,提供了一套系统化的评估框架。该项目解决了★ 414
VibeSearchBenchVibeSearchBench 是一个面向真实世界复杂搜索场景的基准测试集,旨在评估和推动搜索系统在模糊、多轮、主动式交互中的表现。它包含200个长时程任务,每★ 409
polymarket-paper-traderpolymarket-paper-trader 是一个为 AI 智能体打造的 Polymarket 预测市场模拟交易平台。它解决了 AI 交易策略在真实资金投入★ 401
superbenchmarkSuperBenchmark 是微软开源的 AI 基础设施验证与性能分析工具,面向 GPU 集群、云上 AI 算力平台和自建训练环境。它解决的核心问题是:在部署★ 396
InfiniteBenchInfiniteBench 是论文《∞Bench: Extending Long Context Evaluation Beyond 100K Tokens》的★ 393
ollama-benchmarkollama-benchmark 是一个面向本地大模型(通过 Ollama 运行)的吞吐量基准测试工具。它解决的核心问题是:当你在本地部署 Llama、Mist★ 391
selfstarterselfstarter 是一个面向编码智能体的自主任务执行框架,核心思路是让开发者给智能体一份任务简报(brief)而非进行多轮对话,智能体便能跨会话持续工作直★ 387
awesome-ai-leaderboard这是一个精选AI领域排行榜资源的开源列表,旨在帮助开发者、研究者和产品经理快速找到各类AI模型、智能体和应用的评测基准与排名信息。项目解决了AI领域信息分散、评★ 383
EasyWAMEasyWAM 是一个面向具身智能与机器人领域的统一训练框架,专注于 World Action Model(世界动作模型)的构建。它把世界模型与视觉-语言-动作★ 377
physics-IQ-benchmark这是一个用于评估生成式视频模型物理理解能力的基准测试工具。它通过设计一系列物理场景和任务,测试视频生成模型是否真正理解物体的运动规律、碰撞、重力等物理现象,而不★ 353