benchmarks

本站收录 19 个带「benchmarks」标签的 AI 开源项目

InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792GymGym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境中。传统 benchmark 通常只给固定题目和标准答案,难以衡★ 1,210awesome-evals这是一个由 BenchFlow 维护的精选资源列表,专注于 AI 智能体的构建与评估。它汇集了论文、博客、演讲、工具和基准测试等高质量资源,旨在为开发者提供一份★ 936Awesome-Robotics-3DAwesome-Robotics-3D 是一个精选资源列表,专注于大模型(LLM/VLM)时代下机器人领域的 3D 视觉研究。它系统整理了相关论文、代码和网站,★ 825langtestLangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系统性评估的问题,帮助开发者自动生成测试用例,覆盖模型在公平★ 561HallusionBenchHallusionBench 是一个针对多模态大语言模型(如 GPT-4V、LLaVA-1.5)的图像上下文推理基准测试集,旨在揭示模型在视觉问答中因视觉错觉或★ 343AutomationBenchAutomationBench 是一个用于评估 AI 智能体在真实业务流程中表现的基准测试框架。它由 Prime Intellect 开发,主要解决当前 AI ★ 314benchmark-radarbenchmark-radar 是一个面向 AI 评测领域的数据聚合工具,它从 37 个公开来源持续抓取并整理超过 11,923 条与 AI benchmark★ 263Awesome-Video-Reasoning-Landscape这是一个关于视频推理领域的开源综述项目,旨在系统梳理视频推理的最新任务、范式和基准。它解决了视频理解领域缺乏统一知识框架的问题,帮助研究者和开发者快速了解视频推★ 191Cognitive-Core-Skills这是一个面向大模型、小模型、AI智能体及世界模型的认知核心技能通用分类体系。它不依赖特定行业,提供了一套涵盖感知、记忆、推理、规划、行动、验证、学习和治理等八大★ 158awesome-claude-fable-5-prompt-vault这是一个关于 Claude Fable 5 的精选资源列表,汇集了 2026 年的使用案例、集成方案和性能基准。项目以 HTML 形式组织,旨在为开发者提供一站★ 142benchmarks这是一个用于主流AI模型上MLOps引擎、框架和语言性能对比的基准测试项目。它通过统一的测试脚本和标准化流程,对不同的MLOps工具链(如模型服务引擎、训练框架★ 142somali-language-standard这是一个面向索马里语的开放、机器可读语言标准项目,采用 RFC 风格的版本化目录,把正字法、语法、术语、翻译以及 AI/基准测试资源集中管理。索马里语属于低资源★ 108OralGPTOralGPT 是一个面向口腔医学领域的大语言模型项目,由 NeurIPS'25 和 CVPR'26 论文支持,旨在解决口腔医学中多模态理解和生成的专业需求。它★ 106Awesome-Video-MLLMsAwesome-Video-MLLMs 是一个专注于视频多模态大模型(MLLMs)及其基准测试的资源汇总项目,覆盖短视频、长视频和流式视频理解三大场景。它系统整★ 74napolabNapolab 是一个专注于葡萄牙语自然语言处理的基准测试项目,旨在系统评估和追踪葡萄牙语语言模型的最新进展。它通过精心策划的葡萄牙语任务集,为研究者、开发者和★ 72designmddesignmd 是一个为 AI 编程工作流提供生产级设计上下文的开源工具。它能从任意 URL 提取真实的设计系统,包括颜色、字体、间距、断点等,并生成一份便携★ 69Time-Series-Reasoning-Survey这是一个关于时间序列与大语言模型结合的研究综述项目,收录于TMLR 2026。项目系统梳理了推理(Reasoning)和智能体(Agentic)系统在时间序列分★ 57awesome-claude-fable-5这是一个精选资源列表,汇集了 Claude Fable 5 的使用案例、教程、集成方案、演示和基准测试证据,并附有来源链接。该项目旨在帮助开发者快速了解 Cla★ 3