benchmarking
本站收录 13 个带「benchmarking」标签的 AI 开源项目
InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792
ckCollective Knowledge (CK) 是一个开源自动化框架,旨在帮助用户高效地在多样化的模型、数据集、软件和硬件上运行AI/ML及其他新兴工作负载★ 651
DreamLayer-EvalDreamLayer-Eval 是一个面向扩散模型的自动化评测基准工具,旨在解决图像生成模型评估过程繁琐、结果难以复现的问题。它通过自动化管理评估流程、随机种子★ 413
benchmark-radarbenchmark-radar 是一个面向 AI 评测领域的数据聚合工具,它从 37 个公开来源持续抓取并整理超过 11,923 条与 AI benchmark★ 263
foundation-model-benchmarking-tool这是一个用于基础模型(大模型)基准测试的开源工具,旨在帮助用户在 AWS 云平台上运行任意模型,并对比不同实例类型和服务栈(serving stack)的性能表★ 256
vistorybenchViStoryBench 是一个面向 AI 故事可视化任务的基准测试集,由 CVPR 2026 论文提出。它解决的核心问题是:当前图像生成模型在生成连贯、风格一★ 173
BEAMBEAM 是一个针对大语言模型长期记忆能力的基准测试与增强框架,由 ICLR 2026 论文提出。它解决了现有模型在处理超过百万 token 的上下文时,长期记★ 146
model-serving-minefieldmodel-serving-minefield 是一个社区维护的 LLM 推理服务“踩坑登记册”,专门收集那些会让测量结果看似正常、实则自信地给出错误结论的陷阱★ 134
evalstatsevalstats 是一个面向 AI 评测场景的 Python 统计推断库,专门解决小样本条件下模型对比与评测结论不可靠的问题。它把蒙特卡洛模拟验证过的统计方法★ 127
LLMeBenchLLMeBench 是一个用于基准测试大型语言模型(LLM)的开源工具,旨在标准化评估流程,帮助开发者比较不同模型的性能。它解决了 LLM 评测中缺乏统一框架、★ 108
medalignMedAlign 是一个由临床医生生成的指令遵循数据集,专门用于电子病历(EMR)场景。它解决了医疗领域通用大模型缺乏专业临床指令数据、难以准确理解和执行医疗任★ 103
circle-guard-benchcircle-guard-bench 是首个专门评估大语言模型(LLM)防护系统(包括 guardrails 和 safeguards)能力的 AI 基准测试框★ 81
Electron-BitNetElectron-BitNet 是一个将微软的 BitNet 模型封装为桌面应用的早期开源项目,采用 Electron、React 和 Astro 构建。它解决★ 65