
eval
用真实编码任务测出大模型真实力,结果公开可对比
eval 是 FrontierHarness 项目的评测结果与任务定义公开仓库,专注于大语言模型(LLM)在真实编码环境中的能力评估。它解决的核心问题是:传统基准测试(如 MMLU)无法反映模型在复杂、多步骤、工具调用场景下的真实表现。项目通过定义标准化任务、收集公开结果,并集成多种评测工具链(如 claude-code、codex、deepseek-harness 等),提供可复现的评测流程。其核心能力包括:任务定义文件管理、结果数据发布、以及跨模型对比分析。目前处于早期阶段,星标数 132,主要面向 AI 研究者和评测工程师,用于追踪前沿模型在编码智能体任务上的进展。
项目数据
核心亮点
- 聚焦真实编码场景,评测任务贴近实际开发,比传统基准更有说服力
- 集成多种主流模型工具链(claude-code、codex 等),便于横向对比
- 结果与任务定义公开,支持复现和社区共建
不足之处
- 早期项目,文档和社区生态尚不完善
- 评测任务覆盖范围有限,暂未覆盖多模态或非编码场景
适用场景
- 大模型编码能力基准测试与排名
- 企业内部模型选型时的能力验证
- 研究机构追踪前沿模型进展
替代项目
OpenAI Evals、lm-evaluation-harness、BigBench
项目介绍
上一篇:EasyJailbreak
下一篇:dsh-auto-review
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
parea-sdk-py
开源
一站式搞定 LLM 应用的测试、评估与监控
Python SDK for experimenting, testing, evaluating & monitoring LLM-powered applicati···