next-evals-oss

给 AI 出 Next.js 考题,看它到底会不会写

next-evals-oss 是 Vercel 开源的评测套件,专门用来衡量 AI 模型对 Next.js(覆盖到 15.5.6 版本)的掌握程度。它把 Next.js 的常见开发任务——路由、数据获取、Server Components、缓存、中间件、App Router 约定等——整理成可自动运行的评测题,让开发者能客观对比不同大模型在真实框架场景下的表现,而不是只看通用编程 benchmark。项目用 TypeScript 编写,评测结果可复现,适合在选型模型、验证 AI 编码助手、跟踪模型迭代时使用。核心能力包括:贴近 Next.js 实际 API 的题目设计、可扩展的评测框架、与主流模型接口对接、以及可对照的评分标准。它解决的是“AI 写 Next.js 代码到底靠不靠谱”这个难以量化的问题,把主观感受变成可比较的分数。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 315
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队vercel
所属国家
定价模式free
价格说明开源免费,无付费计划
访问状态
是否开源
开源协议MIT
主要语言TypeScript
技术栈/模型
GitHub 星标★ 315
30天Star增速
HF 下载量
上线时间2025-10-21 00:00:00
最近更新2026-09-12 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 题目直接围绕 Next.js 15.5.6 的真实 API 和约定设计,贴近实际开发而非抽象算法题
  • 由 Vercel 维护,评测标准与框架演进同步,结果对选型有参考价值
  • 基于 TypeScript 实现,评测流程可复现、可扩展,方便接入自有模型或 CI

不足之处

  • 项目较早期,星标约 315,题目覆盖面和社区贡献仍在积累
  • 主要聚焦 Next.js 单一框架,无法反映模型在其他前端栈上的能力

适用场景

  • 团队选型 AI 编码助手时,对比不同模型写 Next.js 代码的准确率
  • 模型厂商或研究者跟踪新版本模型在 Next.js 任务上的迭代提升
  • 开发者用评测结果判断 AI 生成的 App Router 代码是否可信

替代项目

SWE-bench、HumanEval、WebDev Arena

项目介绍

next-evals-oss 是一个评测安全领域的开源项目,官方简介:Evals for Next.js up to 15.5.6 to test AI model competency at Next.js。项目使用 TypeScript 开发,在 GitHub 上获得 315 星标。

上一篇:sim-evals

下一篇:workshop

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24