
next-evals-oss
给 AI 出 Next.js 考题,看它到底会不会写
next-evals-oss 是 Vercel 开源的评测套件,专门用来衡量 AI 模型对 Next.js(覆盖到 15.5.6 版本)的掌握程度。它把 Next.js 的常见开发任务——路由、数据获取、Server Components、缓存、中间件、App Router 约定等——整理成可自动运行的评测题,让开发者能客观对比不同大模型在真实框架场景下的表现,而不是只看通用编程 benchmark。项目用 TypeScript 编写,评测结果可复现,适合在选型模型、验证 AI 编码助手、跟踪模型迭代时使用。核心能力包括:贴近 Next.js 实际 API 的题目设计、可扩展的评测框架、与主流模型接口对接、以及可对照的评分标准。它解决的是“AI 写 Next.js 代码到底靠不靠谱”这个难以量化的问题,把主观感受变成可比较的分数。
项目数据
使用教程
核心亮点
- 题目直接围绕 Next.js 15.5.6 的真实 API 和约定设计,贴近实际开发而非抽象算法题
- 由 Vercel 维护,评测标准与框架演进同步,结果对选型有参考价值
- 基于 TypeScript 实现,评测流程可复现、可扩展,方便接入自有模型或 CI
不足之处
- 项目较早期,星标约 315,题目覆盖面和社区贡献仍在积累
- 主要聚焦 Next.js 单一框架,无法反映模型在其他前端栈上的能力
适用场景
- 团队选型 AI 编码助手时,对比不同模型写 Next.js 代码的准确率
- 模型厂商或研究者跟踪新版本模型在 Next.js 任务上的迭代提升
- 开发者用评测结果判断 AI 生成的 App Router 代码是否可信
替代项目
SWE-bench、HumanEval、WebDev Arena
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents