
svelte-bench
专测大模型写 Svelte 5 代码行不行
svelte-bench 是一个专门评测大语言模型在 Svelte 5 框架下代码生成能力的基准测试项目,基于 OpenAI 论文《Evaluating Large Language Models Trained on Code》中提出的方法论构建。它解决的核心问题是:现有代码评测基准(如 HumanEval)多聚焦于 Python 通用编程,缺乏对现代前端框架特别是 Svelte 5 新语法(如 runes、snippets)的针对性评估。项目通过设计一系列 Svelte 5 专属编程任务,让模型生成组件或逻辑代码,再以自动化方式验证正确性,从而量化模型对 Svelte 5 的掌握程度。核心能力包括任务集管理、模型输出执行与断言校验、结果统计与对比,技术栈为 TypeScript + SvelteKit,适合模型开发者、前端团队和评测研究者使用。
项目数据
使用教程
核心亮点
- 聚焦 Svelte 5 新特性(runes、snippets),填补现有代码基准对现代前端框架覆盖不足的空白
- 沿用 OpenAI 论文的评测方法论,任务设计与验证逻辑有学术依据,结果可比性较强
- 基于 SvelteKit 实现,评测流程自动化,可扩展自定义任务集
不足之处
- 项目处于早期,任务集规模和覆盖场景有限,评测结论的统计效力有待扩充
- 社区生态和文档尚不完善,非 Svelte 用户上手门槛较高
适用场景
- 模型团队评估新版本 LLM 对 Svelte 5 代码生成的准确率
- 前端团队选型时对比不同模型写 Svelte 5 组件的可用性
- 研究者做代码生成基准的跨框架横向对比实验
替代项目
HumanEval、BigCodeBench
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents