svelte-bench

专测大模型写 Svelte 5 代码行不行

svelte-bench 是一个专门评测大语言模型在 Svelte 5 框架下代码生成能力的基准测试项目,基于 OpenAI 论文《Evaluating Large Language Models Trained on Code》中提出的方法论构建。它解决的核心问题是:现有代码评测基准(如 HumanEval)多聚焦于 Python 通用编程,缺乏对现代前端框架特别是 Svelte 5 新语法(如 runes、snippets)的针对性评估。项目通过设计一系列 Svelte 5 专属编程任务,让模型生成组件或逻辑代码,再以自动化方式验证正确性,从而量化模型对 Svelte 5 的掌握程度。核心能力包括任务集管理、模型输出执行与断言校验、结果统计与对比,技术栈为 TypeScript + SvelteKit,适合模型开发者、前端团队和评测研究者使用。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 189
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队khromov
所属国家
定价模式free
价格说明开源免费项目,无付费计划
访问状态
是否开源
开源协议
主要语言TypeScript
技术栈/模型ai,svelte,sveltekit
GitHub 星标★ 189
30天Star增速
HF 下载量
上线时间2025-03-06 00:00:00
最近更新2026-09-13 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 聚焦 Svelte 5 新特性(runes、snippets),填补现有代码基准对现代前端框架覆盖不足的空白
  • 沿用 OpenAI 论文的评测方法论,任务设计与验证逻辑有学术依据,结果可比性较强
  • 基于 SvelteKit 实现,评测流程自动化,可扩展自定义任务集

不足之处

  • 项目处于早期,任务集规模和覆盖场景有限,评测结论的统计效力有待扩充
  • 社区生态和文档尚不完善,非 Svelte 用户上手门槛较高

适用场景

  • 模型团队评估新版本 LLM 对 Svelte 5 代码生成的准确率
  • 前端团队选型时对比不同模型写 Svelte 5 组件的可用性
  • 研究者做代码生成基准的跨框架横向对比实验

替代项目

HumanEval、BigCodeBench

项目介绍

svelte-bench 是一个评测安全领域的开源项目,官方简介:An LLM benchmark for Svelte 5 based on the OpenAI methodology from OpenAIs paper "Evaluating Large Language Models Trained on Code".。项目使用 TypeScript 开发,在 GitHub 上获得 189 星标。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24