
llm-coding-benchmark
自动跑编码题,横向比出哪个大模型写代码更强
llm-coding-benchmark 是一个用 Python 编写的轻量级评测工具,专门用来横向对比主流开源与商用大模型在真实编码任务上的表现。它通过自动化驱动 OpenCode(终端里的 AI 编程助手)来执行统一的编码题目,把不同模型放到同一套流程里跑,从而减少人工测试带来的主观偏差。项目解决的核心问题是:开发者想选一个写代码靠谱的模型时,往往只能看厂商宣传或零散测评,缺少可复现、可自己跑的对比数据。它的能力包括自动调用模型、执行编码任务、收集结果并生成对比,让用户用较低成本得到一份贴近实际使用场景的模型排名。整体定位偏工具和参考,适合想快速了解哪个模型写代码更强、或想搭建自己评测流程的人。
项目数据
使用教程
核心亮点
- 用 OpenCode 自动化执行,减少人工逐题测试的重复劳动
- 同时覆盖开源与商用模型,便于横向对比选型
- Python 实现,代码轻量,方便按自己需求改题目和模型列表
不足之处
- 项目早期,星标和生态规模有限,评测题目与模型覆盖可能不够全
- 依赖 OpenCode 等外部工具,环境配置和结果复现存在门槛
适用场景
- 团队选型时快速对比多个大模型的编码能力
- 个人开发者想验证某模型写代码是否靠谱
- 研究者搭建可复现的编码评测流程做二次扩展
替代项目
SWE-bench、HumanEval、LiveCodeBench
项目介绍
上一篇:ollama-benchmark
下一篇:LiveBench
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents