leaderboard

本站收录 11 个带「leaderboard」标签的 AI 开源项目

alpaca_evalalpaca_eval 是一个用于自动评估指令跟随语言模型的工具。它解决了人工评估成本高、速度慢、难以规模化的问题,提供了一种廉价、快速且经过人类验证的自动评估★ 2,018ClawProBenchClawProBench 是一个面向 LLM Agent 的评测基准框架,专门针对 OpenClaw 运行时环境设计。它解决的核心问题是:当前多数 Agent ★ 824Awesome-LLM-EvalAwesome-LLM-Eval 是一个精选资源列表,专注于大语言模型(LLM)的评测领域。它系统性地整理了评测工具、数据集/基准、演示、排行榜、论文、文档和模★ 658polymarket-paper-traderpolymarket-paper-trader 是一个为 AI 智能体打造的 Polymarket 预测市场模拟交易平台。它解决了 AI 交易策略在真实资金投入★ 401awesome-ai-leaderboard这是一个精选AI领域排行榜资源的开源列表,旨在帮助开发者、研究者和产品经理快速找到各类AI模型、智能体和应用的评测基准与排名信息。项目解决了AI领域信息分散、评★ 383confabulationsconfabulations 是一个用于评估 RAG(检索增强生成)系统幻觉(或称虚构)问题的文档型基准测试集。它提供了一系列经过人工验证的问题和答案,专门设计★ 250lora-speedrunlora-speedrun 是一个把 LoRA 微调变成竞速比赛的开源基准项目,思路类似 modded-nanogpt,但聚焦在微调场景。它固定任务、固定硬件、★ 149viberankviberank是一个AI编程工具使用排行榜,基于ccusage数据展示Claude Code、Codex、Gemini CLI等AI编码工具的真实使用成本和t★ 117TextAtlasTextAtlas 是一个用于训练和评估模型密集文本图像生成能力的大规模数据集,由 ICML 2026 论文提出。它解决了当前文本到图像模型在生成包含密集、复杂★ 94tokenmaxxingtokenmaxxing 是一个基于 ccusage 构建的本地命令行工具,旨在解决 AI 开发者在不同工具间 token 使用数据分散、无法共享的问题。它能够★ 76thinkrank融合游戏机制与生成式 AI 教育的移动学习平台,通过智能排序系统与游戏化的 AI 研究贡献机制,革新协作式思考与问题解决方式,让学习者在趣味互动中掌握 AI 知★ 28