primitive-bench

声明任务先定价,AI 干完验证,不成退款

primitive-bench 是一个面向 AI 智能体结果的可验证评测与交付层。它把「任务」当作商品:用户声明要完成的任务,平台先给出固定价格,再自动在多种工具(OCR、检索、重排、MCP 工具调用等)之间路由,尝试完成该任务;若最终结果未达成,则退款。项目核心是开源验证层,负责判断 AI 输出是否真正满足任务要求,而不是只看模型自评或人工抽查。它解决的是 AI Agent 落地时「结果不可信、计费不透明、失败无兜底」的问题,把评测、路由、结算和退款串成闭环。技术上以 Python 实现,围绕 agent-tools、benchmark、evaluation、LLM、MCP、OCR、rerankers、retrieval、tool-use 等能力构建,适合需要可审计、可复现 AI 交付的团队。

开源 pay_as_you_go 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 122
维护状态 较活跃
是否开源 是
定价模式 pay_as_you_go

项目数据

分类评测安全
开发团队primitive-bench
所属国家
定价模式pay_as_you_go
价格说明按任务固定价格预付,未交付可退款,具体定价待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agent-tools,ai-agents,benchmark,evaluation,llm,mcp,ocr,rerankers,retrieval,tool-use
GitHub 星标★ 122
30天Star增速
HF 下载量
上线时间2026-06-17 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-30
浏览次数0

使用教程

核心亮点

  • 把固定报价、工具路由、结果验证和退款做成闭环,AI 交付有兜底
  • 开源验证层可独立接入,便于审计 AI 输出是否真正满足任务
  • 覆盖 OCR、检索、重排、MCP 工具调用等,适合多工具组合型 Agent 评测

不足之处

  • 项目早期,星标仅 122,生态与生产案例有限
  • 验证层对复杂主观任务的判定边界和准确率仍需更多公开评测

适用场景

  • 企业采购 AI 数据处理服务,按任务固定报价并要求未达标退款
  • Agent 团队在发布前用可验证基准回归工具调用与检索效果
  • 平台方对第三方 AI 工具做结果验收与自动结算

替代项目

OpenAI Evals、LangSmith、Braintrust

项目介绍

primitive-bench 是评测安全领域的开源项目,由 primitive-bench 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 480 个项目,GitHub 星标数为 122。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。按任务固定价格预付,未交付可退款,具体定价。

它主要面向的使用场景是:企业采购AI数据处理服务,按任务固定报价并要求未达标退款。同类可对比的替代方案包括 OpenAI Evals、LangSmith、Braintrust。

上一篇:perceptual_abilities_evaluation

下一篇:agentgg

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1519 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2975 2026-09-12