PostTrainBench 是评测安全领域的开源项目,由 aisa-group 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 567。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。
它主要面向的使用场景是:研究人员对比不同AI代理的模型定制化能力。同类可对比的替代方案包括 OpenCompass、lm-evaluation-harness、AgentBench。

一张H100,十小时,测出AI代理调教大模型的本事
PostTrainBench 是一个用于评测命令行 AI 编程代理(如 Claude Code、Codex CLI、Gemini CLI)在单张 H100 GPU 上、10 小时内对基础大模型进行后训练(post-training)能力的基准测试框架。它解决了当前缺乏标准化、可复现的代理后训练评测问题,为研究者和工程师提供了一套统一的测试协议,包括任务定义、数据集、评估指标和自动化流程。核心能力包括:自动化运行代理进行微调或对齐实验、监控资源消耗、量化模型性能提升,并支持多代理横向对比。该项目旨在推动 AI 代理在模型定制化场景中的应用,降低后训练门槛,同时关注安全性和可复现性。
OpenCompass、lm-evaluation-harness、AgentBench
PostTrainBench 是评测安全领域的开源项目,由 aisa-group 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 567。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。
它主要面向的使用场景是:研究人员对比不同AI代理的模型定制化能力。同类可对比的替代方案包括 OpenCompass、lm-evaluation-harness、AgentBench。
上一篇:context-bombs
下一篇:Aegis
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.