eval-assist
开源
用网页交互调教 LLM 当裁判,迭代出靠谱评估标准
EvalAssist 是一个开源工具,旨在简化使用大语言模型作为评估者(LLM-as-a-Judge)来评判其他大语言···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
eval-assist
开源
用网页交互调教 LLM 当裁判,迭代出靠谱评估标准
EvalAssist 是一个开源工具,旨在简化使用大语言模型作为评估者(LLM-as-a-Judge)来评判其他大语言···
system_prompts_leaks
开源
扒开各家 AI 的底牌,看清它怎么想、怎么答
从 Anthropic(Claude Fable 5、Opus 5、Claude Design、Claude Code)、OpenAI(ChatGPT GPT-5.6-···
circle-guard-bench
开源
给 LLM 防护系统打分,选最靠谱的护栏
circle-guard-bench 是首个专门评估大语言模型(LLM)防护系统(包括 guardrails 和 safeguards)能···
uqlm
开源
量化 LLM 不确定性,精准识别幻觉,提升 AI 输出可信度。
UQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心···
CVPR_2025_Oral_Paper_List
开源
一键速览CVPR 2025 Oral论文,紧跟视觉前沿
这是一个精选的CVPR 2025 Oral论文清单,共收录96篇论文。它解决了计算机视觉领域研究者难以快速获···
vitest-evals
开源
用 Vitest 写 LLM 评测,像跑单测一样跑模型回归
vitest-evals 是一个把大模型评测(evals)直接嵌入 Vitest 测试框架的 TypeScript 扩展。它解决的···
openai-guardrails-python
开源
给 LLM 应用加一层安全护栏,自动拦截违规输入输出
openai-guardrails-python 是 OpenAI 官方开源的 Python 安全护栏库,用于在 LLM 应用中检测和拦截···
agent-scan
开源
扫一遍 Agent 和 MCP 配置,提前揪出权限与注入风险
agent-scan 是一款面向 AI Agent 生态的安全扫描器,主要针对 AI 智能体、MCP(Model Context Prot···
heurigym
开源
用 LLM 设计优化算法,一键评测智能体启发式能力
heurigym 是一个面向组合优化问题的智能体基准测试框架,由 ICLR'26 论文提出。它专门评估大型语言···
compute-eval
开源
用真实编译运行测大模型写 CUDA 代码行不行
ComputeEval 是一个专门用于评测大语言模型生成 CUDA 代码能力的开源框架。它解决的核心问题是:现···
cai
开源
给AI穿上防弹衣,让安全模型扛住攻击
CAI(Cybersecurity AI)是一个面向AI安全领域的开源框架,旨在为网络安全场景提供标准化的人工智能···
Eval
开源
并行跑 LLM 评测,速度提升最高 17 倍
Eval 是一个面向大语言模型的高性能评测框架,核心卖点是并行 API 调用,官方宣称比顺序执行的评测···
xVerify
开源
快速验证推理模型答案,让评估更省钱省时。
xVerify 是一个面向推理模型的高效答案验证器,专门用于评估 LLM 在数学等推理任务上的表现。它解决···
auto_eval
开源
让机器人策略评估全自动,省时省力又客观
AutoEval 是一个针对通用机器人操作策略的自动化评估框架,源自 CoRL 2025 论文。它解决的是在真实···
geobench
开源
用 GeoGuessr 游戏场景,测出 AI 的地理定位智商。
geobench 是一个专门为语言模型设计的 GeoGuessr 基准测试工具,旨在评估 AI 模型在地理定位和空间···
Awesome-Anomaly-Detection-Foundation···
开源
一网打尽基础模型做异常检测的前沿资源
这是一个精选列表,汇集了基于基础模型(如大语言模型、视觉-语言模型、图基础模型、时间序列基础模···
pII-guard
开源
用 LLM 智能识别日志中的隐私信息,轻松满足 GDPR 合规。
PII Guard 是一个基于大语言模型的工具,用于检测和管理日志中的个人身份信息(PII),旨在支持数据···
svelte-bench
开源
专测大模型写 Svelte 5 代码行不行
svelte-bench 是一个专门评测大语言模型在 Svelte 5 框架下代码生成能力的基准测试项目,基于 Open···
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam 是一个面向大语言模型和 AI Agent 的红队测试框架,用 Python 编写。它要解决的问题是:当···
CL4R1T4S
开源
看穿AI底牌,一键获取各大模型系统提示词
这是一个收集并公开各大AI系统(如ChatGPT、Claude、Gemini、Grok、Perplexity、Cursor等)泄露的系···
ClawProBench
开源
在真实 OpenClaw 里反复跑 Agent,用确定性打分比出谁更稳
ClawProBench 是一个面向 LLM Agent 的评测基准框架,专门针对 OpenClaw 运行时环境设计。它解决的···
Awesome-Process-Reward-Models
开源
一站式索引过程奖励模型论文与代码,快速上手推理监督
Awesome-Process-Reward-Models 是一个面向大语言模型推理过程奖励模型(Process Reward Model, PR···
Static-to-Dynamic-LLMEval
开源
动态生成评测样本,防数据污染,测出模型真实力
Static-to-Dynamic-LLMEval 是论文《Recent advances in large language model benchmarks against···
Impossible-Videos
开源
用不可能视频,测出多模态模型的物理常识短板
Impossible-Videos 是 ICML 2025 论文的官方基准与代码库,专注于视频生成与理解中的‘不可能视频’···