MIND
开源
测测你的视频生成模型,记忆和动作控制靠不靠谱
MIND 是一个用于评估世界模型记忆一致性和动作控制能力的开源基准测试平台,属于视频生成领域。它主···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
MIND
开源
测测你的视频生成模型,记忆和动作控制靠不靠谱
MIND 是一个用于评估世界模型记忆一致性和动作控制能力的开源基准测试平台,属于视频生成领域。它主···
evals
开源
用真实 React Native 任务,测出 AI 编码真本事。
evals 是一个用于评估编码模型解决真实 React Native 任务能力的基准测试套件。它通过一系列实际开···
agent-audit
开源
给 AI 智能体做安全体检,防提示注入和配置漏洞
agent-audit 是一个针对 LLM 智能体的静态安全扫描工具,主要解决 AI Agent 应用中的安全漏洞问题,···
damn-vulnerable-ai-agent
开源
故意留洞的 AI Agent 靶场,拿来练提示注入和越权
damn-vulnerable-ai-agent 是一个故意设计成存在安全漏洞的 AI Agent 平台,用于安全测试与教学。它···
RVCBench
开源
给语音克隆模型做安全体检,防伪造保隐私
RVCBench 是一个针对语音克隆鲁棒性、说话人隐私和音频保护的基准测试框架,覆盖 26 个 TTS 和 VC ···
prompt-guard
开源
给 AI 智能体装上防注入防火墙,自动识别恶意提示并评分。
prompt-guard 是一个面向 AI 智能体的高级提示注入防御系统,旨在解决大语言模型应用面临的提示注入···
terminal-bench-science
开源
让 AI 在终端里跑通真实科研任务并自动打分
Terminal-Bench-Science 是一个面向科研工作流的 AI 智能体评测基准,聚焦于评估 AI 在真实科学计算···
skills-benchmarks
开源
给 AI 智能体技能上秤,跑分对比不靠嘴
skills-benchmarks 是一个面向 AI 智能体技能(skills)的评测基准集合,用 JavaScript 实现。它要···
tribunal
开源
在 Elixir 里像写测试一样评测 LLM 输出
tribunal 是一个面向 Elixir 生态的 LLM 评测框架,解决在 Elixir 应用中缺乏统一方式评估和测试大···
GenAI-LLM-Top10
开源
对照 OWASP 清单,快速排查大模型应用安全风险
GenAI-LLM-Top10 是 OWASP 针对大语言模型应用发布的风险清单项目,用 JavaScript 实现相关演示与说···
AgentMark
开源
给AI智能体行为打上隐形水印,防止被盗用
AgentMark 是一个面向智能体(Agent)行为的水印工具,旨在保护基于大语言模型的智能体不被恶意窃取···
AgentEval
开源
用 .NET 原生工具,给 AI Agent 做全面体检和红队测试。
AgentEval 是一个面向 .NET 生态的 AI Agent 评测工具包,旨在为 .NET 开发者提供与 Python 生态中···
OpenRT
开源
一键对多模态大模型发起42+攻击,快速暴露安全漏洞
OpenRT 是一个面向多模态大语言模型(MLLMs)的开源红队测试框架,内置 42 种以上的攻击方法,覆盖···
Veritensor
开源
扫描 AI 模型与数据,防投毒、防注入、防泄露
Veritensor 是一个针对 AI 供应链的安全静态分析工具,定位为“AI 制品杀毒软件”和“RAG 防火墙”···
Synthid-Bypass
开源
实测绕过 Google SynthID 水印,AI 图像溯源攻防参考
Synthid-Bypass 是一个 AI 安全研究项目,展示了如何绕过 Google 在 Nano Banana Pro 图像生成模型···
Spiritual-Spell-Red-Teaming
开源
用现成越狱提示快速测出大模型安全漏洞
Spiritual-Spell-Red-Teaming 是一个专注于大语言模型越狱(jailbreak)测试的开源仓库,主要针对 ···
ai-safe2-framework
开源
给 AI 智能体装上治理与合规操作系统,让 AI 安全落地。
AI SAFE² 是一个面向智能体 AI、非人类身份(NHI)和 AI 集群(Swarm)的治理、风险与合规(GRC)···
awesome-ai-agents-security
开源
一张地图看懂AI代理安全生态,快速找到关键资源
这是一个关于AI智能体安全的精选资源列表,旨在绘制AI代理安全生态系统的活地图。它系统整理了该领···
aiewf-eval
开源
专测大模型长上下文下的安全表现
aiewf-eval 是 AI 安全评测框架 AIEWF 的评测套件,专注于长上下文场景下的模型行为评估。它解决的···
PostTrainBench
开源
一张H100,十小时,测出AI代理调教大模型的本事
PostTrainBench 是一个用于评测命令行 AI 编程代理(如 Claude Code、Codex CLI、Gemini CLI)在单···
MLLM-Token-Compression
开源
一页看懂多模态大模型Token压缩方案怎么选
MLLM-Token-Compression 是一个围绕多模态大语言模型(MLLM)Token 压缩的综述与资源集合项目。多模···
WorldLens
开源
给自动驾驶世界模型做全科体检,从生成到重建一测到底
WorldLens 是一个面向自动驾驶世界模型的全面评测框架,由 CVPR 2026 Oral 论文提出。它旨在解决当···
awesome-ai-eval
开源
一站式收藏AI评估工具,快速选型不踩坑
这是一个关于AI评估领域的精选资源清单,旨在帮助开发者和研究者系统性地了解如何评估AI系统在真实···
Awesome-Mental-Health-LLMs
开源
一篇文章看懂LLM做心理健康的技术地图与风险
这是一个关于大语言模型在心理健康领域应用的综述项目,对应论文《从模式识别到个性化伴侣:心理健···