ai-safety

本站收录 82 个带「ai-safety」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

iFixAiiFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是否在按预期工作?它支持由人类或 A★ 16,623AI-Infra-GuardAI-Infra-Guard 是一个全栈 AI 红队测试平台,旨在系统性评估和加固 AI 生态系统的安全性。它解决了 AI 应用从模型、代理、技能到基础设施各层★ 6,636agent-governance-toolkit这是一个面向AI智能体的治理工具包,旨在解决自主AI代理在运行时缺乏安全管控和合规能力的问题。它围绕策略执行、零信任身份验证、执行沙箱和可靠性工程四大核心模块构★ 6,362valqorevalqore 是一个面向 AI 驱动云和 Kubernetes 运维的安全护栏框架。它解决的是当 AI 或自动化脚本直接操作云基础设施时,可能因误操作、权限过★ 1,910safe-rlhfSafe RLHF 是一个基于安全强化学习的人类反馈对齐框架,旨在解决大模型价值对齐中的安全问题。传统 RLHF 通过人类反馈优化模型行为,但可能忽略安全约束,★ 1,618cc-safety-netcc-safety-net 是一个面向 AI 编码代理的安全防护工具,以 CLI 钩子形式在危险命令执行前进行拦截,防止 AI 代理误删代码、访问敏感文件或执行★ 1,566uqlmUQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心问题是:LLM 在生成文本时经常产生幻觉★ 1,205awesome-gpt-6-astra这是一个围绕OpenAI GPT-6 Astra(推测为未来或虚构模型)的精选资源列表,旨在为开发者、安全研究人员和AI产品经理提供有证据支撑的使用案例、提示词★ 1,139AgentLensAgentLens 是一个基于区块链和可信执行环境(TEE)的去中心化 AI Agent 交易平台。它解决了 AI Agent 分发和变现缺乏信任与安全性的问题★ 1,028gpt_jailbreak_status这是一个追踪 OpenAI GPT 语言模型越狱状态的开源项目,旨在实时更新 GPT 系列模型(如 ChatGPT)被越狱(即绕过安全限制)的进展。项目以 HT★ 933h5ih5i 是一个面向编程代理(coding agents)的集成沙箱环境,用 Rust 编写。它解决了 AI 编程代理在开发过程中需要隔离、可复现的运行环境的问题★ 665awesome-llm-unlearning这是一个关于大语言模型机器遗忘(Machine Unlearning)的资源列表仓库,旨在系统整理该领域的前沿论文、基准数据集、评估指标和开源工具。它解决的核心★ 627agent-safe-pipelineagent-safe-pipeline 是一个为 AI 智能体提供安全执行边界的参考架构,解决智能体“能提议但不能擅自行动”的权限管控问题。其核心流程包括:不可★ 589PostTrainBenchPostTrainBench 是一个用于评测命令行 AI 编程代理(如 Claude Code、Codex CLI、Gemini CLI)在单张 H100 GP★ 573langtestLangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系统性评估的问题,帮助开发者自动生成测试用例,覆盖模型在公平★ 561PromptInjectPromptInject 是一个用于评估大型语言模型(LLM)对对抗性提示攻击鲁棒性的开源框架。它通过模块化方式组装提示词,帮助研究者和开发者定量分析模型在面对★ 526cordumCordum 是一个面向 AI 智能体的“行动防火墙”,旨在为自主代理执行高风险操作前提供策略强制与人工审批机制。它解决的核心问题是:当 AI 代理被赋予调用工★ 510keystone-benchkeystone-bench 是一个面向临床决策支持的评测基准,基于 OpenAI 的 HealthBench 构建。它要解决的问题是:医疗问答里模型给出的答案★ 453AegisAegis 是一个面向 AI 代理的运行时策略执行引擎,旨在解决 AI 代理在自主执行任务时缺乏安全管控的问题。它通过加密审计日志、人工审批(human-in-★ 452Prysai-LLM-Playbook这是一个以证据为导向、覆盖八种语言环境的 LLM 实战手册,旨在提供一套可迁移的核心方法论,并针对 Codex 旗舰路径以及 ChatGPT、Claude Co★ 437martin-loopmartin-loop 是一个面向 AI 编码代理的运行时控制平面,用 TypeScript 编写。它要解决的问题是:当你让 Claude Code、Codex★ 411tigerTiger 是一个开源的 LLM 工具包,旨在构建可信赖的大语言模型应用。它包含三个核心组件:TigerArmor 专注于 AI 安全,提供模型防护、提示注入检★ 405prismorprismor 是一个自托管的 AI 智能体运行时控制平面,专注于在工具调用执行前提供安全防护。它解决了 AI 代理在自主执行过程中可能引发的安全问题,如秘密泄★ 379awesome-rsiawesome-rsi 是一个围绕“递归自我改进(RSI)”的精选研究地图,把散落在模型、智能体、执行框架、具身系统、自动化 AI 研发、评测基准与安全等方向的★ 368floe-guardfloe-guard 是一个为 AI 语音代理设计的开源成本计量与预算控制工具。它解决了语音代理在调用语音识别(STT)、语音合成(TTS)、大语言模型(LLM★ 360orbitorbit 是一个自托管的 AI 网关,兼容 OpenAI API,专注于私有 RAG、自然语言数据访问和工具调用代理。它解决了企业在使用大模型时面临的数据隐私★ 351CyberClawCyberClaw 是一个面向企业级场景的下一代透明智能体架构,基于 Python 构建。它旨在解决 AI 智能体在复杂任务执行中常见的不可控、不安全、记忆混乱★ 334agent-controlagent-control 是一个面向大规模智能体运行时的集中式控制平面,旨在统一管理和治理智能体的行为。它解决的是企业在生产环境中部署多个AI智能体时,缺乏统★ 314rust-docs-mcp-serverrust-docs-mcp-server 是一个基于 Rust 的 MCP(模型上下文协议)服务器,旨在解决 AI 编程助手(如 Copilot、Cursor ★ 297Doberman-CoreDoberman-Core 是一个面向 AI 智能体的安全框架,专注于解决 LLM 应用中的安全防护问题。它提供提示注入防御、运行时策略执行、工具调用权限控制、★ 277Doberman-CoreDoberman-Core 是一个面向 AI 代理的运行时安全防护库,定位为“AI 的看门狗”。它解决的是 LLM 应用在输入、输出和工具调用环节缺乏实时管控的★ 277OpenRTOpenRT 是一个面向多模态大语言模型(MLLMs)的开源红队测试框架,内置 42 种以上的攻击方法,覆盖提示注入、越狱、对抗性样本等常见安全威胁。它旨在解决★ 273governGovern 是一个基于 GitHub Actions 的 AI 治理与合规门禁工具,核心是让开发团队在 CI/CD 流程中对关键步骤(如部署、发布、基础设施变★ 264langfairLangFair 是一个用于大语言模型(LLM)偏见与公平性评估的 Python 库,专注于用例级别的评估。它解决了当前 LLM 应用中缺乏系统化、可操作公平性★ 262anywhere-agentsanywhere-agents 是一个旨在统一管理 AI 编程助手的开源项目,通过单一配置文件(如 agents.md)为所有 AI 代理提供便携、高效且安全的★ 245wrench-boardwrench-board 是一个由 Claude Opus 5 驱动的智能体项目,旨在将资深微焊接技术专家的经验数字化,为从资深维修师到学徒的每一位维修人员提供★ 240awesome-ai-safety这是一个精心整理的AI安全与质量领域的论文和技术文章列表,旨在为研究人员、工程师和政策制定者提供系统性的学习资源。项目解决了AI安全领域信息分散、难以快速入门的★ 223safelabs-evalsafelabs-eval 是一个面向 AI 智能体的红队测试与评测框架,核心目标是把 OWASP ASI(Agentic Security Initiativ★ 220node9-proxynode9-proxy 是一个面向 AI Agent 时代的执行安全层,为自主 AI 代理提供确定性的“Sudo”治理和审计日志。它解决的是当前 LLM 代理在★ 216dsh-auto-reviewdsh-auto-review 是一个面向 DeepSeek Harness 审批流程的 AI 自动审查插件,属于评测安全领域。它解决的是人工审批效率低和单一模★ 212phantasmphantasm 是一套用于构建“人在回路”审批层的工具包,旨在实时监控和引导 AI 代理的工作流程。它解决了 AI 代理在自动化执行任务时缺乏人工监督和干预的★ 196www-project-agent-memory-guardAgent Memory Guard 是 OWASP 基金会下的一个开源项目,专注于解决 AI 智能体(Agent)的记忆安全问题。随着大语言模型(LLM)驱动★ 183dynolabDyno Lab 是一个面向 Apple Silicon 的 AI 安全、对齐与可解释性研究工作台,用 Swift 编写,底层基于 MLX 做本地推理。它解决的★ 178Fintech-CUI-Trust-FrameworkFintech-CUI-Trust-Framework 是一个面向金融科技等高合规领域对话式AI代理的开源工程治理标准。它定义了一套明确的信任边界,解决在银行、★ 177Jailbreak-FoundryJailbreak-Foundry 是一个将越狱研究论文转化为可运行攻击与基准测试的系统,旨在解决 AI 安全研究中论文复现难、基准不统一的问题。它能够从论文中★ 170XSafeClawXSafeClaw 是复旦大学开源的多智能体安全评测平台,专注于检测和防御针对 LLM 智能体的安全威胁。它解决的核心问题是:随着 Agent 被赋予工具调用和★ 164vLLM-HookvLLM-Hook 是一个针对 vLLM 推理引擎的插件,允许开发者编程访问和修改模型在推理过程中的内部状态。它解决了 vLLM 默认黑盒推理、难以干预中间层输★ 162humanboundHumanbound 是一个开源的对抗性测试引擎,为 AI 智能体提供 SDK 和命令行工具,用于发现和修复智能体中的安全漏洞与逻辑缺陷。它解决的核心问题是:A★ 161agentic-ai这是一个精选的智能体AI资源列表,汇集了跨24个领域的研究论文、基准测试、框架和工具。项目旨在为开发者、研究者和爱好者提供一个系统化的入口,帮助他们快速了解智能★ 159Cognitive-Core-Skills这是一个面向大模型、小模型、AI智能体及世界模型的认知核心技能通用分类体系。它不依赖特定行业,提供了一套涵盖感知、记忆、推理、规划、行动、验证、学习和治理等八大★ 158