trustworthy-ai

本站收录 20 个带「trustworthy-ai」标签的 AI 开源项目

giskard-ossGiskard 是一个面向 LLM 智能体和应用的自动化评估与测试开源库。它解决了大模型应用上线前缺乏系统性质量保障的问题,提供从单元测试到红队攻击的全链路测试★ 5,846EasyEditEasyEdit 是一个面向大语言模型(LLM)的知识编辑框架,由 ACL 2024 论文提出,旨在高效、精准地修改模型内部已学到的知识,而无需重新训练或微调。★ 2,927babysitterBabysitter 是一个面向智能体工作流的编排与管控框架,旨在解决多智能体协作中常见的失控、幻觉和任务复杂度高的问题。它通过确定性的自编排机制,让智能体在严★ 1,822MarkLLMMarkLLM 是一个面向大语言模型(LLM)水印技术的开源工具包,在 EMNLP 2024 上作为 Demo 发布。它旨在解决 AI 生成文本的溯源与版权保护★ 1,078TrustLLMTrustLLM 是一个针对大语言模型可信度的系统性研究项目,源自 ICML 2024 论文。它定义了一个包含真实性、安全性、公平性、鲁棒性、隐私性、机器伦理与★ 633langtestLangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系统性评估的问题,帮助开发者自动生成测试用例,覆盖模型在公平★ 561Robust-R1Robust-R1 是一个针对视觉语言模型在复杂退化场景下推理能力不足的问题而提出的开源项目,其论文被 AAAI 2026 接收为 Oral。该项目核心是提出一★ 511PoisonedRAGPoisonedRAG 是 USENIX Security 2025 收录的研究项目,专注于揭示检索增强生成(RAG)系统中的知识投毒攻击。它通过向知识库注入恶★ 301gen-fraud-graphgen-fraud-graph 是一个用于生成合成欺诈图数据的开源工具,专门服务于金融领域基于图的欺诈检测模型基准测试。它解决了真实金融欺诈数据难以获取、隐私敏★ 284AttackVLMAttackVLM 是一个针对视觉语言模型(VLM)的红队攻击工具集,源自 NeurIPS 2023 论文。它提供了一系列对抗性攻击方法,用于评估和揭示 VLM★ 231ANeurIPS2024_SPV-MIASPV-MIA 是 NeurIPS 2024 收录的针对微调大语言模型的成员推理攻击方法。它解决的核心问题是:当大模型经过微调后,攻击者能否判断某条数据是否出现★ 184vLLM-HookvLLM-Hook 是一个针对 vLLM 推理引擎的插件,允许开发者编程访问和修改模型在推理过程中的内部状态。它解决了 vLLM 默认黑盒推理、难以干预中间层输★ 162WatermarkDMWatermarkDM 是论文《A Recipe for Watermarking Diffusion Models》的官方代码实现,专注于为扩散模型生成的图像★ 155AwesomeResponsibleAIAwesomeResponsibleAI 是一个精选资源列表,汇集了与负责任、可信赖和以人为本的 AI 相关的学术研究、书籍、伦理准则、课程、数据库、数据集、框★ 152Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144TrustEval-toolkitTrustEval-toolkit 是一个用于评估生成式基础模型可信度的开源工具包和基准测试集,相关论文已被 ICLR'26 和 NAACL'25 Demo 接★ 137Omni-SafetyBenchOmni-SafetyBench 是一个用于评估音视频大语言模型(AV-LLMs)安全性的基准测试工具,源自 ACM MM 2026 Oral 论文。它解决当前★ 115ai-privacy-toolkitai-privacy-toolkit 是一个面向 AI 模型隐私与合规的 Python 工具包,旨在帮助开发者和企业在使用 AI 模型时满足隐私保护与法规要求。★ 113Chain-of-EmbeddingChain-of-Embedding 是 ICLR 2025 论文的官方代码与数据仓库,提出了一种无需生成输出即可让大语言模型进行自我评估的方法。它利用潜在空间★ 105safe-clipSafe-CLIP 是一个针对视觉-语言模型的安全增强工具,主要解决 CLIP 类模型在图像生成和检索任务中可能生成或检索到 NSFW(不宜工作场所)内容的问题★ 68