langwatch
开源
一站式搞定LLM评估与智能体测试,从开发到上线全程可控
LangWatch是一个面向LLM评估与AI智能体测试的开源平台,旨在解决大模型应用开发中评估难、调试烦、···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
langwatch
开源
一站式搞定LLM评估与智能体测试,从开发到上线全程可控
LangWatch是一个面向LLM评估与AI智能体测试的开源平台,旨在解决大模型应用开发中评估难、调试烦、···
text2image-benchmark
开源
一键跑分,量化你的文生图模型实力
text2image-benchmark 是一个用于生成式图像模型的基准测试工具,专注于文本到图像生成任务。它解决···
vigil-llm
开源
给LLM输入装个安检门,拦截提示注入和越狱攻击
Vigil 是一个专注于检测大语言模型(LLM)输入安全风险的开源基础设施工具。它主要解决提示注入(p···
LLF-Bench
开源
让AI听懂人话反馈,越学越聪明
LLF-Bench 是一个专门评估智能体仅通过语言反馈进行学习能力的基准测试平台。它解决了当前强化学习···
CipherChat
开源
用密码绕过安全护栏,测出大模型隐藏漏洞
CipherChat是一个评估大语言模型安全对齐泛化能力的框架。它通过将有害指令编码为密码或加密形式,···
deepeval
开源
像写单元测试一样评测你的 LLM 应用,快速发现质量回归。
DeepEval 是一个开源的 LLM(大语言模型)评测框架,旨在帮助开发者系统化地测试和评估基于 LLM 的···
ClassEval
开源
测大模型写类的能力,比单函数更接近真实编程
ClassEval 是一个面向类级别代码生成的基准测试集,旨在评估大语言模型在生成完整类(而非单函数)···
AgentBench
开源
一套基准测出 LLM 当智能体到底行不行
AgentBench 是一个用于评估大型语言模型(LLM)作为智能体(Agent)能力的综合基准测试,由清华大学···
llm-guard
开源
给 LLM 应用加把安全锁,防注入防泄露
llm-guard 是一个面向大语言模型交互的安全工具包,旨在检测和缓解各类安全威胁,如提示注入、越狱···
parea-sdk-py
开源
一站式搞定 LLM 应用的测试、评估与监控
Parea AI 是一个面向 LLM 应用的开发工具链,提供 Python SDK 来支持实验、测试、评估和监控。它解···
Awesome-Prompting-on-Vision-Language···
开源
一网打尽视觉语言模型提示工程论文,快速入门研究
这是一个关于视觉语言模型提示工程的精选论文列表,源自一篇系统综述论文。它系统梳理了提示工程在···
AlignLLMHumanSurvey
开源
一张图看懂大模型如何对齐人类偏好
这是一个关于大语言模型与人类对齐(Alignment)的综述资源库,系统梳理了让 LLM 输出符合人类意图···
promptmap
开源
给 LLM 应用做安全体检,防提示注入攻击
promptmap 是一款针对自定义 LLM 应用的安全扫描器,帮助开发者在部署前发现提示注入等安全漏洞。它···
llm-hallucination-survey
开源
一站式读懂大模型幻觉,从入门到前沿
这是一个关于大语言模型幻觉问题的精选阅读清单,并配套发布了一篇综述论文《Siren's Song in the ···
T2I-CompBench
开源
测出文生图模型到底懂不懂组合逻辑
T2I-CompBench 是一个用于评估文本到图像生成模型组合能力的基准测试框架,由 NeurIPS 2023 和 TPA···
bench
开源
跑个分,就知道哪个大模型更适合你
bench 是一个用于评估大型语言模型(LLM)的工具,基于 TypeScript 构建。它解决了开发者在选择或迭···
awesome-llm-security
开源
一站式找到 LLM 安全工具和资料,防坑避雷
awesome-llm-security 是一个精选列表,汇集了关于大语言模型(LLM)安全领域的优秀工具、文档和项···
LLM-eval-survey
开源
一张图看懂大模型评估,从基准到方法全覆盖
LLM-eval-survey 是大语言模型评估领域权威综述论文《A Survey on Evaluation of Large Language M···
athina-sdk
开源
写测试、跑监控,让 LLM 应用在生产环境不翻车
athina-sdk 是一个用于 LLM 应用生产环境监控与测试的 Python SDK。它主要解决大语言模型应用在真实···
prompttools
开源
一键对比测试提示词,选对模型和参数不再靠猜
prompttools 是一个开源的提示词测试与实验工具集,专为 LLM 和向量数据库设计。它解决了提示词工程···
datafog-python
开源
给 AI 应用装个本地隐私闸门,敏感信息不出门。
datafog-python 是一个面向 AI 智能体和 LLM 应用的离线 PII(个人身份信息)防火墙。它解决的是 A···
aegis
开源
给大模型装上会自我进化的安全防火墙
aegis 是一个面向大型语言模型的自加固防火墙,属于基础设施类项目。它解决的是 LLM 在部署和交互过···
opencompass
开源
一站式评测大模型,百个数据集横向对比,快速选出最强模型。
OpenCompass 是一个大语言模型评估平台,旨在解决 LLM 评测标准不一、流程复杂的问题。它支持超过 ···
GenDataAttribution
开源
量化训练图像对AI生成的影响,让模型更透明。
GenDataAttribution 是一个面向文本到图像模型的视觉数据归因基准测试工具,旨在评估和量化训练图像···