xFinder

用AI自动评估AI,让模型评测更可靠、更省力

xFinder是一个用于大语言模型评估的自动化评测框架,核心思路是让LLM本身充当评估器,以替代传统的人工评估或基于规则的方法。它解决了LLM输出评估中可靠性不足、成本高昂和速度慢的问题。xFinder通过训练一个专门的评估模型,能够对目标LLM的生成结果进行精准打分或分类,支持多种评估协议(如关键词匹配、数值打分等)。其关键能力包括:提供了一套可复现的训练流程和数据集构建方法,使得评估器可以针对特定任务定制;同时,它强调评估结果与人类判断的一致性,旨在提升评测的准确性和稳定性。该项目在ICLR 2025发表,提供了代码和模型,但尚处于早期阶段,生态和文档有待完善。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 180
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队IAAR-Shanghai
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型benchmark,cc-by-nc-nd-4,chatglm,dataset,evaluation,gpt,judge-model,key-answer-extraction,large-language-models,llm,llm-as-a-judge,llm-as-evaluator,lm-evaluation,open-compass,phi,qwen,regex,reliability,reliable-evaluation,xfinder
GitHub 星标★ 180
30天Star增速
HF 下载量
上线时间2024-05-19 00:00:00
最近更新2026-08-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 提出用LLM作为自动化评估器的新范式,减少人工成本
  • 支持多种评估协议,可灵活适配不同评测任务
  • 提供了训练代码和数据集构建方法,便于复现和定制

不足之处

  • 项目处于早期,文档和社区支持尚不完善
  • 评估器的准确性依赖训练数据质量,泛化性待验证

适用场景

  • 大模型基准测试中的自动评分
  • 生成式任务(如摘要、对话)的质量评估
  • 需要快速、低成本评估模型输出的研发场景

替代项目

Prometheus、LLM-as-a-Judge、MT-Bench

项目介绍

xFinder 是评测安全领域的开源项目,由 IAAR-Shanghai 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 180。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-16。本地部署,完全免费。

它主要面向的使用场景是:大模型基准测试中的自动评分。同类可对比的替代方案包括 Prometheus、LLM-as-a-Judge、MT-Bench。

上一篇:CUREBench

下一篇:pII-guard

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12