llm-jp-eval

一键跑通日语 LLM 多任务评测,结果可对比

llm-jp-eval 是日本 LLM-jp 组织开发的大语言模型评测工具,专门面向日语能力评估。它把多个日语 NLP 数据集(如 JGLUE、日语问答、生成任务等)统一成一套可复现的评测流程,自动下载数据、调用模型、计算指标并汇总分数,解决日语 LLM 评测标准分散、脚本重复、结果难比较的问题。核心能力包括:支持 Hugging Face 模型与 OpenAI 兼容 API 的推理接口;覆盖分类、问答、摘要、翻译等多类任务;提供统一的 prompt 模板与后处理逻辑;输出可对比的 JSON/表格结果,方便研究者横向比较不同模型。项目用 Python 实现,配置驱动,适合作为日语 LLM 的基准测试入口。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 169
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队llm-jp
所属国家
官网地址
定价模式free
价格说明开源免费
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 169
30天Star增速
HF 下载量
上线时间2023-10-19 00:00:00
最近更新2026-09-13 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 统一封装 JGLUE 等日语数据集,省去逐任务写评测脚本的重复劳动
  • 同时支持本地 Hugging Face 模型和 OpenAI 兼容 API,接入成本低
  • 输出结构化分数与可复现配置,方便论文或模型选型时横向对比

不足之处

  • 星标仅 169,社区规模小,遇到问题可参考的讨论有限
  • 主要面向日语场景,非日语评测需求需自行扩展数据集

适用场景

  • 日语 LLM 发布前跑一遍标准基准,生成可对比的评测报告
  • 研究者比较不同微调策略在日语任务上的效果差异
  • 企业选型时快速验证候选模型在日语问答/摘要上的实际表现

替代项目

lm-evaluation-harness、OpenCompass

项目介绍

llm-jp-eval 是一个评测安全领域的开源项目,官方简介:暂无简介。项目使用 Python 开发,在 GitHub 上获得 169 星标。

上一篇:llm_benchmark

下一篇:ollama-benchmark

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24