
llm-jp-eval
一键跑通日语 LLM 多任务评测,结果可对比
llm-jp-eval 是日本 LLM-jp 组织开发的大语言模型评测工具,专门面向日语能力评估。它把多个日语 NLP 数据集(如 JGLUE、日语问答、生成任务等)统一成一套可复现的评测流程,自动下载数据、调用模型、计算指标并汇总分数,解决日语 LLM 评测标准分散、脚本重复、结果难比较的问题。核心能力包括:支持 Hugging Face 模型与 OpenAI 兼容 API 的推理接口;覆盖分类、问答、摘要、翻译等多类任务;提供统一的 prompt 模板与后处理逻辑;输出可对比的 JSON/表格结果,方便研究者横向比较不同模型。项目用 Python 实现,配置驱动,适合作为日语 LLM 的基准测试入口。
项目数据
使用教程
核心亮点
- 统一封装 JGLUE 等日语数据集,省去逐任务写评测脚本的重复劳动
- 同时支持本地 Hugging Face 模型和 OpenAI 兼容 API,接入成本低
- 输出结构化分数与可复现配置,方便论文或模型选型时横向对比
不足之处
- 星标仅 169,社区规模小,遇到问题可参考的讨论有限
- 主要面向日语场景,非日语评测需求需自行扩展数据集
适用场景
- 日语 LLM 发布前跑一遍标准基准,生成可对比的评测报告
- 研究者比较不同微调策略在日语任务上的效果差异
- 企业选型时快速验证候选模型在日语问答/摘要上的实际表现
替代项目
lm-evaluation-harness、OpenCompass
项目介绍
上一篇:llm_benchmark
下一篇:ollama-benchmark
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents