LongICLBench 是数据集领域的开源项目,由 TIGER-AI-Lab 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 113。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-06-30。MIT许可证,代码和数据完全免费,无付费版本。
它主要面向的使用场景是:评估长上下文LLM在超长输入下的学习与推理能力。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。

测出长上下文模型在超长输入下的真实学习能力
LongICLBench 是 TMLR 2025 论文《Long-context LLMs Struggle with Long In-context Learning》的官方代码与数据集仓库。它聚焦于长上下文大语言模型(LLM)在长上下文学习(Long In-context Learning, ICL)场景下的性能短板,提供了一套专门设计的基准测试集和评估工具。该基准包含多个需要从超长上下文中提取并应用复杂模式的任务,例如长序列分类、键值检索和模式归纳,旨在暴露模型在上下文长度增加时性能急剧下降的问题。项目核心能力包括:生成标准化的长上下文任务数据、提供统一的评估脚本以量化模型在不同长度下的表现、以及支持多种主流 LLM 的接入测试。通过该基准,研究者可以系统性地诊断长上下文模型在记忆、推理和泛化方面的真实能力,从而推动模型架构和训练方法的改进。
LongBench、L-Eval、ZeroSCROLLS
LongICLBench 是数据集领域的开源项目,由 TIGER-AI-Lab 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 113。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-06-30。MIT许可证,代码和数据完全免费,无付费版本。
它主要面向的使用场景是:评估长上下文LLM在超长输入下的学习与推理能力。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。
上一篇:Craw4LLM
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models