LongICLBench

测出长上下文模型在超长输入下的真实学习能力

LongICLBench 是 TMLR 2025 论文《Long-context LLMs Struggle with Long In-context Learning》的官方代码与数据集仓库。它聚焦于长上下文大语言模型(LLM)在长上下文学习(Long In-context Learning, ICL)场景下的性能短板,提供了一套专门设计的基准测试集和评估工具。该基准包含多个需要从超长上下文中提取并应用复杂模式的任务,例如长序列分类、键值检索和模式归纳,旨在暴露模型在上下文长度增加时性能急剧下降的问题。项目核心能力包括:生成标准化的长上下文任务数据、提供统一的评估脚本以量化模型在不同长度下的表现、以及支持多种主流 LLM 的接入测试。通过该基准,研究者可以系统性地诊断长上下文模型在记忆、推理和泛化方面的真实能力,从而推动模型架构和训练方法的改进。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 113
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队TIGER-AI-Lab
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,代码和数据完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型large-language-models
GitHub 星标★ 113
30天Star增速
HF 下载量
上线时间2024-04-02 00:00:00
最近更新2026-06-30 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

核心亮点

  • 专门针对长上下文学习设计,填补了现有基准在超长上下文任务上的空白
  • 提供标准化数据生成和评估脚本,便于复现论文结果和横向对比
  • 覆盖多种任务类型,能全面诊断模型在长上下文下的模式提取与泛化能力

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善
  • 数据集规模和模型覆盖范围有限,可能不足以代表所有长上下文场景

适用场景

  • 评估长上下文 LLM 在超长输入下的学习与推理能力
  • 对比不同模型或训练方法在长上下文任务上的表现
  • 推动长上下文模型架构和训练策略的改进研究

替代项目

LongBench、L-Eval、ZeroSCROLLS

项目介绍

LongICLBench 是数据集领域的开源项目,由 TIGER-AI-Lab 开发,2024 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 113。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-06-30。MIT许可证,代码和数据完全免费,无付费版本。

它主要面向的使用场景是:评估长上下文LLM在超长输入下的学习与推理能力。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。

上一篇:Craw4LLM

下一篇:Awesome-Data-Efficient-LLM

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09