selfcodealign 是模型训练领域的开源项目,由 bigcode-project 开发,2024 年首次发布。
它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 325。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。Apache-2.0许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:代码大模型训练数据自动构建。同类可对比的替代方案包括 CodeRL、Self-Instruct、WizardCoder。

让代码模型自己教自己,无需人工标注,自动提升生成质量。
SelfCodeAlign 是一个面向代码生成任务的自对齐框架,核心思想是让模型通过自身生成的数据来提升代码生成能力,无需依赖人工标注或外部模型。它解决了代码大模型训练中数据获取成本高、标注困难的问题,通过从模型自身采样、过滤、执行验证和指令构建的完整流程,自动生成高质量的训练数据。该框架在 NeurIPS 2024 上发表,支持多种主流代码模型,并提供了完整的训练和评估流程。其核心能力包括:基于执行反馈的自动数据过滤、多样化的指令生成、以及跨模型的自对齐训练策略,能够显著提升模型在 HumanEval 等基准上的 pass@1 指标。
CodeRL、Self-Instruct、WizardCoder
selfcodealign 是模型训练领域的开源项目,由 bigcode-project 开发,2024 年首次发布。
它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 325。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。Apache-2.0许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:代码大模型训练数据自动构建。同类可对比的替代方案包括 CodeRL、Self-Instruct、WizardCoder。
下一篇:SimPO
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···