AlignLLMHumanSurvey

一张图看懂大模型如何对齐人类偏好

这是一个关于大语言模型与人类对齐(Alignment)的综述资源库,系统梳理了让 LLM 输出符合人类意图、价值观和偏好的技术路线。项目围绕指令微调、RLHF、监督微调等核心方法,汇总了 ChatGPT、GPT-4、LLaMA、LLaMA2、Chinese-LLaMA 等主流模型的对齐实践,并整理了相关论文、数据集、评测基准与开源工具。它解决的是研究者和工程师在快速膨胀的对齐文献中难以建立全局认知、难以选型的问题,相当于一张对齐领域的地图。核心能力包括:按技术阶段分类的方法论梳理、对齐数据与评测资源的索引、以及面向中文社区的资料聚合。适合作为入门综述阅读,也可作为工程落地时的参考清单。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 738
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队GaryYufei
所属国家
官网地址
定价模式free
价格说明学术论文,免费公开访问
访问状态
是否开源
开源协议
主要语言
技术栈/模型awesome,chatgpt,chinese-llama,gpt-4,large-language-models,llama,llama2,llms,rlhf,supervised-finetuning,survey
GitHub 星标★ 738
30天Star增速
HF 下载量
上线时间2023-07-23 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 按指令微调、RLHF、评测等阶段系统分类,结构清晰,便于快速建立对齐领域知识框架
  • 聚合了 LLaMA、ChatGPT、GPT-4 等主流模型的对齐实践与论文链接,省去大量检索时间
  • 覆盖中文社区关注点,包含 Chinese-LLaMA 等资源,对国内研究者友好

不足之处

  • 本质是 awesome 列表式资源汇总,缺乏对方法优劣的深度对比与实验验证
  • 更新依赖人工维护,对齐领域进展极快,部分条目可能滞后

适用场景

  • 研究生入门大模型对齐方向时快速建立文献地图
  • 算法工程师为 RLHF 或指令微调方案选型时查阅参考
  • 团队内部做对齐技术分享时直接复用其分类框架

替代项目

Awesome-LLM、LLM-Awesome、RLHF-Papers

项目介绍

AlignLLMHumanSurvey 是一个评测安全领域的开源项目,官方简介:Aligning Large Language Models with Human: A Survey。项目使用 未知 开发,在 GitHub 上获得 738 星标。

上一篇:inspect_ai

下一篇:GenAI-LLM-Top10

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24