
AlignLLMHumanSurvey
一张图看懂大模型如何对齐人类偏好
这是一个关于大语言模型与人类对齐(Alignment)的综述资源库,系统梳理了让 LLM 输出符合人类意图、价值观和偏好的技术路线。项目围绕指令微调、RLHF、监督微调等核心方法,汇总了 ChatGPT、GPT-4、LLaMA、LLaMA2、Chinese-LLaMA 等主流模型的对齐实践,并整理了相关论文、数据集、评测基准与开源工具。它解决的是研究者和工程师在快速膨胀的对齐文献中难以建立全局认知、难以选型的问题,相当于一张对齐领域的地图。核心能力包括:按技术阶段分类的方法论梳理、对齐数据与评测资源的索引、以及面向中文社区的资料聚合。适合作为入门综述阅读,也可作为工程落地时的参考清单。
项目数据
使用教程
核心亮点
- 按指令微调、RLHF、评测等阶段系统分类,结构清晰,便于快速建立对齐领域知识框架
- 聚合了 LLaMA、ChatGPT、GPT-4 等主流模型的对齐实践与论文链接,省去大量检索时间
- 覆盖中文社区关注点,包含 Chinese-LLaMA 等资源,对国内研究者友好
不足之处
- 本质是 awesome 列表式资源汇总,缺乏对方法优劣的深度对比与实验验证
- 更新依赖人工维护,对齐领域进展极快,部分条目可能滞后
适用场景
- 研究生入门大模型对齐方向时快速建立文献地图
- 算法工程师为 RLHF 或指令微调方案选型时查阅参考
- 团队内部做对齐技术分享时直接复用其分类框架
替代项目
Awesome-LLM、LLM-Awesome、RLHF-Papers
项目介绍
上一篇:inspect_ai
下一篇:GenAI-LLM-Top10
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents