alignment
本站收录 25 个带「alignment」标签的 AI 开源项目
aeneasaeneas 是一个用 Python/C 编写的开源工具集,用于自动将音频与文本进行强制对齐,即自动生成音频中每个单词或句子对应的时间戳。它解决了人工手动标注音★ 2,868
WFGYWFGY 是一个面向 AI 推理、RAG、智能体及真实世界工作流的开源项目,正迈向 5.0 Polaris Protocol 重大版本。它提供问题地图(Prob★ 1,791
DataDreamerDataDreamer 是一个专注于合成数据生成与模型训练对齐的开源 Python 库。它解决的核心问题是:在真实数据稀缺或受隐私限制时,如何通过提示词(Pro★ 1,121
SimPOSimPO 是一个简单而有效的偏好优化方法,用于对齐大语言模型与人类偏好。它由斯坦福大学等机构提出,发表于 NeurIPS 2024。与传统的直接偏好优化(DP★ 959
OpenJudgeOpenJudge 是一个用于智能体全面评估与质量奖励的统一框架。它解决的核心问题是:当前大模型智能体评估往往只关注最终结果,而忽略过程质量,且评估标准碎片化。★ 860
Awesome-LLM-in-Social-Science这是一个收录大语言模型(LLM)在社会科学领域应用的论文精选列表。项目旨在解决社会科学研究者难以系统追踪LLM相关前沿研究的问题,通过分类整理相关学术论文,帮助★ 648
CipherChatCipherChat是一个评估大语言模型安全对齐泛化能力的框架。它通过将有害指令编码为密码或加密形式,测试模型在非自然语言输入下的安全表现。核心能力包括:支持多★ 630
awesome-llm-unlearning这是一个关于大语言模型机器遗忘(Machine Unlearning)的资源列表仓库,旨在系统整理该领域的前沿论文、基准数据集、评估指标和开源工具。它解决的核心★ 627
deitaDeita 是一个专注于数据高效指令微调的开源项目,旨在解决大语言模型对齐过程中数据质量参差不齐、训练成本高昂的问题。它通过自动筛选高质量指令数据,用更少的数据★ 604
AlignPropAlignProp 是一个用于对齐大规模文本到图像扩散模型的开源项目,核心思想是直接对奖励函数进行反向传播,以微调 Stable Diffusion 等模型,从★ 328
VADERVADER 是一个用于视频扩散模型对齐的开源项目,通过奖励梯度(Reward Gradients)对预训练的视频生成模型进行微调,以提升生成视频的质量和与人类偏★ 318
mini-verlmini-verl 是字节跳动 verl 强化学习训练框架的轻量单卡版本,目标是在一张消费级 NVIDIA GPU(如 RTX 3090/4090)上跑通大模型★ 304
awesome_LLM-harmful-fine-tuning-papers这是一个聚焦大语言模型有害微调攻击的论文综述仓库,对应一篇被 ACM Computing Surveys 收录的综述文章。它系统整理了 harmful fine★ 248
dynolabDyno Lab 是一个面向 Apple Silicon 的 AI 安全、对齐与可解释性研究工作台,用 Swift 编写,底层基于 MLX 做本地推理。它解决的★ 178
Awesome-Music-GenerationAwesome-Music-Generation 是一个聚焦音乐生成模型(MG²)的资源合集,收录了基于扩散模型、大语言模型等技术的音乐生成项目、论文和工具。它★ 167
bournemouth-forced-aligner这是一个用于语音音频的强制对齐工具,能够自动提取音素级别的时间戳。它解决了语音处理中需要精确对齐音频与文本的问题,尤其适用于语音识别、语音合成和语言学研究。核心★ 167
timethingTimething 是一个用于将文本转录与音频录音进行对齐的开源库。它解决的核心问题是,在语音识别或音频处理场景中,转录文本与音频时间轴不同步,导致难以定位或校★ 133
autoguardrailsAutoGuardrails 是一个面向 LLM 护栏的 alignment-research 脚手架,采用 autoresearch 风格,在单一的 poli★ 130
SensorLLMSensorLLM是EMNLP 2025的官方实现,旨在将大语言模型与运动传感器数据对齐,用于人类活动识别。它解决了传统HAR模型泛化能力差、难以理解复杂活动语★ 111
ReAlignReAlign 是一个专注于大语言模型对齐(Alignment)的开源项目,核心思路是“重新格式化对齐”——即通过改变训练数据的格式或结构来提升模型的对齐效果,★ 111
AutoControl-ArenaAutoControl-Arena 是一个面向前沿 AI 的风险自动发现平台,旨在系统性地评估和暴露大语言模型在自主控制场景下的潜在危险能力。它通过构建一个自动★ 107
awesome-direct-preference-optimization这是一个关于直接偏好优化(Direct Preference Optimization, DPO)的精选资源列表,旨在系统梳理该领域的研究进展。DPO是一种用于★ 94
VLGuardVLGuard是一个针对视觉大语言模型(VLLMs)的安全微调基线项目,发表于ICML 2024。它解决的是VLLMs在视觉输入下容易生成不安全内容的问题,例如★ 91
DPO-ShiftDPO-Shift 是一个针对直接偏好优化(DPO)算法的改进开源项目,旨在解决 DPO 训练中分布偏移的问题。在标准 DPO 中,模型在训练时使用的参考分布与★ 59
Re-AlignRe-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检索机制,在模型生成文本时检索相关图像作为额外★ 52