giza-pp

用平行语料训练词对齐模型,输出双语词对应关系

GIZA++ 是统计机器翻译领域的经典开源工具包,主要实现 IBM Model 1-5 以及 HMM 词对齐模型的训练,用于从平行语料中自动学习源语言与目标语言词语之间的对应关系。它解决的核心问题是双语词对齐:给定大量句对,推断出每个词在另一语言中的翻译概率与位置对应,这是统计机器翻译、词对齐评测和后续神经对齐研究的基础组件。包内还包含 mkcls 工具源码,可自动生成词类,用于部分对齐模型的初始化训练。项目以 C++ 编写,运行效率较高,支持大规模语料迭代训练,输出对齐文件与概率表,被 Moses 等主流统计翻译系统广泛集成。作为早期项目,其接口偏命令行、配置繁琐,但仍是词对齐方向不可绕过的参考实现。

开源 free 行业应用
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 274
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类行业应用
开发团队moses-smt
所属国家
官网地址
定价模式free
价格说明开源免费,需自行编译部署
访问状态
是否开源
开源协议
主要语言C++
技术栈/模型
GitHub 星标★ 274
30天Star增速
HF 下载量
上线时间2015-03-17 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-24
浏览次数0

使用教程

核心亮点

  • 实现完整的 IBM Model 1-5 与 HMM 对齐模型,覆盖统计词对齐主流算法
  • 附带 mkcls 词类生成工具,可完成从词类初始化到模型训练的完整流程
  • C++ 实现,支持大规模平行语料迭代训练,被 Moses 等系统长期集成验证

不足之处

  • 命令行参数与配置流程繁琐,缺少现代封装和易用的 Python 接口
  • 项目年代久远,构建方式与文档偏旧,社区活跃度低

适用场景

  • 统计机器翻译系统训练前的双语词对齐
  • 词对齐算法教学与 IBM 模型实验复现
  • 为神经词对齐或翻译模型提供对齐标注与评测基线

替代项目

fast_align、eflomal、Moses

项目介绍

giza-pp 是行业应用领域的开源项目,由 moses-smt 开发,2015 年首次发布。

它收录于行业应用分类,该分类目前共有 544 个项目,GitHub 星标数为 274。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。开源免费,需自行编译部署。

它主要面向的使用场景是:统计机器翻译系统训练前的双语词对齐。同类可对比的替代方案包括 fast_align、eflomal、Moses。

上一篇:Swim_Pool_Web_Dev

下一篇:bidara

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 102 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 691 2026-08-13