stopes

一键准备多语言翻译数据,从清洗到挖掘平行语料

stopes 是由 Meta AI 的 FAIR NLLB 团队开发的数据集准备库,专为机器翻译研究设计。它解决的核心问题是多语言翻译数据处理的复杂性,提供从单语语料预处理到双语文本挖掘(bitext mining)的一站式工具链。其核心能力包括:大规模单语数据的清洗、过滤和去重;基于嵌入或词频的双语平行句对挖掘;支持多语言数据集的构建与平衡;以及集成 NLLB 项目的数据处理流程。该库以 Python 编写,模块化设计,便于研究人员定制流水线,尤其适合低资源语言的数据增强和语料构建。通过自动化处理,它显著降低了构建高质量翻译数据集的门槛,是 NMT 研究和应用的基础设施。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 312
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类数据集
开发团队facebookresearch
所属国家
定价模式free
价格说明开源库,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型dataset,dataset-generation,machine-learning,machine-translation,machine-translation-data-processing,nmt,translation
GitHub 星标★ 312
30天Star增速
HF 下载量
上线时间2022-06-02 00:00:00
最近更新2026-09-24 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数13

使用教程

核心亮点

  • 由 Meta FAIR NLLB 团队出品,处理多语言数据经验丰富,代码质量有保障
  • 内置 bitext mining 功能,可自动从大规模单语语料中挖掘平行句对
  • 模块化流水线设计,支持自定义预处理步骤,适配不同研究需求

不足之处

  • 文档/社区待观察
  • 项目处于早期阶段,API 可能不稳定,需关注版本更新

适用场景

  • 构建低资源语言的机器翻译训练数据集
  • 从网络爬取的多语语料中清洗并挖掘平行语料
  • 研究多语言翻译模型时的数据增强与平衡

替代项目

LASER、fastText、Moses

项目介绍

stopes 是数据集领域的开源项目,由 facebookresearch 开发,2022 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 312。

项目仍在小幅维护中,最近一次代码更新于 2026-09-24。开源库,MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:构建低资源语言的机器翻译训练数据集。同类可对比的替代方案包括 LASER、fastText、Moses。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09