OpusFilter

配置式过滤平行语料,快速清洗出高质量句对

OpusFilter 是一个用 Python 编写的平行语料处理工具包,面向机器翻译和 NLP 数据准备环节。它解决的核心问题是:从网络抓取或已有的平行语料往往噪声大、句对质量参差、语言混杂,直接训练会拖累模型效果。OpusFilter 提供了一套可配置的过滤流水线,用户通过 YAML 配置文件组合多种过滤器,对句对进行打分和筛选。核心能力包括:基于语言识别的过滤、句长与长度比过滤、重复与相似度去重、字符/词级统计过滤、双语词典匹配、以及可自定义的 Python 过滤器。它支持多进程并行处理,能处理大规模语料,并输出保留或剔除的句对及统计报告,方便迭代调参。项目与 OPUS 语料生态紧密相关,适合在训练 NMT 模型前做数据清洗。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 115
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队Helsinki-NLP
所属国家
官网地址
定价模式free
价格说明开源免费工具,无付费服务
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型corpus-processing,corpus-tools,machine-translation,natural-language-processing,nlp,parallel-corpus
GitHub 星标★ 115
30天Star增速
HF 下载量
上线时间2019-11-06 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-11
浏览次数0

使用教程

核心亮点

  • 提供 YAML 配置驱动的过滤流水线,可灵活组合语言识别、长度比、重复度等多种过滤器
  • 支持多进程并行处理,适合大规模平行语料的高效清洗
  • 与 OPUS 语料生态集成,可直接下载和处理 OPUS 数据集

不足之处

  • 项目星标数较低,社区规模和活跃度有限,长期维护存在不确定性
  • 文档以英文为主,中文用户上手需要一定学习成本

适用场景

  • 机器翻译模型训练前的平行语料清洗与质量筛选
  • 从网络爬取的平行文本中去除语言不匹配、长度异常和重复句对
  • 构建低资源语言平行语料时,用双语词典过滤器筛选可靠句对

替代项目

Bicleaner、SOTA-filter

项目介绍

OpusFilter 是一个数据集领域的开源项目,官方简介:OpusFilter - Parallel corpus processing toolkit。项目使用 Python 开发,在 GitHub 上获得 115 星标。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
stopes 开源

一键准备多语言翻译数据,从清洗到挖掘平行语料

A library for preparing data for machine translation research (monolingual preproces···

★ 313 2026-08-10