
OpusFilter
配置式过滤平行语料,快速清洗出高质量句对
OpusFilter 是一个用 Python 编写的平行语料处理工具包,面向机器翻译和 NLP 数据准备环节。它解决的核心问题是:从网络抓取或已有的平行语料往往噪声大、句对质量参差、语言混杂,直接训练会拖累模型效果。OpusFilter 提供了一套可配置的过滤流水线,用户通过 YAML 配置文件组合多种过滤器,对句对进行打分和筛选。核心能力包括:基于语言识别的过滤、句长与长度比过滤、重复与相似度去重、字符/词级统计过滤、双语词典匹配、以及可自定义的 Python 过滤器。它支持多进程并行处理,能处理大规模语料,并输出保留或剔除的句对及统计报告,方便迭代调参。项目与 OPUS 语料生态紧密相关,适合在训练 NMT 模型前做数据清洗。
项目数据
使用教程
核心亮点
- 提供 YAML 配置驱动的过滤流水线,可灵活组合语言识别、长度比、重复度等多种过滤器
- 支持多进程并行处理,适合大规模平行语料的高效清洗
- 与 OPUS 语料生态集成,可直接下载和处理 OPUS 数据集
不足之处
- 项目星标数较低,社区规模和活跃度有限,长期维护存在不确定性
- 文档以英文为主,中文用户上手需要一定学习成本
适用场景
- 机器翻译模型训练前的平行语料清洗与质量筛选
- 从网络爬取的平行文本中去除语言不匹配、长度异常和重复句对
- 构建低资源语言平行语料时,用双语词典过滤器筛选可靠句对
替代项目
Bicleaner、SOTA-filter
项目介绍
同类项目推荐
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
stopes
开源
一键准备多语言翻译数据,从清洗到挖掘平行语料
A library for preparing data for machine translation research (monolingual preproces···