
hflow
训练前自动体检机器人数据,坏帧丢帧一跑就现形
hflow 是面向机器人团队的 Python SDK,用于在训练 AI 模型前验证数据质量。机器人训练数据常来自多传感器采集(摄像头、激光雷达、IMU、关节状态等),格式多样且规模庞大,低质量样本会直接拖垮模型效果。hflow 把数据质量检查做成可编排的流水线:基于 Airflow 调度任务,用 DuckDB 直接查询 Parquet 等列式存储,支持 LeRobot、MCAP、Foxglove 等机器人数据格式,可对多模态数据做一致性、完整性、时序对齐等校验,并输出可视化报告。团队可以像写数据工程管道一样定义检查规则,在数据入库或训练前自动跑批,快速定位坏帧、丢帧、时间戳错乱等问题,减少人工抽检成本。项目处于早期,272 星,适合想搭建机器人数据质量体系的团队参考和二次开发。
项目数据
使用教程
核心亮点
- 基于 DuckDB 直接查 Parquet,大数据集校验不用全量加载,速度快
- 原生支持 LeRobot、MCAP、Foxglove 等机器人数据格式,贴合具身智能场景
- 用 Airflow 编排检查流水线,可复用现有数据工程习惯做定时批处理
不足之处
- 项目早期,API 和文档可能频繁变动
- 生态和社区案例较少,生产落地需自行补不少适配
适用场景
- 机器人团队在训练 VLA/模仿学习模型前批量筛查采集数据
- 数据标注或入库环节自动跑质量门禁,拦截坏样本
- 多传感器数据时间戳对齐与丢帧问题的排查
替代项目
Great Expectations、pandera
项目介绍
上一篇:flickr_scraper
下一篇:没有了!
同类项目推荐
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
stopes
开源
一键准备多语言翻译数据,从清洗到挖掘平行语料
A library for preparing data for machine translation research (monolingual preproces···