simulate 是数据集领域的开源项目,由 huggingface 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 195。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费,无付费计划。
它主要面向的使用场景是:机器人策略训练:批量生成带标注的仿真交互数据。同类可对比的替代方案包括 Habitat-Sim、AI2-THOR。

快速搭仿真环境,批量产合成数据
simulate 是一个面向具身智能与合成数据研究的开源项目,核心目标是让研究者能够创建、配置并共享仿真环境。它解决的是具身 AI 训练中真实数据采集成本高、场景难以复现的问题:通过把环境定义、任务逻辑与数据生成流程标准化,研究者可以快速搭建可复现的虚拟场景,批量生成带标注的合成数据,用于训练和评测机器人策略、视觉模型等。项目以 Python 实现,提供环境抽象与共享机制,方便团队之间复用同一套仿真配置,减少重复搭建成本。当前处于早期阶段,星标约 195,适合作为具身与合成数据方向的原型验证与内部研究基础设施。
Habitat-Sim、AI2-THOR
simulate 是数据集领域的开源项目,由 huggingface 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 195。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费,无付费计划。
它主要面向的使用场景是:机器人策略训练:批量生成带标注的仿真交互数据。同类可对比的替代方案包括 Habitat-Sim、AI2-THOR。
上一篇:ABSADatasets
下一篇:没有了!
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models