world-models

本站收录 55 个带「world-models」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163lingbot-world致力于推进开源世界模型的前沿项目,通过大规模数据与先进架构构建可泛化的世界模型,助力视频生成、仿真与具身智能等方向的研究与应用发展。★ 4,494HunyuanWorld-1.0HunyuanWorld-1.0 是腾讯混元团队推出的3D世界生成模型,旨在从文本或图像直接生成沉浸式、可探索且可交互的3D世界。它解决了传统3D内容制作成本高★ 2,936LightX2VLightX2V 是一个轻量级的图像到视频(I2V)动作生成推理框架,专注于降低视频生成模型的使用门槛。它解决了现有视频生成工具依赖复杂环境、推理速度慢、资源占★ 2,867HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176alpamayoalpamayo 是 NVIDIA 开源的 10B 参数推理型 VLA(视觉-语言-动作)模型,专为自动驾驶设计。它把驾驶轨迹预测与 Chain-of-Caus★ 2,030HunyuanWorld-VoyagerHunyuanWorld-Voyager 是一个基于 RGBD 视频生成的交互式 3D 重建模型,由腾讯混元团队开源。它解决了从普通视频中实时重建 3D 场景的★ 1,599cosmos-predict2.5Cosmos-Predict2.5 是 NVIDIA 开源的视频生成模型,属于 Cosmos 世界基础模型(WFM)系列的最新版本,专注于以视频形式模拟和预测世★ 1,374awesome-3d-4d-world-models这是一个关于3D和4D世界建模的综述性资源列表,收录了TPAMI 2026论文《3D and 4D World Modeling: A Survey》中引用的相★ 993Causal-ForcingCausal-Forcing 是 ICML 2026 论文的官方代码库,提出了一种自回归扩散模型的蒸馏方法,旨在实现高质量、实时的交互式视频生成。它解决了传统扩★ 983lingbot-videolingbot-video 是一个面向具身智能的视频生成预训练项目,核心思路是用混合专家(MoE)架构扩展视频预训练规模。它解决的是机器人或智能体在真实世界中缺★ 964Matrix-3DMatrix-3D 是一个从单张图片或文本提示生成大规模可探索 3D 场景的开源项目。它通过生成高质量的全景视频,让用户能够在虚拟 3D 空间中自由漫游。该项目★ 833WorldSeedWorldSeed 是一个基于 Python 的多智能体世界引擎,旨在模拟 AI 智能体的生活、对话、竞争与结盟等复杂社会行为。它通过 agent-based ★ 822rcmrCM(Rectified Consistency Models)是一个专注于视频扩散模型蒸馏的开源项目,旨在将大规模视频扩散模型转化为少步生成模型,实现双向和★ 814DriveAGIDriveAGI 是一个基于 CVPR 2024 Highlight 论文 GenAD 实现的开源自动驾驶预测模型。它旨在通过大规模视频数据预训练一个通用的驾驶★ 807cosmos-transfer2.5Cosmos-Transfer2.5 是 NVIDIA 开源的视频生成模型,基于 Cosmos-Predict2.5 构建,专注于多空间控制条件下的高质量世界模★ 744Awesome-Video-World-Models-with-AR-Diffusion这是一个精心整理的视频世界模型资源清单,聚焦于自回归扩散(AR Diffusion)技术路线。项目系统梳理了该领域的算法、应用与基础设施,旨在为研究人员、工程师★ 711SpatialVIDSpatialVID 是一个面向视频生成与空间智能研究的大规模视频数据集,由 CVPR 2026 论文提出。它解决了现有视频数据集缺乏空间标注、难以支撑 4D ★ 601Code-as-WorldCode-as-World 是一个面向物理推理的智能体研究项目,核心思路是让 AI 智能体通过生成可执行代码来发现和表达物理世界的规律。它把视频理解、视觉语言模★ 467vmemVMem 是一个基于 ICCV 2025 论文的开源视频生成项目,专注于交互式视频场景生成。它通过 Surfel-Indexed View Memory(表面元★ 449World-R1World-R1 是一个面向文本到视频生成任务的强化学习框架,核心思路是在视频生成过程中注入 3D 约束,以提升生成内容的物理合理性和时空一致性。它解决了现有视★ 427OpenDWMOpenDWM 是一个专注于自动驾驶场景的开源世界模型代码库,提供从训练、推理到评估的完整工具链,并附带预训练权重。它基于扩散模型和视频生成技术,旨在解决自动驾★ 422TesserActTesserAct 是 ICCV 2025 收录的 4D 具身世界模型项目,旨在解决机器人或具身智能体对动态三维世界的理解与预测问题。它通过将视频生成与 3D/★ 409EponaEpona 是 ICCV 2025 收录的自动驾驶世界模型官方实现,基于自回归扩散模型生成未来视频帧。它解决自动驾驶中预测未来场景的难题,核心能力是给定当前观测★ 389EasyWAMEasyWAM 是一个面向具身智能与机器人领域的统一训练框架,专注于 World Action Model(世界动作模型)的构建。它把世界模型与视觉-语言-动作★ 377CarDreamerCarDreamer 是一个基于世界模型(World Model)的自动驾驶研究平台,构建在 CARLA 模拟器之上。它旨在解决自动驾驶中模型训练成本高、泛化能★ 375Book-of-MLM《多模态大模型:新一代人工智能技术范式》一书的官方配套教学资源库,由中国人民大学高瓴人工智能学院长聘副教授卢志武团队维护。项目旨在为读者和研究者提供系统性的多模★ 328Awesome-Physics-Cognition-based-Video-Generation这是一个聚焦视频生成中物理认知方向的论文列表,旨在系统梳理该交叉领域的研究进展。它解决了研究者难以快速获取物理感知视频生成相关论文、代码和资源的问题。项目按主题★ 327sekai-codebaseSekai 是一个面向世界模型探索的视频数据集,由 NeurIPS 2025 收录。它旨在解决视频生成领域缺乏高质量、多样化、长时程视频数据的问题,为训练能够理★ 312Awesome-Interactive-World-Model这是一个关于交互式世界模型的论文与资源精选列表,旨在系统梳理该领域的前沿研究。项目按核心研究挑战(如3D、扩散模型、流式视频、数据集等)对论文进行分类,帮助研究★ 308HyDRAHyDRA 是一个面向动态视频世界模型的混合记忆框架,旨在解决视频生成中长时程动态场景的建模难题。其核心思想是“眼不见,心不忘”——通过结合短期工作记忆和长期语★ 282Echo-MemoryEcho-Memory 是一个用于视频世界模型研究的简单基线项目,核心思路是引入显式记忆机制来提升视频生成的时间连贯性与物理合理性。它解决的是当前视频生成模型在★ 253DrivingWorldDrivingWorld 是一个面向自动驾驶场景的世界模型构建项目,基于视频 GPT 架构生成驾驶视频。它解决的问题是:自动驾驶系统需要预测和理解未来道路场景,★ 245FM-AD-SurveyFM-AD-Survey 是一个持续更新的综述论文仓库,专注于大型基础模型(Foundation Models)在自动驾驶场景生成与分析中的应用。它系统收集和整★ 238GeometryForcingGeometryForcing 是一个将视频扩散模型与 3D 表示相结合的统一世界建模框架,旨在解决视频生成中时空一致性问题。它通过引入几何约束(如深度、点云等★ 227world-in-worldworld-in-world 是一个基于闭环世界模型(Closed-Loop World Models)的视频生成开源项目,核心论文发表于 ICLR'26 并获★ 209Awesome-Efficient-AIGCAwesome-Efficient-AIGC 是一个专注于高效 AIGC(人工智能生成内容)领域的精选资源列表,收录了相关论文、文档和代码。该项目旨在为高效 A★ 209SCoPESCoPE 是一个面向三维感知视频生成的开源研究项目,核心是提出「视线坐标位置编码」(Sightline-Coordinate Positional Encod★ 208LiDARCrafterLiDARCrafter 是一个基于 LiDAR 序列的动态 4D 世界建模框架,由 AAAI 2026 Oral 论文提出。它解决的是从稀疏、无序的 LiDA★ 203alpamayo-recipesalpamayo-recipes 是 NVIDIA Alpamayo 的开发者中心,面向自动驾驶与物理 AI 场景,提供一整套可直接运行的模型配方。它解决的核心★ 193ReSimReSim 是一个面向自动驾驶的可靠世界模拟器,基于扩散模型生成高保真视频,用于仿真测试和场景理解。它解决了自动驾驶中真实世界数据稀缺、边缘场景难以覆盖的问题,★ 192VideoActionModelVideoActionModel 是自动驾驶视频生成建模的官方实现,包含 VaViM 和 VaVAM 两个核心模型。它解决的是自动驾驶中通过视频生成来学习世界模★ 171Cognitive-Core-Skills这是一个面向大模型、小模型、AI智能体及世界模型的认知核心技能通用分类体系。它不依赖特定行业,提供了一套涵盖感知、记忆、推理、规划、行动、验证、学习和治理等八大★ 158LiveWorldLiveWorld 是 ECCV 2026 论文的官方实现,旨在解决生成式视频世界模型中“视野外动态”的模拟问题。传统视频生成模型只能基于可见帧进行预测,而 L★ 144Olaf-WorldOlaf-World 是一个面向视频世界建模的研究项目,核心是“潜在动作定向”(Orienting Latent Actions),旨在让视频生成模型具备交互性★ 123mirage-cortexmirage-cortex是一个面向大语言模型世界建模的智能体集群模拟工具集,旨在通过多智能体仿真来探索涌现行为。它提供了一套基于代理的操作系统(agentos★ 121Web-World-ModelsWeb World Models 是一个基于 TypeScript 的开源项目,对应论文《Web World Models》的官方实现页面。该项目旨在构建能够理★ 91genrlGenRL 是一个基于多模态基础世界模型的强化学习框架,旨在将自然语言和视频提示转化为具体可执行的动作序列。它通过将语言和视频输入编码为潜在世界模型状态序列,再★ 86AAD-1AAD-1 是一个面向单步自回归视频生成的开源项目,基于 ICML 2026 论文提出非对称对抗蒸馏方法。它针对自回归视频生成模型推理速度慢的问题,通过引入非对★ 77Apple-PIApple-PI(Apple-π)是一个面向物理智能的视频生成基准测试项目,旨在评估和推动视频生成模型对物理世界规律的理解。它提出了“思维链帧”(chain-o★ 76