world-model

本站收录 36 个带「world-model」标签的 AI 开源项目

vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135HunyuanWorld-1.0HunyuanWorld-1.0 是腾讯混元团队推出的3D世界生成模型,旨在从文本或图像直接生成沉浸式、可探索且可交互的3D世界。它解决了传统3D内容制作成本高★ 2,936Matrix-GameMatrix-Game 是一个实时流式交互式世界模型,旨在解决长时程视频生成中的记忆与交互问题。它基于Genie架构,支持生成超过10分钟的长视频,并能在生成过★ 2,342Awesome-World-ModelAwesome-World-Model 是一个面向自动驾驶(并延伸至机器人等领域)的世界模型论文与资源合集。它把散落在 arXiv、会议和工程博客里的世界模型相★ 2,267HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176Awesome-World-ModelsAwesome-World-Models 是一个围绕“世界模型”主题的论文与资源合集,系统整理了世界模型的定义、发展脉络,以及它在通用视频生成、具身智能和自动驾★ 2,027Awesome-LLM4ADAwesome-LLM4AD 是一个持续更新的精选资源列表,聚焦于大语言模型(LLM)、视觉语言模型(VLM)、视觉语言动作模型(VLA)以及世界模型在自动驾驶★ 1,890HunyuanWorld-VoyagerHunyuanWorld-Voyager 是一个基于 RGBD 视频生成的交互式 3D 重建模型,由腾讯混元团队开源。它解决了从普通视频中实时重建 3D 场景的★ 1,599MotusMotus 是一个统一潜在动作世界模型,用于视频生成和机器人操作。它基于扩散模型,将视觉、语言和动作融合到一个潜在空间中,通过预测未来的视频帧来学习世界的动态规★ 1,297AWorldAWorld 是一个面向智能体(Agent)的研究与开发平台,旨在帮助开发者轻松地搜索、理解、复现和改进一个想法。它提供了一套完整的工具链,涵盖智能体框架、运行★ 1,238Causal-ForcingCausal-Forcing 是 ICML 2026 论文的官方代码库,提出了一种自回归扩散模型的蒸馏方法,旨在实现高质量、实时的交互式视频生成。它解决了传统扩★ 983VistaVista是一个面向自动驾驶的通用世界模型,来自NeurIPS 2024。它解决的核心问题是:自动驾驶系统如何在没有标注数据的情况下,预测和想象未来的驾驶场景。★ 901nano-world-modelnano-world-model 是一个极简但功能完备的世界模型研究仓库,旨在推进世界模型科学的发展。它基于扩散强制(diffusion-forcing)技术,★ 751YUMEYUME 是一个基于世界模型的实时视频生成项目,官方代码库。它支持文本到视频和图像到视频的生成,强调交互式与实时生成能力。项目旨在解决传统视频生成速度慢、缺乏交★ 683AetherAether 是一个面向具身智能与空间智能的统一世界模型,核心解决视频生成中几何一致性缺失的问题。它通过融合4D重建与生成技术,在生成视频的同时显式建模场景的几★ 612OmniWorldOmniWorld 是一个面向 4D 世界建模的多领域、多模态数据集,由 ICLR 2026 论文提出。它旨在解决当前视频生成和世界模型研究中数据单一、缺乏空间★ 498Awesome-Generalist-Robots-via-Foundation-Models这是一个精选论文列表,源自综述论文《Toward General-Purpose Robots via Foundation Models: A Survey ★ 469large-performance-model.github.ioLPM 1.0 是一个基于视频的角色表演模型,旨在从视频中提取并生成角色的动态表演。它解决的是传统角色动画制作中流程复杂、成本高的问题,核心能力包括实时视频驱动★ 366AstraAstra 是一个面向视频生成与交互式世界建模的开源项目,核心思路是用自回归去噪(Autoregressive Denoising)构建通用交互式世界模型。它解★ 340WorldFoundryWorldFoundry 是一个面向世界模型(World Model)的统一推理与评估基础设施,旨在解决视频生成、视觉-语言-动作(VLA)及世界动作模型(WA★ 318RLVR-WorldRLVR-World 是 NeurIPS 2025 论文《Training World Models with Reinforcement Learning》的★ 278WorldLensWorldLens 是一个面向自动驾驶世界模型的全面评测框架,由 CVPR 2026 Oral 论文提出。它旨在解决当前驾驶世界模型评估标准单一、缺乏真实世界关★ 253LynnReal-OmniLynnReal-Omni 是一个把多种视频生成与编辑能力统一到同一框架的开源项目,基于 Python 实现。它试图解决视频生成领域模型碎片化的问题:文生视频、★ 241VideoREPAVideoREPA 是一个面向视频生成的研究项目,旨在通过关系对齐(Relational Alignment)让生成模型更好地学习物理规律。它针对当前视频生成模★ 208Awesome-Video-Reasoning-Landscape这是一个关于视频推理领域的开源综述项目,旨在系统梳理视频推理的最新任务、范式和基准。它解决了视频理解领域缺乏统一知识框架的问题,帮助研究者和开发者快速了解视频推★ 191iVideoGPTiVideoGPT 是一个基于交互式视频生成的可扩展世界模型,来自 NeurIPS 2024 论文。它通过自回归 Transformer 架构,将视频预测、动作★ 187WorldForgeWorldForge 是一个基于 CVPR 2026 Highlight 论文的官方实现,专注于可控的视频生成与 4D 世界模型构建。它解决的核心问题是:在视频★ 178WKMWKM(World Knowledge Model)是一个面向智能体规划的开源模型,源自NeurIPS 2024论文。它解决的是大语言模型在复杂任务规划中缺乏世★ 168Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144lpwmlpwm(Latent Particle World Models)是一个面向视频生成与预测的物体中心世界模型,由ICLR 2026 Oral论文官方开源。它旨★ 139MaineCoonMaineCoon 是一个追求实时音视频社交世界模型的开源项目,目前处于早期技术报告与项目链接阶段。它旨在构建一个能够实时理解和生成音频与视频的生成式AI模型,★ 121MINDMIND 是一个用于评估世界模型记忆一致性和动作控制能力的开源基准测试平台,属于视频生成领域。它主要解决当前视频生成模型在长时程生成中出现的记忆漂移和动作控制不★ 81Vid2WorldVid2World 是一个将视频扩散模型转化为交互式世界模型的开源项目,源自 ICLR 2026 论文。它解决的核心问题是:如何让 AI 从静态视频中学习环境动★ 79EgoSimEgoSim 是一个面向具身智能与第一人称视觉的仿真世界生成器,核心解决现有视频生成模型缺乏第一人称视角与交互一致性的问题。它能够根据用户提供的动作指令或场景描★ 72EVAEVA 是一个将视频生成模型与机器人动作执行对齐的开源项目,核心思路是利用逆动力学奖励来训练视频世界模型,使其不仅能预测未来帧,还能根据视频内容生成可执行的机器★ 64Awesome-Video-World-Models这是一个关于视频生成作为世界模型的精选资源列表,从机制视角梳理了视频生成与物理世界模拟的关联。项目核心在于将视频生成理解为对世界状态和动态的建模,而非简单的像素★ 61