google-veo3-from-scratch

手把手从零复现 Veo 3,搞懂视频生成核心架构

这是一个从零开始、逐步实现 Google Veo 3 架构的开源项目,旨在帮助开发者深入理解 Veo 3 视频生成模型的内部原理。项目以 Jupyter Notebook 形式提供,涵盖从文本到视频生成的核心模块,包括多模态编码、时空建模、扩散生成等关键环节。它解决了 Veo 3 官方未开源、技术细节不透明的问题,通过清晰的分步实现和代码讲解,让学习者能够亲手搭建一个简化版 Veo 3,并掌握视频生成模型的设计思路。项目基于 Python,并借鉴了 OpenAI、Sora 等前沿工作的思想,适合对视频生成、多模态 AI 感兴趣的研究者和工程师。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 82
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队FareedKhan-dev
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型google,google-veo-3,llm,multimodal,openai,python,sora,text-to-video,veo,veo3
GitHub 星标★ 82
30天Star增速
HF 下载量
上线时间2025-06-16 00:00:00
最近更新2026-08-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 分步实现,代码结构清晰,适合学习复杂模型架构
  • 涵盖多模态编码、时空建模等关键模块,讲解深入
  • 基于真实论文和公开资料,技术路线可信

不足之处

  • 项目处于早期,文档和社区支持待观察
  • 未提供完整训练代码,可能无法直接生产使用

适用场景

  • 研究 Veo 3 架构细节,撰写技术分析报告
  • 教学演示,用于视频生成模型课程或工作坊
  • 作为基础,二次开发轻量级文本到视频模型

替代项目

Open-Sora、VideoGPT、CogVideo

项目介绍

google-veo3-from-scratch 是视频领域的开源项目,由 FareedKhan-dev 开发,2025 年首次发布。

它收录于视频分类,该分类目前共有 473 个项目,GitHub 星标数为 82。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-20。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:研究Veo3架构细节,撰写技术分析报告。同类可对比的替代方案包括 Open-Sora、VideoGPT、CogVideo。

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09