text-to-video
本站收录 178 个带「text-to-video」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
OpenMontage全球首个开源的智能体视频制作系统,提供 12 条生产流水线、100 余种工具以及 700 多个智能体技能与制作知识文件。可将 AI 编程助手转化为完整的视频生产★ 61,862
Open-Generative-AI不受限制的开源 AI 图像与视频生成平台,集成 Flux、Midjourney、Kling、Sora、Veo 等 500+ 模型,无内容过滤、可自托管,MIT ★ 29,398
hypithypit 是一个用 TypeScript 编写的开源视频生成工具,目标是把爆款视频的完整制作流程交给 AI 代理自动完成。它不只是生成脚本,而是覆盖换脸、改写★ 17,185
Toonflow-app开源的一站式 AI 短剧创作工具,可将小说、剧本快速转化为动画短剧,集成 AI 编剧、智能分镜、角色与视频生成等能力,跨平台桌面端轻量部署,助力创作者低成本批量★ 16,224
CogVideo智谱开源的文字与图像生成视频系列模型,包含 2024 年发布的 CogVideoX 与 ICLR 2023 收录的 CogVideo,同时支持文生视频与图生视频★ 13,048
LTX-VideoLightricks 官方开源的 LTX-Video 视频生成模型仓库,基于 DiT 架构实现高质量文生视频与图生视频,支持实时生成与可控编辑,为视频创作者提供★ 10,995
SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163
imagen-pytorch谷歌 Imagen 文生图模型的 PyTorch 实现,忠实还原其扩散模型架构与超分辨率能力,代码清晰、易于扩展,是研究文生图技术原理与二次开发的优质开源参考。★ 8,429
dramaclaw通用 AIGC 视频引擎,以一条流水线打通从剧本到成片的全部环节,支持漫剧、广告、产品视频、乙女游戏等内容形态,帮助创作者低成本、高效率地将创意转化为完整影视作★ 6,583
Awesome-Prompt-Engineering这是一个精选的提示工程(Prompt Engineering)资源列表,专注于GPT、ChatGPT、PaLM等生成式预训练模型。项目整理了从基础概念到高级技巧★ 6,347
ArcReelAI Agent 驱动的开源可自部署视频工作台,可将小说与剧本转化为角色、场景、道具资产、分镜、视频及剪映草稿,支持跨镜头一致性、多供应商接入与费用追踪,让短剧★ 5,237
VideoCrafter高质量视频扩散模型 VideoCrafter2,通过创新的训练策略有效克服数据稀缺问题,在有限数据下依然能生成清晰流畅、运动自然的高质量视频,为视频生成研究提供★ 5,085
HunyuanVideo-1.5腾讯混元推出的领先轻量级视频生成模型,在保持高画质的前提下大幅压缩模型规模与推理成本,支持高效文生视频,适合资源受限环境下的部署与应用。★ 4,564
Diffusion-Models-Papers-Survey-Taxonomy扩散模型论文、综述与分类体系的精选资料库,系统梳理扩散模型领域的研究脉络与分类框架,是快速入门与持续跟踪该领域进展的必备导航工具。★ 3,364
awesome-generative-ai-apps这是一个精选的开源生成式 AI 应用合集,收录了 50 多个可直接克隆、部署并商业化的项目,涵盖图像生成、视频工具、虚拟试穿、AI SaaS 模板及平台集成等类★ 3,347
Stable-Diffusion这是一个聚焦Stable Diffusion生态的中文教程与资源聚合项目,旨在帮助用户从零开始掌握AI图像生成技术。项目覆盖了FLUX、SDXL、SD3等主流模★ 2,769
Awesome-Video-Diffusion-Models这是一个关于视频扩散模型的精选资源列表,源自一篇发表在《计算机科学与技术评论》(CSUR)上的综述论文。项目系统梳理了视频扩散模型领域的核心研究,包括模型架构、★ 2,318
anything2explaineranything2explainer 是一个 Claude Code / Codex 技能,输入任意主题,输出带旁白解说的科普视频。它用 Remotion 在代★ 2,200
HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176
vox-directorvox-director 是一个自动化生成 Vox 风格纸板拼贴解说视频的开源项目。它接受一个主题,通过 Atlas Cloud 和 ffmpeg 完成从脚本撰★ 2,096
make-a-video-pytorchMake-A-Video 的 PyTorch 非官方实现,复现 Meta AI 提出的文本生成视频模型。该模型基于扩散模型架构,结合了文本编码器、时空注意力机制★ 1,988
AIComicBuilderAIComicBuilder 是一个基于 TypeScript 构建的 AI 动画漫画生成器,旨在将文字脚本自动转化为完整的动画视频。它解决了从创意到成片过程中★ 1,885
VBenchVBench 是一个专为视频生成模型设计的综合评估基准,由 CVPR 2024 Highlight 论文提出。它解决了视频生成领域缺乏统一、细粒度、自动化评估标★ 1,800
TokenFlowTokenFlow 是 ICLR 2024 的官方 PyTorch 实现,用于实现基于扩散模型的视频编辑。它解决了文本到视频编辑中常见的时序不一致问题,即逐帧独★ 1,707
ai-moive-studioai-moive-studio(AICON)是一个自然语言驱动的无限画布工作流 Agent,面向 AI 视频创作者。它解决的核心问题是:现有 AI 视频工具大多★ 1,600
MiniMax-MCPMiniMax-MCP 是 MiniMax 官方推出的 Model Context Protocol (MCP) 服务器,旨在将 MiniMax 的多模态生成能★ 1,584
DirectorDirector 是一个面向下一代视频交互与工作流的 AI 智能体框架,基于 Python 构建。它旨在解决视频内容生成、编辑和处理过程中缺乏统一智能编排的问题★ 1,540
PhantomPhantom 是一个基于扩散模型的文生视频(Text-to-Video)开源项目,专注于解决视频生成中主体一致性问题。它通过跨模态对齐技术,确保在生成的视频中★ 1,516
text-to-video-synthesis-colab这是一个基于 Colab 的文本生成视频(T2V)合成项目,旨在让用户无需本地 GPU 即可通过 Jupyter Notebook 运行文本到视频的生成模型。它★ 1,514
awesome-seedanceawesome-seedance 是一个面向 AI 视频生成(尤其字节 Seedance 2.5/2.0)的提示词案例库。它解决的核心问题是:网上流传的 AI ★ 1,494
video-diffusion-pytorchvideo-diffusion-pytorch 是 Jonathan Ho 论文《Video Diffusion Models》的 PyTorch 实现,将 D★ 1,389
MagicTimeMagicTime 是一个专注于生成延时摄影视频的开源项目,核心能力是将文本描述转化为自然演变过程的延时视频,例如花朵绽放、冰雪融化、云卷云舒等。它基于扩散模型★ 1,337
MOVAMOVA 是一个统一的多模态基础模型,能够在一个模型中同时生成同步的视频和音频,解决了传统视频生成中音画分离、需要额外配音或后期对齐的痛点。它基于扩散模型架构,★ 1,119
Hotshot-XLHotshot-XL 是一个基于 Stable Diffusion XL 的文本生成 GIF 模型,由 Hotshot 团队开发。它解决了文本到动态图像生成的问★ 1,112
ShareGPT4VideoShareGPT4Video 是一个由 NeurIPS 2024 收录的开源项目,旨在通过生成高质量的视频描述文本来提升视频理解与生成模型的性能。它解决了当前视★ 1,096
HunyuanVideo-FoleyHunyuanVideo-Foley 是腾讯混元团队开源的多模态扩散模型,用于从视频内容自动生成高保真度的拟音音频(Foley Sound)。它解决了视频后期制★ 1,061
MotionDirectorMotionDirector 是 ECCV 2024 Oral 论文的开源实现,专注于文本到视频扩散模型的运动定制。它解决的是现有视频生成模型难以精确控制动作、★ 1,055
Causal-ForcingCausal-Forcing 是 ICML 2026 论文的官方代码库,提出了一种自回归扩散模型的蒸馏方法,旨在实现高质量、实时的交互式视频生成。它解决了传统扩★ 983
brainrot.jsbrainrot.js 是一个将文本转换为视频的生成器,专门生成“脑腐”风格的短视频。它允许用户选择喜欢的“名人”风格,通过自动化流程将学习内容转化为有趣的短视★ 958
FancyVideoFancyVideo 是一个早期的视频生成开源项目,支持从文本和图像生成视频,属于第一代此类工具。它主要解决用户快速将文字描述或静态图片转化为动态视频片段的需求★ 919
clipforgeClipForge(原『带货剪手』)是一个开源的 AI 带货短视频生成工具,主要面向电商卖家、内容创作者和中小商家。它解决的是商品短视频制作成本高、效率低的问题★ 907
ConsisIDConsisID 是一个面向身份保持的文本到视频生成模型,由 CVPR 2025 Highlight 论文提出。它解决的是在视频生成中,如何根据文本描述生成指定★ 862
Text-To-Video-AIText-To-Video-AI 是一个基于 AI 的文本转视频生成工具,旨在帮助用户通过简单的文字描述快速生成视频内容。它解决了传统视频制作门槛高、耗时长的痛★ 834
Matrix-3DMatrix-3D 是一个从单张图片或文本提示生成大规模可探索 3D 场景的开源项目。它通过生成高质量的全景视频,让用户能够在虚拟 3D 空间中自由漫游。该项目★ 833
kandinsky-5Kandinsky 5.0 是一个基于扩散模型的视频与图像生成项目,旨在提供高质量的多模态生成能力。它解决了从文本到视频和图像的统一生成问题,支持文本到视频、文★ 829
aphantasiaaphantasia 是一个基于 CLIP 模型的文本生成图像与视频的开源工具。它利用 CLIP 的语义理解能力,结合 FFT(快速傅里叶变换)、DWT(离散小★ 789
phenaki-pytorchPhenaki-PyTorch 是 Phenaki 视频生成模型的非官方 PyTorch 实现。Phenaki 由 Google 提出,核心创新在于利用 Mas★ 789
awesome-text-to-video这是一个关于文本生成视频(Text-to-Video)领域的精选资源列表,本质上是一份技术综述。项目系统梳理了该方向的研究论文、开源模型、数据集和工具,覆盖从早★ 746
PaddleMIXPaddleMIX是百度飞桨生态下的多模态大模型套件,旨在统一支持主流多模态任务,包括图文理解、视觉问答、图像生成等。它集成了端到端的大规模多模态预训练模型和扩★ 723
Text-To-Video-FinetuningText-To-Video-Finetuning 是一个基于 Python 的开源项目,旨在帮助开发者对 ModelScope 的文本生成视频模型进行微调。它利★ 704