video
本站收录 101 个带「video」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
hypithypit 是一个用 TypeScript 编写的开源视频生成工具,目标是把爆款视频的完整制作流程交给 AI 代理自动完成。它不只是生成脚本,而是覆盖换脸、改写★ 17,185
agentsagents 是 OpenAI 推出的开源 Python 框架,用于构建实时语音 AI 智能体。它解决的核心问题是:开发者通常需要自己拼接语音识别、大模型推理、★ 14,422
ten-frameworkTEN Framework 是一个面向对话式语音 AI 智能体的开源开发框架,用 Python 编写,主打实时、多模态交互。它要解决的核心问题是:开发者想搭建能★ 11,143
autoclipAutoClip 是一款基于 AI 的视频高光提取与自动剪辑工具,主要面向视频二创和内容分发场景。它利用大语言模型和视频处理技术,自动分析视频内容,识别并提取精★ 9,044
ShortGPTShortGPT 是一个实验性的 AI 框架,专注于 YouTube Shorts 和 TikTok 频道的自动化内容生成。它解决了短视频创作者在选题、脚本、配★ 7,996
html-video面向编程智能体的程序化视频生成工具,可在本地将 HTML、CSS 与数据直接渲染为 MP4 视频,内置 21 套模板与可插拔渲染引擎,支持 AI 配乐,Apac★ 4,625
LLPlayerLLPlayer 是一款专为语言学习设计的开源媒体播放器,基于 C# 开发。它解决了语言学习者在使用普通播放器时无法高效对照原文和译文、难以获取生词释义、以及缺★ 4,315
SimpleMemSimpleMem 是一个为大型语言模型(LLM)智能体设计的终身记忆模块,旨在解决智能体在长期交互中遗忘历史信息、缺乏持续学习能力的问题。它通过高效的记忆存储★ 3,819
FireRed-OpenStorylineFireRed-OpenStoryline 是一个基于大语言模型的 AI 视频剪辑智能体,旨在将传统的手工剪辑流程转变为意图驱动的导演式创作。它通过自然语言交互★ 3,455
Ask-AnythingAsk-Anything 是一个基于大语言模型的多模态视频理解对话助手,核心解决“让 AI 看懂视频并自然对话”的问题。它支持多种主流语言模型(如 miniGP★ 3,354
awesome-virtual-try-on这是一个围绕虚拟试穿(Virtual Try-On)方向的精选资源合集,系统整理了相关的研究论文、开源项目、代码实现、数据集与学术工作坊。虚拟试穿要解决的是电商★ 3,189
SnapOtterSnapOtter 是一个开源、可自托管的文件处理工具,旨在解决个人和企业处理图片、视频、音频、PDF 及文档时依赖云端服务导致的数据隐私和合规问题。它集成了格★ 2,755
awesome-seedanceawesome-seedance 是一个围绕 Seedance 2.0 视频生成模型的提示词与资源合集,主要解决用户拿到模型却不知道怎么写提示词、怎么调 API★ 2,569
mPLUG-OwlmPLUG-Owl是阿里巴巴达摩院开发的多模态大语言模型家族,旨在让AI同时理解文本和图像,并基于指令进行对话。它解决了传统语言模型只能处理文本、无法理解视觉信★ 2,539
Awesome-Video-Diffusion-Models这是一个关于视频扩散模型的精选资源列表,源自一篇发表在《计算机科学与技术评论》(CSUR)上的综述论文。项目系统梳理了视频扩散模型领域的核心研究,包括模型架构、★ 2,318
vox-directorvox-director 是一个自动化生成 Vox 风格纸板拼贴解说视频的开源项目。它接受一个主题,通过 Atlas Cloud 和 ffmpeg 完成从脚本撰★ 2,096
ai-moive-studioai-moive-studio(AICON)是一个自然语言驱动的无限画布工作流 Agent,面向 AI 视频创作者。它解决的核心问题是:现有 AI 视频工具大多★ 1,600
SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538
PostBot 内容同步助手PostBot 内容同步助手是一款开源的多平台内容同步分发生产力工具。支持将文章、笔记、动态、图片、视频、音频等内容一键同步发布至主流媒体平台,覆盖微信/微博/★ 1,470
spotlightSpotlight 是一个基于 TypeScript 的开源交互式数据探索工具,专为处理非结构化数据集而设计。在机器学习和数据科学工作中,图像、音频、视频等非结★ 1,276
jonexjonex 是一个面向 AI 应用的全栈知识引擎,核心定位是“多模态解析 + 本体驱动的知识组织”。它能把视频、音频、图片、文档等非结构化数据,通过内置的 AS★ 1,228
ChattyPlay-AgentChattyPlay-Agent 是一个基于 Python、React、TypeScript、Hono、SQLite3 和 Redis 构建的“All in O★ 943
generative-manimgenerative-manim 是一个把自然语言变成数学动画视频的开源工具。它把 OpenAI 的 GPT 模型与 Manim(3Blue1Brown 使用的★ 922
SavantSavant 是一个基于 Python 的计算机视觉与视频分析框架,构建在 NVIDIA DeepStream 和 CUDA 之上,目标是让开发者用声明式 YA★ 858
open-editopen-edit 是一个面向开发者的本地视频编辑工具,核心理念是“拥有而非租用”视频编辑器。它允许用户通过编码智能体(如 Claude Code、Codex、★ 851
kandinsky-5Kandinsky 5.0 是一个基于扩散模型的视频与图像生成项目,旨在提供高质量的多模态生成能力。它解决了从文本到视频和图像的统一生成问题,支持文本到视频、文★ 829
Video-MMEVideo-MME 是首个专门用于评估多模态大语言模型(LLMs)在视频分析任务中表现的综合基准测试集,发表于 CVPR 2025。它旨在解决现有视频理解基准在★ 798
WhisperSubTranslateWhisperSubTranslate 是一款免费、本地优先的桌面应用,基于 Electron 构建,利用 OpenAI Whisper 模型从视频中提取字幕(★ 759
SparkVSRSparkVSR 是一个基于稀疏关键帧传播的交互式视频超分辨率工具,由 ECCV 2026 论文提出。它解决传统视频超分方法计算量大、无法实时交互的问题,通过智★ 741
yutuyutu 是一个基于 Go 语言开发的 AI 驱动的 YouTube 频道自动化增长工具,旨在通过自动化流程帮助内容创作者高效运营频道。它集成了多种 AI 模型★ 696
AnimateLCMAnimateLCM 是一个面向个性化风格视频生成的计算高效方法,发表于 SIGGRAPH ASIA 2024。它解决了现有视频生成模型在个性化定制时需要大量视★ 657
wav2lip_288x288Wav2Lip 288x288 是一个基于 Wav2Lip 的改进版本,专注于高分辨率(288x288)的唇形同步视频生成。它解决了原始 Wav2Lip 在低分★ 651
Ego4dEgo4d 是一个大规模第一人称视角视频数据集及其配套工具仓库,由 Meta AI 联合多所高校发布。它解决了 AI 模型在理解日常活动、社交交互和手物交互时缺★ 651
openstoryopenstory 是一个基于 TanStack Start 构建的开源 AI 视频序列生成平台。它主要解决视频创作中脚本到成片流程割裂的问题,通过 AI 能力★ 650
QmediaQmedia 是一款专为内容创作者设计的开源 AI 内容搜索引擎。它解决了创作者在海量素材中查找、整理和问答的痛点,支持从文本、图片和短视频中提取信息,并构建多★ 635
ComeCutComeCut(来剪)是一个轻量级视频编辑器,提供网页版和桌面版,完全免费使用。它的功能设计借鉴了 CapCut 等主流编辑器,旨在为用户提供一个无需复杂安装、★ 598
awesome-ltx2awesome-ltx2 是一个围绕 LTX-2 视频生成模型的资源聚合仓库,由 Lightricks 官方维护。它集中收录了 LTX-2 相关的所有可用模型权★ 597
common_metrics_on_video_quality这是一个用于评估视频生成或预测质量的Python工具库,专注于计算FVD、PSNR、SSIM、LPIPS等核心指标。它解决了视频生成领域缺乏统一、易用的评估工具★ 587
vmodal_sdk_androidvmodal_sdk_android 是一个面向 Android 平台的视频搜索 SDK,使用 Kotlin 编写,旨在帮助开发者快速将视频搜索能力集成到任意视★ 582
LLaVA-MiniLLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计★ 576
FabricFabric 是一个受 Quartz Composer 启发的节点式创意编程工具,使用 Swift 编写,面向 macOS 平台。它把 3D 渲染、图像处理、计★ 570
openclipOpenClip 是一个用 Python 编写的开源工具,专门解决长视频中精彩片段难以快速定位的问题。它借助大语言模型和 AI 分析能力,自动从数小时的长视频里★ 566
StreamRAGStreamRAG 是一个基于 Python 的视频搜索与流式处理代理,旨在解决视频内容检索和实时流式处理中的效率问题。它利用检索增强生成(RAG)技术,将视频★ 503
skillsHeyGen 官方推出的 AI 智能体技能包,通过 v3 Video Agent 流水线,让 Claude Code 等智能体直接调用 HeyGen 的数字人创★ 459
Video-As-PromptVideo-As-Prompt 是一个面向视频生成的可控性研究项目,源自 ICLR 2026 论文。它提出将视频本身作为提示(Prompt),实现统一的语义控制★ 454
Text2VideoText2Video 是一个基于 ICASSP 2022 论文的开源项目,实现文本驱动的说话人视频合成。它通过音素字典将输入文本转换为语音,并驱动人物头像生成与★ 438
sd-parseqsd-parseq 是一个用于 Stable Diffusion 的参数序列器,旨在解决 AI 视频生成和动画制作中参数难以精确控制的问题。它允许用户为视频帧序★ 388
supermosh.github.iosupermosh.github.io 是一个基于浏览器的数据破坏(Datamosh)工具,由 TypeScript 编写。它让用户无需安装任何软件,直接在网页★ 370
Video-MME-v2Video-MME-v2 是一个面向全面视频理解的新一代评测基准项目。它旨在解决现有视频理解基准在任务多样性、视频长度覆盖和评估维度上的不足,推动视频大模型从简★ 370
large-performance-model.github.ioLPM 1.0 是一个基于视频的角色表演模型,旨在从视频中提取并生成角色的动态表演。它解决的是传统角色动画制作中流程复杂、成本高的问题,核心能力包括实时视频驱动★ 366