Ask-Anything

上传视频,就能和 AI 对话提问,看懂视频内容

Ask-Anything 是一个基于大语言模型的多模态视频理解对话助手,核心解决“让 AI 看懂视频并自然对话”的问题。它支持多种主流语言模型(如 miniGPT4、StableLM、MOSS 等),并提供了视频描述、时序问答、事件定位等能力。项目包含简单易用的 Gradio 演示界面,用户可直接上传视频进行交互式问答;同时提供训练和评估代码,方便研究者复现和扩展。Ask-Anything 在 CVPR2024 上获得 Highlight,其 VideoChatGPT 方案在视频理解领域有一定影响力。项目代码结构清晰,支持自定义模型接入,适合学术研究和产品原型开发。

开源 unknown 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3354
维护状态 维护中
是否开源 是
定价模式 unknown

项目数据

分类对话助手
开发团队OpenGVLab
所属国家
定价模式unknown
价格说明官网为在线视频对话Demo,但未明确展示定价信息,需进一步确认。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型big-model,captioning-videos,chat,chatgpt,foundation-models,gradio,langchain,large-language-models,large-model,stablelm,video,video-question-answering,video-understanding
GitHub 星标★ 3354
30天Star增速
HF 下载量
上线时间2023-04-19 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:云服务 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 huggingface.co 的网络环境(用于在线 Demo)
  • Git,用于克隆 GitHub 仓库
  • Python 环境(项目开发语言为 Python,具体版本以仓库 README 为准)
  • 本地部署还需按仓库 README 的 Getting Started 章节自行准备依赖

安装与启动步骤

  1. 1在线体验 Demo

    README 提供 HuggingFace Spaces 在线入口:VideoChat-7B-8Bit 与 InternVideo2-Chat-8B-HD,浏览器打开即可对话。

  2. 2克隆项目仓库

    从 GitHub 拉取 Ask-Anything 源码到本地,便于查看官方安装说明与训练评估代码。

    git clone https://github.com/OpenGVLab/Ask-Anything.git
  3. 3进入项目目录

    切换到克隆下来的仓库根目录,后续命令都在此目录下执行。

    cd Ask-Anything
  4. 4查看安装说明

    仓库 README 的 “ Getting Started” 章节给出本地安装与运行方式,请以仓库内最新文档为准。

  5. 5参考中文文档

    README 提供中文 README_cn.md 与中文交流群,安装或使用遇到问题时可先查阅。

如何确认成功

HuggingFace Spaces 页面能正常打开、上传视频并完成问答,即视为可用。

常见问题

Q:需要自己下载模型权重吗?

A:README 节选中未给出本地权重下载与部署步骤,建议先用 HuggingFace Spaces 在线 Demo,再到仓库 README 的 Getting Started 章节确认。

Q:本地怎么安装依赖和启动?

A:本次 README 节选没有给出安装命令,无法照抄;请以仓库最新 README(含中文版 README_cn.md)中的 Getting Started 说明为准。

Q:遇到问题去哪里求助?

A:README 中提供了 Discord 交流链接,并注明有中文 README 及中文交流群,可加入其中提问。

注意事项

  • 本次 README 节选未包含具体安装命令,本地部署步骤请务必以仓库最新 README 为准,不要套用其他项目的命令。
  • 项目在 CVPR2024 获 Highlight,模型与代码更新较频繁,建议拉取最新代码后再操作。
  • 在线 Demo 运行在第三方平台上,上传视频前请注意隐私与数据合规。

核心亮点

  • 支持多种主流大语言模型(miniGPT4、StableLM、MOSS),灵活切换
  • 提供完整训练和评估代码,便于学术复现和二次开发
  • 内置 Gradio 交互界面,开箱即用,降低使用门槛

不足之处

  • 视频处理依赖较大计算资源,推理速度可能较慢
  • 文档/社区待观察

适用场景

  • 视频内容智能问答与检索
  • 视频摘要和描述生成
  • 多模态大模型教学与研究实验

替代项目

Video-ChatGPT、Video-LLaMA、LLaVA

项目介绍

Ask-Anything 是视频领域的开源项目,由 OpenGVLab 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,354)位列前 30%,在视频分类的 473 个项目里位列前 9%。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。官网为在线视频对话Demo,但未明确展示定价信息,需进一步确认。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:视频内容智能问答与检索。同类可对比的替代方案包括 Video-ChatGPT、Video-LLaMA、LLaVA。

上一篇:StoryToolkitAI

下一篇:MoneyPrinterTurboEasy

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09