InternLM-XComposer

让AI边看视频边聊天,长时音视频实时理解不丢上下文

InternLM-XComposer 是上海人工智能实验室推出的多模态大模型系统,最新版本 2.5-OmniLive 专注于长时流式视频与音频的实时交互。它解决了传统多模态模型难以处理长时间连续音视频流、响应延迟高、上下文记忆有限的问题。核心能力包括:支持长达数小时的视频/音频流式输入,实现边看边聊的实时对话;融合视觉、听觉与文本的多模态理解,能同时解析画面内容、语音语义和环境声音;具备长期记忆机制,可跨片段关联信息,回答涉及前文的问题。系统采用模块化设计,将感知、推理和记忆解耦,支持在本地或云端部署,为智能助手、视频分析、实时监控等场景提供端到端解决方案。项目基于 Python 和深度学习框架,提供预训练模型与推理代码,开发者可快速集成。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2928
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队InternLM
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型chatgpt,foundation,gpt,gpt-4,instruction-tuning,language-model,large-language-model,large-vision-language-model,llm,mllm,multi-modality,multimodal,supervised-finetuning,vision-language-model,vision-transformer,visual-language-learning
GitHub 星标★ 2928
30天Star增速
HF 下载量
上线时间2023-09-26 00:00:00
最近更新2026-09-15 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 5 步

环境要求

  • Python 环境(项目基于 Python 与深度学习框架)
  • NVIDIA GPU 及 CUDA 环境(LMDeploy 默认依赖 CUDA 12.x,CUDA 11.x 需另按安装指南配置)
  • 已安装 PyTorch 与 transformers 等依赖库
  • 可访问 HuggingFace 或 ModelScope 下载 internlm/internlm-xcomposer2d5-7b 权重

安装与启动步骤

  1. 1获取项目代码

    把仓库克隆到本地,后续安装与示例代码都基于该目录运行。

    git clone https://github.com/InternLM/InternLM-XComposer.git
    cd InternLM-XComposer
  2. 2安装环境依赖

    README 要求先配置好环境并安装依赖库,具体命令需查看仓库内 docs/install.md,本页未给出完整命令。

  3. 3安装 LMDeploy(可选)

    若需要做推理加速,README 推荐使用 LMDeploy,直接安装其 pypi 包即可。

    pip install lmdeploy
  4. 4Transformers 快速上手

    README 的 Quickstart 只给出了示例开头(导入与关闭梯度),完整模型加载与推理代码在仓库示例中。

    import torch
    from transformers import AutoModel, AutoTokenizer
    
    torch.set_grad_enabled(False)
  5. 5准备 Gradio 演示

    README 说明构建 Web UI Demo 需使用 gradio==4.13.0,启动 Chat/Composition 的具体命令在本页节选中被截断。

    pip install gradio==4.13.0

关键配置

配置项必填说明示例
模型 ID是HuggingFace 上的官方权重,也可在 ModelScope 获取同名模型internlm/internlm-xcomposer2d5-7b
gradio 版本是构建 Web UI Demo 时必须使用的 Gradio 版本4.13.0

如何确认成功

模型与 tokenizer 能正常加载且推理无报错;Gradio 启动后终端会输出本地访问地址,浏览器打开该地址即可看到界面。

常见问题

Q:CUDA 11.x 环境怎么安装 LMDeploy?

A:README 说明 pip install lmdeploy 默认依赖 CUDA 12.x;CUDA 11.x 需参考 LMDeploy 官方安装指南选择合适的安装方式。

Q:完整的安装步骤在哪里?

A:README 未列出具体安装命令,而是指向仓库内的 docs/install.md,按该文档配置环境后再运行示例。

Q:Gradio 启动命令是什么?

A:README 仅说明需使用 gradio==4.13.0 并提示运行下方命令,但本页节选中命令内容缺失,请查看仓库 README 原文的 Gradio Deploy 段落。

Q:模型权重从哪里下载?

A:可从 HuggingFace 的 internlm/internlm-xcomposer2d5-7b 或 ModelScope 的 Shanghai_AI_Laboratory/internlm-xcomposer2d5-7b 获取。

注意事项

  • README 的安装说明指向 docs/install.md,本页未包含该文件内容,安装前请先阅读它。
  • LMDeploy 安装默认面向 CUDA 12.x,CUDA 11.x 环境需单独处理。
  • Gradio 启动命令在节选中被截断,请以仓库最新 README 为准。
  • 模型为 7B 规模,本地运行需准备足够的显存与磁盘空间。

核心亮点

  • 支持数小时连续视频/音频流式输入,实时交互延迟低
  • 多模态融合能力强,同时理解视觉、语音和文本
  • 模块化架构,感知/推理/记忆解耦,便于定制和扩展

不足之处

  • 模型体积大,推理资源需求高,轻量部署困难
  • 文档/社区待观察

适用场景

  • 长视频内容审核与摘要生成
  • 实时音视频会议助手,边听边总结
  • 智能监控系统,持续分析流媒体并响应异常

替代项目

Video-LLaVA、Qwen-VL、LLaMA-VID

项目介绍

InternLM-XComposer 是开源模型领域的开源项目,由 InternLM 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,928)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:长视频内容审核与摘要生成。同类可对比的替代方案包括 Video-LLaVA、Qwen-VL、LLaMA-VID。

上一篇:matmulfreellm

下一篇:solon

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10