Lance

3B参数搞定图像视频理解、生成与编辑,轻量部署

Lance 是一个仅 3B 激活参数的原生统一多模态模型,专攻图像与视频的理解、生成和编辑。它解决了传统多模态模型需要庞大参数、且各任务分离的问题,通过单一模型统一处理视觉理解和生成任务,降低部署门槛。核心能力包括:图像/视频理解(如描述、问答)、生成(文生图/视频)以及编辑(指令式修改)。基于稀疏激活架构,在保持高性能的同时大幅减少计算资源消耗,适合在消费级 GPU 上运行。项目提供开源权重和推理代码,支持灵活扩展,为多模态 AI 研究和应用提供了一个轻量级、高效的基线方案。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1348
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队bytedance
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可,可免费本地部署使用,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型image-editing,image-generation,image-understanding,unified-multimodal-models,video-generation,video-understanding
GitHub 星标★ 1348
30天Star增速
HF 下载量
上线时间2026-05-15 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.11(README 用 conda 创建 Lance 环境)
  • 支持 CUDA 12.6 的 NVIDIA GPU 与驱动(torch 使用 cu126 轮子)
  • 已安装 conda 与 git
  • 磁盘空间需容纳 Lance-3B 权重(含 safetensors/bin/pth 等文件)
  • 能访问 Hugging Face 下载模型权重

安装与启动步骤

  1. 1克隆仓库

    把 Lance 官方仓库拉到本地,并进入项目根目录,后续命令都在该目录执行。

    git clone https://github.com/bytedance/Lance.git
    cd Lance
  2. 2创建 conda 环境

    按 README 用 Python 3.11 新建名为 Lance 的虚拟环境并激活,避免污染系统环境。

    conda create -n Lance python=3.11 -y
    conda activate Lance
  3. 3安装 PyTorch

    从 PyTorch 官方 cu126 源安装 torch 2.8.0、torchvision 0.23.0、torchaudio 2.8.0,版本必须对齐。

    pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 --index-url https://download.pytorch.org/whl/cu126
  4. 4安装项目依赖

    在已激活的 Lance 环境中安装 requirements.txt 里的全部 Python 依赖。

    pip install -r requirements.txt
  5. 5安装 flash-attn

    安装 flash-attn 2.8.3;源码编译失败时可改用 README 给的预编译 wheel,需自行核对 Python/PyTorch/CUDA 版本。

    pip install flash-attn==2.8.3 --no-build-isolation
  6. 6下载模型权重

    用 huggingface_hub 的 snapshot_download 拉取 bytedance-research/Lance 权重到 downloads/ 目录,按 allow_patterns 只取必要文件。

    from huggingface_hub import snapshot_download
    
    save_dir = "./downloads/"
    repo_id = "bytedance-research/Lance"
    cache_dir = save_dir + "/cache"
    
    snapshot_download(cache_dir=cache_dir,
      local_dir=save_dir,
      repo_id=repo_id,
      local_dir_use_symlinks=False,
      resume_download=True,
      allow_patterns=["*.json", "*.safetensors", "*.bin", "*.py", "*.md", "*.txt","*.pth",],
    )
  7. 7运行推理

    先修改 inference_lance.sh 顶部的推理参数,再执行脚本;任务可用 t2i、t2v、i2v、image_edit、video_edit、x2t_image、x2t_video。

    bash inference_lance.sh

关键配置

配置项必填说明示例
repo_id是权重下载用的 Hugging Face 仓库 IDbytedance-research/Lance
save_dir是权重保存目录,需为 downloads/ 供推理脚本加载./downloads/
cache_dir否Hugging Face 下载缓存目录./downloads/cache
TASK_DEFAULT_CONFIGS否在 inference_lance.py 中自定义各任务的默认数据样本t2i
inference_lance.sh 顶部参数是脚本开头的推理参数区,运行前需按需修改bash inference_lance.sh

如何确认成功

执行 bash inference_lance.sh 能跑完且不报错,即说明环境、flash-attn 与权重均已正确加载。

常见问题

Q:flash-attn 源码安装失败怎么办?

A:改用 README 提供的预编译 wheel 安装(带 --no-cache-dir --no-deps --force-reinstall)。该 wheel 来自第三方仓库仅供参考,务必核对 Python、PyTorch、CUDA 与 ABI 版本是否匹配。

Q:Lance 支持哪些推理任务?

A:支持 t2i、t2v、i2v、image_edit、video_edit、x2t_image、x2t_video 共七类任务,可在 inference_lance.sh 顶部切换。

Q:推理参数在哪里配置?

A:运行前修改 inference_lance.sh 顶部的推理参数;若要替换每个任务的默认数据样本,可改 inference_lance.py 中的 TASK_DEFAULT_CONFIGS。

Q:怎么跑官方基准测试?

A:benchmarks/ 下已提供可直接运行的脚本:图像生成 GenEVAL 与 DPG、图像编辑 GEdit、视频生成 VBench,直接 bash 对应 .sh 即可。

Q:为什么生成质量不理想?

A:README 提示所有任务都建议按仓库示例中的 prompt 格式书写输入提示词,遵循示例格式通常能获得更好的生成效果。

注意事项

  • weight 下载脚本的 allow_patterns 只拉取 json、safetensors、bin、py、md、txt、pth 等文件,勿随意删减。
  • 预编译 flash-attn wheel 来自第三方仓库,README 明确说明仅供参考,安装前请校验版本匹配。
  • 输入提示词建议参照仓库示例格式,否则生成质量会下降。
  • benchmarks/ 下的 GenEVAL、DPG、GEdit、VBench 脚本可直接运行,便于对比效果。

核心亮点

  • 原生统一多模态架构,单一模型覆盖理解、生成、编辑三大任务,无需拼接多个模型
  • 仅3B激活参数,显存占用低,可在消费级GPU上运行,大幅降低部署成本
  • 支持图像与视频的跨模态联合建模,能处理视频编辑等复杂时序任务

不足之处

  • 项目较新,文档和社区生态尚待完善
  • 3B参数规模在复杂生成任务上可能受限于细节质量,与更大模型有差距

适用场景

  • 边缘设备或中小型团队快速部署多模态AI助手
  • 视频内容创作中的自动剪辑、风格化编辑
  • 多模态研究中的轻量基线模型,用于对比实验

替代项目

LLaVA、MiniGPT-4、Emu2

项目介绍

Lance 是开源模型领域的开源项目,由 bytedance 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,348)位列前 30%,在开源模型分类中处于中上游。

近 45 天,它的 GitHub 星标从 1,311 增加到 1,348,净增 37。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。Apache-2.0许可,可免费本地部署使用,无在线服务。

它主要面向的使用场景是:边缘设备或中小型团队快速部署多模态AI助手。同类可对比的替代方案包括 LLaVA、MiniGPT-4、Emu2。

上一篇:ChatRWKV

下一篇:Stable-Diffusion

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10