Valley 是开源模型领域的开源项目,由 bytedance 开发,2024 年首次发布。
它收录于开源模型分类,该分类目前共有 432 个项目,GitHub 星标数为 297。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-14。免费使用。
它主要面向的使用场景是:多模态内容理解平台:自动分析视频画面、语音和字幕,生成结构化摘要。同类可对比的替代方案包括 LLaVA、Qwen-VL、Video-LLaVA。

一个模型同时看懂文字、图片、视频和音频
Valley 是一个多模态大模型开源项目,目标是让单一模型同时处理文本、图像、视频和音频四类数据,覆盖理解与生成类任务。它解决的是传统方案需要为每种模态单独部署模型、跨模态对齐困难的问题,通过统一架构降低多模态应用的集成成本。核心能力包括:跨模态语义理解,例如根据视频内容回答文本问题;图文混合推理,支持图像描述、视觉问答;音频与视频联合分析,可用于内容审核或摘要生成。项目以 Python 实现,定位研究型模型,适合作为多模态算法实验和二次开发的基础。当前星标约 297,属于早期项目,代码和权重开放,便于研究者在本地或云端复现与微调。整体上,Valley 试图用一套模型打通多模态输入输出,减少工程拼接,为多模态 Agent、智能客服、内容理解等方向提供底层能力。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
LLaVA、Qwen-VL、Video-LLaVA
Valley 是开源模型领域的开源项目,由 bytedance 开发,2024 年首次发布。
它收录于开源模型分类,该分类目前共有 432 个项目,GitHub 星标数为 297。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-14。免费使用。
它主要面向的使用场景是:多模态内容理解平台:自动分析视频画面、语音和字幕,生成结构化摘要。同类可对比的替代方案包括 LLaVA、Qwen-VL、Video-LLaVA。
上一篇:HongLabLLM
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···