Vision-Agents

用任意模型和视频源,低延迟构建语音视觉智能体。

Vision-Agents 是 Stream 推出的开源框架,用于快速构建语音与视觉智能体。它解决了开发者需要集成多种模型和视频提供商、并实现低延迟实时交互的痛点。核心能力包括:支持任意模型(如 GPT-4o、Claude)和视频服务(如 Twilio、Zoom)的即插即用,提供统一的 Agent 抽象和工具调用机制,并借助 Stream 的边缘网络将交互延迟降至极低。项目内置了语音识别(STT)、语音合成(TTS)和视觉理解模块,可轻松构建语音助手、视频分析机器人等。其 Python 接口简洁,文档示例丰富,适合从原型到生产的快速落地。

开源 unknown 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8139
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类智能体
开发团队GetStream
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic-ai,agents,ai,ai-agents,realtime,stt,tts,video-agents,video-ai,vision-ai,voice-ai
GitHub 星标★ 8139
30天Star增速
HF 下载量
上线时间2025-08-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 项目环境(README 以 uv 作为依赖管理工具)
  • 已安装 uv 包管理器(README 直接使用 uv add 命令)
  • Stream 账号及 API 凭据(官网可免费申请)
  • 可选:OpenAI、ElevenLabs、Deepgram 等集成所需的第三方密钥

安装与启动步骤

  1. 1安装核心包

    在已初始化的 Python/uv 项目中把 vision-agents 作为依赖加入,README 给出的第一步就是这条命令。

    uv add vision-agents
  2. 2按需装集成

    可选步骤。需要接入 Stream、OpenAI、ElevenLabs、Deepgram 时安装对应 extra,不需要的可以去掉。

    uv add "vision-agents[getstream, openai, elevenlabs, deepgram]"
  3. 3获取 Stream 凭据

    到 Stream 官网免费申请 API Key,开发者每月获 333,000 participant minutes,Maker Program 还可领额外额度。

  4. 4构建首个智能体

    按官方 quickstart 文档逐步创建并运行你的第一个语音/视觉智能体,README 未给出具体运行命令。

如何确认成功

依赖安装命令无报错,且已从 Stream 获取到可用 API 凭据,即视为环境准备完成(README 未提供启动命令)。

常见问题

Q:只安装 vision-agents 就能跑起来吗?

A:核心包只含基础能力,README 把带 extra 的安装标为可选步骤;要使用 Stream 视频网络或 OpenAI、ElevenLabs、Deepgram,需要按需安装对应集成。

Q:必须使用 uv 吗?

A:README 的 Getting Started 只给出了 uv add 的安装方式,未提供 pip 等其它安装命令,建议直接按 README 使用 uv。

Q:Stream 的 API Key 去哪里申请、有费用吗?

A:README 指向 Stream 官网的免费试用页面申请,开发者每月有 333,000 participant minutes,另有 Maker Program 额外额度。

Q:安装完下一步做什么?

A:按 README 指引阅读官方 quickstart 指南,用它来搭建你的第一个 Vision Agent。

注意事项

  • uv add 需要在该项目的 uv 虚拟环境/项目目录中执行。
  • 带方括号的 extras 命令包含空格,复制时务必保留双引号。
  • README 未给出运行、端口或环境变量名称,具体参数以官网 quickstart 文档为准。

核心亮点

  • 模型/视频提供商无关,可自由切换,避免厂商锁定
  • 基于 Stream 边缘网络,实测交互延迟极低,适合实时场景
  • 内置 STT/TTS/视觉模块,开箱即用,减少集成工作量

不足之处

  • 依赖 Stream 生态,自建或非 Stream 基础设施时可能受限
  • 文档/社区待观察

适用场景

  • 实时语音客服机器人,快速响应客户咨询
  • 视频会议内容分析,自动生成摘要或实时提醒
  • 智能家居语音助手,结合视觉识别控制设备

替代项目

LiveKit Agents、Pipecat、Vapi

项目介绍

Vision-Agents 是智能体领域的开源项目,由 GetStream 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(8,139)位列前 6%,在智能体分类的 2,499 个项目里位列前 7%。

近 44 天,它的 GitHub 星标从 8,008 增加到 8,139,净增 131。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:实时语音客服机器人,快速响应客户咨询。同类可对比的替代方案包括 LiveKit Agents、Pipecat、Vapi。

上一篇:rowboat

下一篇:cli

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 199 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12