multimedia-gpt

给 ChatGPT 加上眼睛和耳朵,直接看图说话、听音作答。

multimedia-gpt 是一个为 ChatGPT 增加视觉和音频输入能力的开源扩展项目。它解决了 ChatGPT 官方接口仅支持文本交互的限制,允许用户通过图像和语音与 GPT 模型进行多模态对话。项目基于 Python 构建,封装了 OpenAI API,提供了一套简洁的接口来上传图片和音频文件,并获取模型的理解与回复。核心能力包括图像识别与描述、音频转写与语义理解,以及多轮对话中的上下文融合。它适合开发者快速集成多模态交互到自己的应用中,或作为学习 OpenAI API 多模态用法的参考实现。项目目前处于早期阶段,功能聚焦且代码结构清晰,但生态和文档尚不完善。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 179
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队fengyuli-dev
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可免费使用和部署。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型chatbot,chatgpt,gpt,openai-api
GitHub 星标★ 179
30天Star增速
HF 下载量
上线时间2023-03-15 00:00:00
最近更新2026-04-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

核心亮点

  • 直接复用 OpenAI 官方 API,无需额外训练模型,接入成本低。
  • 代码结构简洁,核心逻辑清晰,适合二次开发和定制。
  • 同时支持视觉和音频输入,覆盖多模态交互常见场景。

不足之处

  • 文档和示例较少,上手需要自行阅读源码。
  • 依赖 OpenAI 付费 API,且多模态输入可能增加调用成本。

适用场景

  • 为聊天机器人增加图片理解能力,如识别截图或照片内容。
  • 在语音助手场景中,让模型直接处理用户语音指令。
  • 作为教学示例,演示如何用 Python 调用 OpenAI 多模态接口。

替代项目

OpenAI Whisper + GPT-4V 组合方案、LangChain 多模态模块、LLaVA(视觉语言助手)

项目介绍

multimedia-gpt 是对话助手领域的开源项目,由 fengyuli-dev 开发,2023 年首次发布。

它收录于对话助手分类,该分类目前共有 907 个项目,GitHub 星标数为 179。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-23。MIT许可证,可免费使用和部署。

它主要面向的使用场景是:为聊天机器人增加图片理解能力,如识别截图或照片内容。同类可对比的替代方案包括 OpenAI Whisper + GPT-4V 组合方案、LangChain 多模态模块、LLaVA(视觉语言助手)。

上一篇:GO-Bot-DRL

下一篇:Coze-Discord-Bridge

同类项目推荐

open-webui 开源

给本地模型配个漂亮聊天室,全家都能用

User-friendly AI Interface (Supports Ollama, OpenAI API, ...)

★ 152821 2026-08-09
prompts.chat 开源

海量好提示词,抄了就能让 AI 更听话

f.k.a. Awesome ChatGPT Prompts. Share, discover, and collect prompts from the commun···

★ 170999 2026-08-09
elia 开源

终端里用键盘快速聊 AI,多模型切换不打断思路

A snappy, keyboard-centric terminal user interface for interacting with large langua···

★ 2479 2026-08-09
NextChat 开源

一个界面聊遍所有主流AI模型,支持全平台部署,轻快又私密。

✨ Zero-config AI chat assistant. No API key needed — sign up and instantly chat wi···

★ 88802 2026-08-09