AI-Media2Doc

上传音视频,一键生成小红书/公众号/笔记/思维导图

AI-Media2Doc 是一个开源工具,旨在将音视频内容一键转化为多种格式的文档,如小红书文案、公众号文章、知识笔记、思维导图和视频字幕。它解决了内容创作者在整理和再利用音视频素材时耗时费力的问题,通过自动化的转录和智能处理,将原始媒体快速转换为结构化的文本内容。项目基于 Vue 构建前端界面,后端使用 Python,集成了 OpenAI 等 AI 能力,支持从 Bilibili、YouTube 等平台直接导入视频,并生成适配不同平台风格的文档。核心能力包括自动语音识别、文本润色、格式转换和导出,适合自媒体运营、知识管理者和教育工作者使用。项目目前处于成长阶段,社区活跃,持续迭代中。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4030
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队hanshuaikang
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Vue
技术栈/模型ai,bilibili,chatgpt,openai,python,subtitles-generator,vue,xiaohongshu,youtube
GitHub 星标★ 4030
30天Star增速
HF 下载量
上线时间2025-04-12 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:Docker 4 步

环境要求

  • 已安装 Docker(Windows 用户建议使用 wsl 启动)
  • 下载项目首页提供的 docker-compose.yaml 文件
  • 参考 variables_template.env 生成 variables.env 并填写环境变量
  • variables.env 必须与 docker-compose.yaml 放在同一目录(建议新建文件夹单独存放)

安装与启动步骤

  1. 1安装 Docker

    先在机器上安装 Docker,README 未给出具体安装命令,请按官方或网上教程安装;Windows 玩家建议使用 wsl 启动本项目。

  2. 2下载编排文件

    从项目首页下载 docker-compose.yaml 文件,放到一个新建的独立文件夹中备用。

  3. 3生成环境变量文件

    参考项目中的 variables_template.env,在根目录生成 variables.env,并按后端部署指引完善其中的环境变量(该指引提到在火山引擎获取对应变量的值)。

  4. 4启动服务

    确认 variables.env 与 docker-compose.yaml 在同一目录后,在该目录下执行命令,以 -d 方式后台启动容器。

    docker-compose -f docker-compose.yaml up -d

关键配置

配置项必填说明示例
variables.env是后端环境变量配置文件,内容参考 variables_template.env,必须与 docker-compose.yaml 同目录./variables.env

如何确认成功

用 docker-compose ps 或 docker ps 查看容器状态为 Up 即启动成功;实际访问地址请查看 docker-compose.yaml 中的端口映射。

常见问题

Q:Windows 上怎么部署?

A:README 建议 Windows 玩家使用 wsl 启动该项目,先在 wsl 中装好 Docker,再按同样的 docker-compose 步骤执行。

Q:variables.env 应该放在哪里?

A:必须与 docker-compose.yaml 在同一目录下,建议新建一个文件夹单独存放这两个文件,否则可能读不到配置。

Q:需要本地安装 ffmpeg 吗?

A:不需要。项目前端采用 ffmpeg wasm 技术处理音视频,无需在本地安装 ffmpeg。

Q:环境变量的值从哪里获取?

A:README 指向后端 README 的配置项说明,其中提到在火山引擎获取对应环境变量的值,建议先阅读 backend/README.md 再填写。

Q:使用需要登录注册吗?

A:不需要登录注册,任务记录保存在本地;如果后端设置了访问密码,前端用户需要填写该密码才能正常使用。

注意事项

  • 该项目为 MIT 协议开源,支持本地部署,数据与任务记录保存在本地。
  • 下载 docker-compose.yaml 与生成 variables.env 的具体获取方式见项目首页和 backend/README.md,README 未给出对应命令。
  • 若部署遇到问题,可通过公众号或首页置顶 issue 的微信交流群联系作者。
  • 未来计划支持 fast-whisper 本地音频识别,当前版本以现有部署方式为准。

核心亮点

  • 支持 Bilibili/YouTube 链接直接导入,免去手动下载
  • 输出格式多样,覆盖小红书、公众号、思维导图等主流场景
  • 集成 AI 润色,自动调整文案风格,适配不同平台调性

不足之处

  • 依赖外部 AI API,需自行配置密钥,有使用成本
  • 文档/社区待观察

适用场景

  • 自媒体创作者将视频内容快速转为多平台文案
  • 学生或职场人士将课程/会议录音整理为知识笔记
  • 教育者将教学视频生成字幕或讲义

替代项目

Whisper、Buzz、SubtitleEdit

项目介绍

AI-Media2Doc 是写作内容领域的开源项目,由 hanshuaikang 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,030)位列前 30%,在写作内容分类的 183 个项目里位列前 8%。

近 42 天,它的 GitHub 星标从 3,968 增加到 4,030,净增 62。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,可自行部署使用,无付费版本。

它主要面向的使用场景是:自媒体创作者将视频内容快速转为多平台文案。同类可对比的替代方案包括 Whisper、Buzz、SubtitleEdit。

上一篇:The_Prompt_Report

下一篇:gpt_academic

同类项目推荐

easy-writing 开源

本地优先的 AI 网文写作助手,自带 Key 即可用

易创:纯本地、开源的 AI 网文写作桌面软件,支持小说创作、AI 辅助写作、BYOK 与自定义提···

★ 620 2026-09-03
higgsfield-ai-prompt-skill 开源

让 Claude 生成电影级 AI 视频提示词,一键搞定专业分镜

Claude AI skill for cinematic Higgsfield AI prompts — 32 sub-skills covering Seedan···

★ 626 2026-08-09
shanyin-screenwriting-master 开源

用Claude当编剧,从点子到成片剧本一条龙。

山音超级编剧大师——由 @山音 设计的全格式影视编剧技能。 覆盖从1-3分钟概念超短片到90分···

★ 1207 2026-08-09
PostBot 内容同步助手 开源

一键同步发布至主流媒体平台,支持微信/微博/头条/小红书/知乎/B站/抖音等

PostBot 内容同步助手 一款开源的多平台内容同步分发生产力工具。 支持将文章、笔记、动态···

★ 1458 2026-08-24