text2video

输入文本,一键生成带语音和画面的视频

text2video 是一个基于 Python 的文本转视频工具,旨在通过简单的文本输入快速生成包含语音和画面的视频。它利用 edge-tts 将文本转换为自然语音,并结合 stable-diffusion 生成与文本内容相关的图像,最终将这些元素组合成视频。该项目解决了非专业用户制作视频的门槛问题,无需复杂的视频编辑技能,只需输入文本即可获得一个基础视频。核心能力包括文本转语音、文本生成图像、以及音视频合成,支持自定义语音和图像风格。适合快速生成短视频、演示文稿或社交媒体内容,是一个轻量级、易于上手的自动化视频生成方案。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1050
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队bravekingzhang
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,本地部署,完全免费。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型edge-tts,stable-diffusion,text2video
GitHub 星标★ 1050
30天Star增速
HF 下载量
上线时间2023-06-09 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:Docker 6 步

环境要求

  • 开发环境推荐 macOS(其他环境可能存在兼容性问题)
  • Python 3.10.12
  • 必须安装 ffmpeg(用于音视频合成)
  • 使用 Docker 方式需安装 Docker 与 docker-compose
  • OpenAI API Key 与 Hugging Face Token 为可选,用于提升绘图质量

安装与启动步骤

  1. 1获取项目代码

    从 GitHub 克隆仓库到本地并进入项目目录,后续所有命令都在该目录下执行。

    git clone https://github.com/bravekingzhang/text2video.git
    cd text2video
  2. 2检查 ffmpeg

    视频合成声音依赖 ffmpeg,未安装需先自行安装,再执行命令确认已可用。

    ffmpeg -version
  3. 3配置密钥文件

    在项目根目录新建 .env 文件,写入 OpenAI 与 Hugging Face 相关配置;仅用 pollinations-ai 时可不填 Token。

  4. 4Docker 一键启动

    在项目根目录执行该命令构建并启动容器,适合不想配置本地 Python 环境的用户。

    docker-compose up --build
  5. 5本地安装依赖

    采用本地开发方式时,使用 Python 3.10.12 安装 requirements.txt 中的依赖。

    pip install -r requirements.txt
  6. 6启动本地服务

    在项目目录执行该命令启动应用,启动后在浏览器访问本地 5001 端口页面。

    python3.10 app.py

关键配置

配置项必填说明示例
OPEN_AI_API_KEY调用大模型生成 midjourney 类绘图提示词,提升出图质量sk-xxxxxxxx
OPEN_AI_BASE_URLOpenAI 接口地址,支持代理或第三方兼容服务https://api.moonshot.cn/v1
API_TOKENHugging Face 访问令牌,用于调用文生图模型;使用 pollinations-ai 时可留空hf_xxxxxxxxxxxxxxxx

如何确认成功

浏览器打开 http://127.0.0.1:5001/ 能看到页面,输入文本后能生成带画面、字幕和声音的 mp4 视频。

常见问题

Q:必须购买付费 API Key 吗?

A:不必须。README 说明若使用 pollinations-ai 模型,不填写 Hugging Face token 也可以,该模型走 ChatGPT 的 Dalle-2。

Q:Windows 或 Linux 能直接跑吗?

A:README 给出的开发环境为 macOS,并提示其他环境可能存在兼容性问题;建议优先使用 Docker 方式启动。

Q:生成的中文图片效果差怎么办?

A:项目会先用有道翻译把中文转为英文再生成图片;另外配置 OpenAI API Key 生成绘图提示词,可进一步提升出图质量。

Q:生成的视频没有声音?

A:音频合并依赖 ffmpeg,请先执行 ffmpeg -version 确认安装成功,再重新生成视频。

注意事项

  • 本地开发尽量使用 README 指定的 Python 3.10.12 与 macOS 环境
  • .env 内含密钥,不要提交到公开仓库
  • 服务默认监听 127.0.0.1:5001,被占用时需自行调整
  • 输出视频为 mp4 格式,保存在你指定的本地目录

核心亮点

  • 集成 edge-tts 和 stable-diffusion,实现从文本到语音、图像、视频的全自动流程
  • 代码简洁,依赖少,易于二次开发和集成到其他项目
  • 支持自定义语音和图像参数,可生成个性化视频内容

不足之处

  • 生成视频的分辨率和时长可能受限,不适合专业级制作
  • 文档和社区支持相对薄弱,高级功能需自行探索

适用场景

  • 快速制作短视频用于社交媒体或营销
  • 生成教学演示或产品介绍视频
  • 自动化生成视频内容用于内容农场或批量生产

替代项目

ffmpeg、moviepy、PaddleGAN

项目介绍

text2video 是视频领域的开源项目,由 bravekingzhang 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,050)位列前 30%,在视频分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。MIT许可证,本地部署,完全免费。

它主要面向的使用场景是:快速制作短视频用于社交媒体或营销。同类可对比的替代方案包括 ffmpeg、moviepy、PaddleGAN。

上一篇:FateZero

下一篇:PIA

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 334 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10