transcribe-anything

一条命令把本地或在线音视频转成文字和字幕

transcribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快又简单。它支持输入本地文件或在线 URL,自动完成下载、转码和识别,输出文字稿与字幕。项目对 Mac ARM 芯片做了专门优化,在 Apple Silicon 上速度表现突出,同时也能调用不同 Whisper 实现作为后端,兼顾速度与精度。它完全在本地运行,不上传音频,隐私性好且免费。除基础转写外,还支持说话人分离(diarization)和字幕生成,适合会议记录、播客整理、视频字幕等场景。安装和使用通过命令行完成,对熟悉终端的用户比较友好。整体定位是轻量、私密、跨平台的 Whisper 封装层,把复杂的模型部署和音频处理细节隐藏起来,让用户一条命令就能拿到转写结果。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1403
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队zackees
所属国家
官网地址
定价模式free
价格说明完全免费开源,需自行安装部署
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型cli,diarization,python,speech-to-text,subtitles,transcription,whisper
GitHub 星标★ 1403
30天Star增速
HF 下载量
上线时间2021-05-09 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-23
浏览次数0

使用教程

难度:入门 约 15 分钟 部署方式:命令行工具 7 步

环境要求

  • 已安装 Python 且 pip 可用
  • 联网(下载输入音视频与后端依赖,--device insane 约 10 GB)
  • macOS 建议 Apple Silicon 以使用 mlx 后端加速
  • 使用 Docker 需已安装 Docker(GPU 加速需支持 CUDA 的镜像环境)

安装与启动步骤

  1. 1安装主程序

    用 pip 把 transcribe-anything 装到当前 Python 环境,装完会自动获得 transcribe_anything 命令。

    pip install transcribe-anything
  2. 2转写在线视频

    最基础用法,直接传 YouTube 或任意 URL,工具会自动下载并转码后识别,CPU 模式到处都能跑但较慢。

    transcribe-anything "https://www.youtube.com/watch?v=dQw4w9WgXcQ"
  3. 3Mac 用 MLX 加速

    Apple Silicon 上指定 mlx 后端走 Metal GPU,速度更快;--device 省略时会自动检测后端。

    transcribe-anything video.mp4 --device mlx
  4. 4高速高精度组合

    insane-flash 后端配批量大小与词级时间戳,适合追求速度与精度;首次运行会构建独立环境并下载依赖。

    transcribe-anything video.mp4 --device insane-flash --batch-size 12 --timestamp word
  5. 5说话人分离

    whisperx 后端带 VAD 与 wav2vec2 对齐,可输出按说话人分区的 speaker.json,适合会议记录。

    transcribe-anything video.mp4 --device whisperx
  6. 6构建 Docker 镜像

    仓库自带 GPU 加速 Dockerfile,默认预构建 insane 与 insane-flash 共用的后端环境。

    docker build -t transcribe-anything .
  7. 7自托管带 TLS 服务

    用 examples 里的 compose 起守护进程,Caddy 反代自动申请 Let's Encrypt 证书,先设置令牌与公网域名。

    export TRANSCRIBE_ANYTHING_TOKEN=$(openssl rand -hex 32)
    export TRANSCRIBE_PUBLIC_HOST=transcribe.example.com
    docker compose -f examples/serve-compose.yml up -d

关键配置

配置项必填说明示例
--device选择后端:cpu/cuda/insane/insane-flash/xpu/whisperx/sensevoice/mlx,省略则自动检测mlx
--batch-size批量推理大小,配合 insane-flash 提升吞吐12
--timestamp时间戳粒度,如 word 生成词级时间戳word
TRANSCRIBE_ANYTHING_CACHE_DIR覆盖后端虚拟环境与 ffmpeg 的缓存目录,只读安装时指向可写路径/somewhere/writable
PREBUILD_BACKENDSDocker 构建时预构建的后端,设为 none 可得到最小镜像但首次运行才装依赖none
TRANSCRIBE_ANYTHING_TOKEN自托管守护进程的访问令牌,用随机值生成$(openssl rand -hex 32)

如何确认成功

命令正常结束并在输出目录生成文字稿/字幕文件;whisperx 后端还会生成 speaker.json。

常见问题

Q:首次运行为什么很慢、很占磁盘?

A:每个后端首次使用时会现场构建独立的 uv 虚拟环境并下载依赖,--device insane 约 10 GB,之后复用缓存不再重复下载。

Q:需要自己装 CUDA 或 torch 吗?

A:不需要。各后端运行在各自隔离的环境里,避免污染你的 Python,也不会有 CUDA/torch 依赖冲突。

Q:升级后为什么又要重新下载?

A:从 3.2 起缓存从包目录迁到用户缓存目录,旧路径的 venv 成为孤儿,每个后端首次运行会重新拉取一次依赖,没有数据丢失。

Q:怎么得到说话人分离结果?

A:使用 --device whisperx,它带 VAD 与 wav2vec2 对齐,并生成按说话人分区的 speaker.json。

Q:只读安装(如 Nix、--target 挂载)怎么用?

A:把缓存目录指到可写位置即可,例如设置环境变量 TRANSCRIBE_ANYTHING_CACHE_DIR=/somewhere/writable。

注意事项

  • 命令中的 video.mp4 需替换为你自己的本地音视频文件路径。
  • Docker 想最小化镜像可设 PREBUILD_BACKENDS=none,代价是首次运行才初始化后端。
  • 各后端互不影响,但逐个使用会分别占用一份缓存空间,注意磁盘余量。

核心亮点

  • 对 Mac ARM 做了专门优化,Apple Silicon 上转写速度快
  • 支持本地文件和 URL 直接输入,自动处理下载与转码
  • 完全本地运行,音频不外传,隐私性好且免费

不足之处

  • 命令行交互为主,普通用户上手有一定门槛
  • 依赖 Whisper 模型与后端环境,首次安装配置可能较繁琐

适用场景

  • 整理播客或访谈录音,自动生成文字稿
  • 为视频批量生成 SRT 字幕文件
  • 会议录音转写并按说话人区分内容

替代项目

whisper.cpp、faster-whisper、whisperX

项目介绍

transcribe-anything 是语音识别领域的开源项目,由 zackees 开发,2021 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(1,403)位列前 30%,在语音识别分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全免费开源,需自行安装部署。

它主要面向的使用场景是:整理播客或访谈录音,自动生成文字稿。同类可对比的替代方案包括 whisper.cpp、faster-whisper、whisperX。

上一篇:hyprwhspr

下一篇:whisper

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1614 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3733 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13