transcribe-anything 是语音识别领域的开源项目,由 zackees 开发,2021 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(1,403)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全免费开源,需自行安装部署。
它主要面向的使用场景是:整理播客或访谈录音,自动生成文字稿。同类可对比的替代方案包括 whisper.cpp、faster-whisper、whisperX。

一条命令把本地或在线音视频转成文字和字幕
transcribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快又简单。它支持输入本地文件或在线 URL,自动完成下载、转码和识别,输出文字稿与字幕。项目对 Mac ARM 芯片做了专门优化,在 Apple Silicon 上速度表现突出,同时也能调用不同 Whisper 实现作为后端,兼顾速度与精度。它完全在本地运行,不上传音频,隐私性好且免费。除基础转写外,还支持说话人分离(diarization)和字幕生成,适合会议记录、播客整理、视频字幕等场景。安装和使用通过命令行完成,对熟悉终端的用户比较友好。整体定位是轻量、私密、跨平台的 Whisper 封装层,把复杂的模型部署和音频处理细节隐藏起来,让用户一条命令就能拿到转写结果。
1安装主程序
用 pip 把 transcribe-anything 装到当前 Python 环境,装完会自动获得 transcribe_anything 命令。
pip install transcribe-anything2转写在线视频
最基础用法,直接传 YouTube 或任意 URL,工具会自动下载并转码后识别,CPU 模式到处都能跑但较慢。
transcribe-anything "https://www.youtube.com/watch?v=dQw4w9WgXcQ"3Mac 用 MLX 加速
Apple Silicon 上指定 mlx 后端走 Metal GPU,速度更快;--device 省略时会自动检测后端。
transcribe-anything video.mp4 --device mlx4高速高精度组合
insane-flash 后端配批量大小与词级时间戳,适合追求速度与精度;首次运行会构建独立环境并下载依赖。
transcribe-anything video.mp4 --device insane-flash --batch-size 12 --timestamp word5说话人分离
whisperx 后端带 VAD 与 wav2vec2 对齐,可输出按说话人分区的 speaker.json,适合会议记录。
transcribe-anything video.mp4 --device whisperx6构建 Docker 镜像
仓库自带 GPU 加速 Dockerfile,默认预构建 insane 与 insane-flash 共用的后端环境。
docker build -t transcribe-anything .7自托管带 TLS 服务
用 examples 里的 compose 起守护进程,Caddy 反代自动申请 Let's Encrypt 证书,先设置令牌与公网域名。
export TRANSCRIBE_ANYTHING_TOKEN=$(openssl rand -hex 32)
export TRANSCRIBE_PUBLIC_HOST=transcribe.example.com
docker compose -f examples/serve-compose.yml up -d| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--device | 否 | 选择后端:cpu/cuda/insane/insane-flash/xpu/whisperx/sensevoice/mlx,省略则自动检测 | mlx |
--batch-size | 否 | 批量推理大小,配合 insane-flash 提升吞吐 | 12 |
--timestamp | 否 | 时间戳粒度,如 word 生成词级时间戳 | word |
TRANSCRIBE_ANYTHING_CACHE_DIR | 否 | 覆盖后端虚拟环境与 ffmpeg 的缓存目录,只读安装时指向可写路径 | /somewhere/writable |
PREBUILD_BACKENDS | 否 | Docker 构建时预构建的后端,设为 none 可得到最小镜像但首次运行才装依赖 | none |
TRANSCRIBE_ANYTHING_TOKEN | 否 | 自托管守护进程的访问令牌,用随机值生成 | $(openssl rand -hex 32) |
命令正常结束并在输出目录生成文字稿/字幕文件;whisperx 后端还会生成 speaker.json。
Q:首次运行为什么很慢、很占磁盘?
A:每个后端首次使用时会现场构建独立的 uv 虚拟环境并下载依赖,--device insane 约 10 GB,之后复用缓存不再重复下载。
Q:需要自己装 CUDA 或 torch 吗?
A:不需要。各后端运行在各自隔离的环境里,避免污染你的 Python,也不会有 CUDA/torch 依赖冲突。
Q:升级后为什么又要重新下载?
A:从 3.2 起缓存从包目录迁到用户缓存目录,旧路径的 venv 成为孤儿,每个后端首次运行会重新拉取一次依赖,没有数据丢失。
Q:怎么得到说话人分离结果?
A:使用 --device whisperx,它带 VAD 与 wav2vec2 对齐,并生成按说话人分区的 speaker.json。
Q:只读安装(如 Nix、--target 挂载)怎么用?
A:把缓存目录指到可写位置即可,例如设置环境变量 TRANSCRIBE_ANYTHING_CACHE_DIR=/somewhere/writable。
whisper.cpp、faster-whisper、whisperX
transcribe-anything 是语音识别领域的开源项目,由 zackees 开发,2021 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(1,403)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全免费开源,需自行安装部署。
它主要面向的使用场景是:整理播客或访谈录音,自动生成文字稿。同类可对比的替代方案包括 whisper.cpp、faster-whisper、whisperX。
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper