transcription

本站收录 71 个带「transcription」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464meetilyMeetily 是一款基于 Rust 构建的隐私优先 AI 会议助手,专为 macOS 和 Windows 设计。它解决的核心问题是会议记录的低效与隐私泄露风险★ 31,241FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962SenseVoiceSenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音★ 9,408FunClipFunClip 是一个基于阿里达摩院 FunASR 语音识别模型的开源视频剪辑工具,主要解决视频中语音内容的快速定位与剪辑问题。它提供本地 Gradio 网页界★ 6,354auto-subsauto-subs 是一个本地优先的自动字幕生成工具,专为视频剪辑师设计。它直接集成到 DaVinci Resolve、Premiere 和 After Eff★ 4,293speachesspeaches 是一个基于 faster-whisper 构建的语音识别服务,提供与 OpenAI API 兼容的接口,支持实时转录、文件转录和翻译功能。它解★ 3,691whishperwhishper 是一个基于 Whisper 模型的本地语音转文字工具,提供网页界面,让用户无需上传数据即可完成音频转录、翻译和字幕编辑。它解决了云端语音服务带★ 3,077HexHex 是一款专为 macOS 打造的语音转文字工具,基于 Swift 和 SwiftUI 构建,核心目标是实现从语音到文字的快速、精准转换。它利用 OpenA★ 2,901vexavexa 是一个开源的会议转录 API,专为 Google Meet、Microsoft Teams 和 Zoom 设计。它通过自动加入会议的机器人,实时捕获音★ 2,841awesome-whisperawesome-whisper 是一个围绕 OpenAI 开源语音识别模型 Whisper 的资源聚合清单,本身不是可运行代码,而是把散落在社区里的模型变体、微★ 2,397kalosmkalosm 是一个用 Rust 编写的本地预训练 AI 模型推理框架,旨在让开发者能够以极低的延迟和完全可控的方式在本地运行大语言模型、语音识别和图像生成等模★ 2,229claude-real-videoclaude-real-video 是一个让 Claude 等大语言模型真正“看懂”视频的开源工具。它解决的是 LLM 无法直接处理视频的问题,通过从视频 UR★ 2,191noScribenoScribe 是一款面向访谈、口述史与定性研究场景的桌面音频转写工具,本质上是 OpenAI Whisper(通过 faster-whisper 加速)与 ★ 2,173MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50 多种语言,并集成时间戳和声学事件识★ 2,096typewhisper-mactypewhisper-mac 是一款专为 macOS 设计的本地语音转文字工具,基于 Apple Silicon 芯片和 WhisperKit 框架,实现完全★ 1,811obs-localvocalobs-localvocal 是一个专为 OBS Studio 设计的本地语音识别与字幕插件,利用 OpenAI Whisper 等 AI 模型在本地实时将音频★ 1,619Fun-ASRFun-ASR 是一个基于大语言模型的开源语音识别(ASR)模型家族,专注于中文、方言、口音及多语言场景。它提供多种运行时支持,包括 FunASR、vLLM、流★ 1,555amicalamical 是一款本地优先的开源 AI 听写应用,旨在让用户摆脱键盘,通过语音实现 3 倍速的文字输入。它基于 Electron 和 Next.js 构建,支★ 1,540minutesminutes 是一个开源的、注重隐私的对话记忆层,使用 Rust 编写。它旨在解决会议、想法和语音备忘录等信息碎片化、难以检索的问题。其核心能力是自动将音频(★ 1,519CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432transcribe-anythingtranscribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快又简单。它支持输入本地文件或在线 UR★ 1,403pdf-reader-mcppdf-reader-mcp 是一个基于 MCP(模型上下文协议)的 PDF 阅读工具,旨在为 AI 智能体提供“眼睛”,使其能够深入理解 PDF 文档。它通过★ 988anymdanymd 是一个用 Rust 编写的本地文档转换工具,目标是把各种格式的文件统一转成干净的 Markdown,方便喂给 AI 智能体或大模型。它支持 PDF、★ 988subvertsubvert 是一个基于 PHP 的视频处理工具,利用 OpenAI 的 Whisper 模型自动为视频生成字幕、摘要和章节。它解决了视频内容创作者手动转录、★ 868open-editopen-edit 是一个面向开发者的本地视频编辑工具,核心理念是“拥有而非租用”视频编辑器。它允许用户通过编码智能体(如 Claude Code、Codex、★ 851whisper_androidwhisper_android 是一个将 OpenAI Whisper 语音识别模型移植到 Android 平台的开源项目,基于 TensorFlow Lite★ 692cheetahCheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解决的是传统云端语音识别依赖网络、延迟高、隐私风险大的问题,通★ 670whisperIMEwhisperIME 是一个基于 Whisper 语音识别模型的 Android 输入法(IME)。它把语音转文字能力直接集成到系统输入法层,用户在任何需要打字★ 643joinlyjoinly 是一个让 AI 智能体能够接入会议场景的开源工具,核心目标是解决 AI 无法直接参与实时会议的问题。它通过将会议音频流、转录文本和参与者信息标准化★ 567leopardLeopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决的是云端 ASR 常见的隐私泄露、网络延迟和按量★ 485yapyap 是一款面向 macOS 的免费开源语音听写工具,目标是让用户在任意输入框中用说话代替打字。它常驻菜单栏,通过全局快捷键唤起,调用苹果系统自带的 Spee★ 441SayItSayIt 是一款面向 Windows 的开源语音输入工具,定位为 Wispr Flow / Superwhisper 的替代品。按下快捷键说话,AI 润色后的★ 426LiveWhisperLiveWhisper 是一个基于 OpenAI Whisper 的近乎实时语音转文字工具,通过 sounddevice 捕获麦克风音频并流式处理,无需修改 W★ 361osttostt 是一款面向终端用户的语音转文字工具,用 Rust 编写,主打在命令行环境中完成录音、转写与后续处理。它解决的是开发者不想离开终端、又需要快速把语音变成★ 301yapsnapyapsnap 是一个纯 CPU 运行的语音转文字命令行工具,能把任意视频链接或本地音视频文件转成纯文本,无需 GPU、无需调用云端 API,一条命令即可完成。★ 298humlahumla 是一款面向 Mac 的开源 AI 会议笔记工具。它无需机器人参会,直接录制麦克风与系统音频,支持在设备本地或通过 OpenAI、Deepgram、G★ 291DictateKeyboardDictateKeyboard 是一款基于 Whisper AI 的 Android 输入法键盘,目标是让用户在任意 App 里直接通过语音完成文字输入。它把 ★ 291DeLiveDeLive 是一款本地优先的桌面端实时字幕与语音识别工作台,用 Electron + TypeScript 构建,核心解决会议、直播、听课等场景下系统音频难以★ 280openasropenasr 是一个用 Rust 编写的本地优先语音转文字工具,核心目标是让转录过程完全在用户自己的机器上完成,不依赖云端服务、不上报任何遥测数据,并且采用 ★ 279kittkitt 是一个基于 Go 语言构建的实时语音对话开源项目,它利用 LiveKit 框架让开发者能够快速实现与 ChatGPT 的实时语音交互。该项目解决了传统★ 273petalPetal 是一款原生 macOS 菜单栏应用,专注本地优先的音频转写。它解决的是用户不想把会议、访谈、语音备忘等敏感音频上传云端,又希望快速得到文字稿的痛点。★ 270SpeakoFlowSpeakoFlow 是一款免费开源的跨平台语音听写与 AI 助手,支持 Windows、macOS 和 Linux。它利用本地 Whisper 模型实现离线语★ 256HoldSpeakHoldSpeak 是一款面向 macOS 和 Linux 的本地语音输入与会议转写工具,用 Python 编写。它解决的核心问题是:在不把音频上传云端的前提下★ 249milaMila 是一款原生 macOS 本地语音转写应用,底层基于 whisper.cpp 实现语音识别,并可选接入说话人分离(diarization)能力。它解决的★ 233typewhisper-winTypeWhisper for Windows 是一款基于 C# 开发的本地语音转文字工具,专为 Windows 平台设计。它利用 Whisper 模型在设备端★ 218qwen-scribeqwen-scribe 是一个面向 Apple Silicon Mac 的本地语音识别工具,基于 MLX 框架运行 Qwen3-ASR 模型,提供私有化、离线的★ 216hermes-speechhermes-speech 是一个为 Hermes Agent 设计的语音插件,同时提供 TTS(文本转语音)和 STT(语音转文本)能力。它解决的核心问题是:★ 197awesome-voice-typingawesome-voice-typing 是一个精选开源语音输入与语音转文字工具清单,覆盖 Linux、macOS、Windows、Android 和 iOS ★ 197