tiny-audio

25 美元训出带时间戳和说话人分离的语音转文字

开源 freemium 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 153
维护状态 活跃
是否开源 是
定价模式 freemium

项目预览

项目数据

分类语音识别
开发团队alexkroman
所属国家
官网地址
定价模式freemium
价格说明训练成本约$25,提供免费在线Demo和免费课程,开源代码可自部署
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型asr,audio-llm,forced-alignment,huggingface,llm,lora,multimodal,pipecat,pytorch,qwen,runpod,speaker-diarization,speech-llm,speech-recognition,speech-to-text,transformers,turn-detection,tutorial,voice-ai,word-timestamps
GitHub 星标★ 153
30天Star增速
HF 下载量
上线时间2025-10-14 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-11
浏览次数0

项目介绍

tiny-audio 是一个低成本语音转文字(ASR)系统,核心思路是把冻结的语音编码器与 Qwen 大语言模型通过一个小型可训练投影层连接起来,训练成本约 25 美元。它解决的是传统 ASR 模型训练昂贵、部署复杂的问题,让个人开发者也能在有限预算下获得带词级时间戳和说话人分离的转录能力。项目提供批量 HTTP 服务器、实时演示和免费课程,技术栈基于 PyTorch、HuggingFace、LoRA 和 RunPod,支持多模态音频-语言建模。适合需要自定义语音识别、又不想从零训练大模型的场景。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 训练成本极低,约 25 美元即可完成微调
  • 集成词级时间戳与说话人分离,输出信息丰富
  • 提供批量 HTTP 服务器和实时演示,开箱可部署

不足之处

  • 项目星标仅 153,社区和生态尚在早期
  • 依赖 Qwen 和外部编码器,版本兼容性需自行验证

适用场景

  • 个人开发者低成本搭建自定义语音转录服务
  • 会议录音自动转写并区分不同发言人
  • 为特定领域音频微调 ASR 模型并快速上线 API

替代项目

whisper、faster-whisper

上一篇:super-voice-assistant

下一篇:typeflux

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1630 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3843 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11863 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5662 2026-08-13