AudioNotes

上传音视频,自动生成结构化 Markdown 笔记

AudioNotes 是一个基于 Python 的语音转文字笔记工具,旨在快速从音视频文件中提取内容并整理成结构化的 Markdown 笔记。它解决了手动听写和整理会议、讲座、采访等音视频内容耗时费力的问题。核心能力包括:调用 FunASR 或 Whisper 等 ASR 模型进行高精度语音识别,结合 Ollama 本地大模型(如 Qwen2)对转录文本进行智能总结、提炼要点、生成结构化笔记。用户只需提供音视频文件路径,即可自动完成转录、清洗、总结和 Markdown 输出,支持自定义模型和参数,适合本地部署,保护隐私。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2515
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队harry0703
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai,asr,funasr,ollama,python,qwen2,whisper
GitHub 星标★ 2515
30天Star增速
HF 下载量
上线时间2024-07-19 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数5

使用教程

难度:入门 约 20 分钟 部署方式:Docker 7 步

环境要求

  • Docker Desktop(已安装并启动)
  • Ollama(已安装并启动)
  • Docker Desktop 建议分配至少 12GB 内存,处理长音视频推荐 16GB,并预留约 10GB 磁盘空间
  • 源码方式需准备 Python 3.12 和 ffmpeg
  • 首次安装需联网下载应用镜像和模型,处理个人内容时不依赖云端 AI 服务

安装与启动步骤

  1. 1安装并启动依赖

    先安装并启动 Docker Desktop 与 Ollama,并给 Docker 分配足够内存和磁盘空间。

  2. 2拉取本地大模型

    用 Ollama 拉取 qwen3.5:2b,后续的笔记整理和内容问答都在本地完成。

    ollama pull qwen3.5:2b
  3. 3下载项目配置文件

    新建 audionotes 目录,再下载 docker-compose.yml 和 .env 示例配置。

    mkdir audionotes
    cd audionotes
    curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/docker-compose.yml -o docker-compose.yml
    curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/.env.example -o .env
  4. 4启动 AudioNotes

    在含 docker-compose.yml 的目录下后台启动容器,首次会拉取应用镜像,请耐心等待。

    docker compose up -d --remove-orphans
  5. 5打开页面登录

    浏览器访问地址,默认账号和密码均为 admin,登录后上传音视频或使用浏览器录音。

  6. 6源码方式准备

    可选方案:克隆代码、建虚拟环境、装依赖、复制 .env,并拉取本地模型。

    git clone https://github.com/harry0703/AudioNotes.git
    cd AudioNotes
    python3.12 -m venv .venv
    source .venv/bin/activate
    python -m pip install -r requirements.txt
    cp .env.example .env
    ollama pull qwen3.5:2b
  7. 7源码方式运行

    确认 Ollama 已启动后运行 Chainlit 服务,端口同样是 15433。

    python -m chainlit run main.py --host 127.0.0.1 --port 15433

如何确认成功

浏览器访问 http://localhost:15433/,用 admin / admin 能成功登录并看到上传页面,即表示启动成功。

常见问题

Q:首次使用为什么很慢?

A:首次识别会自动下载约 2.15GB 的语音模型,等待时间取决于网络速度;模型下载完成后保存在本机,后续无需重复下载。

Q:默认登录账号密码是什么?

A:默认账号和密码均为 admin,登录后可上传音视频或直接使用浏览器录音。

Q:需要联网才能用吗?

A:首次安装需要联网下载应用镜像和模型,之后音视频识别与笔记整理都在本机完成,不依赖云端 AI 服务。

Q:内存不够导致处理失败怎么办?

A:建议给 Docker Desktop 分配至少 12GB 内存,处理较长音视频时推荐 16GB,并预留约 10GB 磁盘空间。

Q:源码方式如何退出环境?

A:在源码目录下执行 deactivate 即可退出 Python 虚拟环境。

注意事项

  • Web 页面默认只允许本机访问,不对局域网或互联网开放。
  • 音视频、文字稿、笔记和对话历史都保存在本机,请在受信任的电脑上使用并保护本机账户与磁盘数据。
  • 需要安装或配置数据库,AudioNotes 会自动创建本地数据文件。
  • 源码启动必须确认 Ollama 已启动,否则大模型相关功能不可用。

核心亮点

  • 支持 FunASR 和 Whisper 双引擎,识别精度高且可切换
  • 集成 Ollama 本地大模型,自动总结要点,无需联网
  • 输出标准 Markdown,方便后续编辑和知识管理

不足之处

  • 依赖本地 GPU 资源,CPU 环境下转录速度较慢
  • 文档和社区支持尚待完善,新手配置可能有一定门槛

适用场景

  • 会议录音快速转写并生成纪要
  • 网课或讲座视频提炼核心知识点
  • 采访或播客内容整理为结构化文稿

替代项目

WhisperX、Faster-Whisper、Vosk

项目介绍

AudioNotes 是语音识别领域的开源项目,由 harry0703 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,515)位列前 30%,在语音识别分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,257 增加到 2,515,净增 258。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:会议录音快速转写并生成纪要。同类可对比的替代方案包括 WhisperX、Faster-Whisper、Vosk。

上一篇:Recorder

下一篇:transcribe.cpp

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13