audio

本站收录 78 个带「audio」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848AudioGPTAudioGPT 是一个多模态音频处理框架,旨在统一理解和生成语音、音乐、声音以及说话头(Talking Head)等音频相关任务。它解决了传统音频模型功能单一★ 10,169speech_recognition这是一个Python语音识别模块,支持多种引擎和API,涵盖在线和离线场景。它解决了开发者需要统一接口调用不同语音识别服务的问题,通过简单的API即可实现从麦克★ 8,993RecorderRecorder 是一个基于 HTML5 的纯前端录音库,旨在解决浏览器和混合应用中录音格式不统一、兼容性差的问题。它支持 mp3、wav、ogg、webm、a★ 5,638MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147riffusion-hobbyriffusion-hobby 是一个基于 Stable Diffusion 的音乐生成开源项目,将图像生成技术应用于音频频谱图,实现实时音乐创作。它解决了传统★ 3,900SimpleMemSimpleMem 是一个为大型语言模型(LLM)智能体设计的终身记忆模块,旨在解决智能体在长期交互中遗忘历史信息、缺乏持续学习能力的问题。它通过高效的记忆存储★ 3,819audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927aeneasaeneas 是一个用 Python/C 编写的开源工具集,用于自动将音频与文本进行强制对齐,即自动生成音频中每个单词或句子对应的时间戳。它解决了人工手动标注音★ 2,868riffusion-app-hobbyriffusion-app-hobby 是一个基于 Stable Diffusion 的实时音乐生成 Web 应用,将图像生成模型应用于音频频谱图,实现从文本或★ 2,670MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50 多种语言,并集成时间戳和声学事件识★ 2,096AngelSlimAngelSlim 是一个面向大语言模型的开源压缩工具包,旨在让模型压缩更易用、更全面、更高效。它解决了模型部署中体积大、推理慢、成本高的问题,提供从剪枝、量化★ 1,668SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538PostBot 内容同步助手PostBot 内容同步助手是一款开源的多平台内容同步分发生产力工具。支持将文章、笔记、动态、图片、视频、音频等内容一键同步发布至主流媒体平台,覆盖微信/微博/★ 1,470CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432spotlightSpotlight 是一个基于 TypeScript 的开源交互式数据探索工具,专为处理非结构化数据集而设计。在机器学习和数据科学工作中,图像、音频、视频等非结★ 1,276TTS-Audio-SuiteTTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)和语音转换(VC)提供一站式解决方案。它★ 1,216ai-audio-datasets覆盖语音、音乐与音效的 AI 音频数据集合集,为生成式 AI、AIGC、模型训练与智能音频工具开发提供高质量训练数据,是构建音频 AI 应用、开展相关研究的实用★ 970Confucius4-TTSConfucius4-TTS 是一个多语言与跨语言零样本语音合成引擎,基于 PyTorch 构建。它解决的核心问题是:在无需针对特定说话人进行微调的情况下,用极★ 824voxtral-mini-realtime-rs这是一个用 Rust 实现 Mistral Voxtral mini 实时语音识别(ASR)和语音合成(TTS)的开源项目,基于 Burn 机器学习框架,支持本★ 823party-modeparty-mode 是一个实验性的音乐可视化项目,基于 d3.js 和 Web Audio API 构建。它能够解析音频文件的频谱数据,并将其转化为动态的、由★ 804ComfyUI-VibeVoiceComfyUI-VibeVoice 是一个为 ComfyUI 设计的自定义节点,用于集成 VibeVoice 文本转语音(TTS)引擎。它解决了在 ComfyU★ 598ComeCutComeCut(来剪)是一个轻量级视频编辑器,提供网页版和桌面版,完全免费使用。它的功能设计借鉴了 CapCut 等主流编辑器,旨在为用户提供一个无需复杂安装、★ 598JJazzLabJJazzLab 是一款开源的自动伴奏生成应用,专为音乐人、练习者和即兴演奏者设计。它解决了在没有真实乐队的情况下,如何快速获得高质量伴奏音乐的问题。用户只需输★ 594liquid-audioLiquid Audio 是 Liquid AI 推出的语音到语音(speech-to-speech)音频模型系列,旨在解决传统语音处理流水线中模块割裂、延迟高★ 570tacotronTacotron是Google提出的端到端语音合成模型,该项目是其论文的音频样本展示页。它解决了传统TTS系统需要复杂前端文本分析和声学建模的问题,直接通过注意★ 539muspyMusPy 是一个用于符号音乐生成的开源 Python 工具包,旨在为音乐生成研究和应用提供统一、高效的基础设施。它解决了音乐生成领域中数据格式混乱、数据集不兼★ 525whisplay-ai-chatbot这是一个基于树莓派 Zero 2W 或 5 的袖珍 AI 聊天机器人项目,名为 whisplay-ai-chatbot。它利用 TypeScript 构建,整合★ 521ComfyUI-VoxCPMComfyUI-VoxCPM 是一个为 ComfyUI 设计的音频生成节点,专注于高表现力的语音合成和零样本声音克隆。它解决了在 ComfyUI 工作流中集成先★ 511speech_datasetspeech_dataset 是一个面向语音识别(ASR)研究的中文语音数据集仓库,旨在为深度学习语音模型提供训练与评估所需的音频资源。项目整理了多种来源的语音★ 471google-speech-v2google-speech-v2 是一个针对 Google 语音转文字 API(v2 版本)的逆向工程项目。它通过分析 Google 内部接口的请求协议,提供了★ 469audio-development-toolsAudio Development Tools (ADT) 是一个面向音频技术研发的开源项目,旨在整合声音、语音和音乐领域的开发工具链。它解决音频开发者缺乏统一★ 469potatopotato 是一个轻量级、可移植的数据标注工具,旨在为 AI 研究和开发提供灵活高效的标注解决方案。它解决了传统标注工具部署复杂、难以定制、难以适应多模态数据★ 425audio.cpp-webuiaudio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它支持语音合成(TTS)、★ 369xcodecxcodec 是一个面向音频语言模型的语义编解码器,由香港科技大学等机构在 AAAI 2025 提出。它针对传统音频编解码器(如 EnCodec)在语义信息保留★ 316LLMVoXLLMVoX 是一个将任意大型语言模型(LLM)转换为支持流式语音对话的端到端系统。它解决了传统语音助手需要额外语音识别和合成模块、延迟高且交互不自然的问题。核★ 312aixploraAIxplora 是一个开源工具,让你能够查询各种类型的文件,不受长度或格式限制。它基于 TypeScript 构建,支持音频、PDF 等格式,利用嵌入模型和生★ 272MOSS-Audio-TokenizerMOSS-Audio-Tokenizer 是一个基于因果 Transformer 架构(CAT)的音频分词器,旨在将连续音频信号转换为离散 token,为音频语★ 258go-astibobgo-astibob 是一个基于 Go 语言构建的 AI 框架,旨在帮助开发者快速搭建能够理解语音并回应的智能助手。它解决了从零开始集成语音识别(STT)和语音★ 243PodciniPodcini 是一款开源的 Android 播客播放器,不仅支持传统 RSS 播客订阅,还能直接播放 YouTube 和 YouTube Music 上的音频★ 236so-vits-models这是一个收集AI模型与应用的资源汇总项目,聚焦于声音、图像、视频和文本生成领域。它整理了so-vits-svc(歌声转换)、TTS(文本转语音)、Stable ★ 210musicaizmusicaiz 是一个面向符号音乐生成、评估与分析的 Python 框架。它解决了音乐研究者与开发者在构建音乐生成模型时缺乏统一工具链的问题,提供从数据加载、★ 193InflectInflect 是一个轻量级、高质量的文本转语音(TTS)模型,旨在以极小的资源占用生成自然流畅的语音。它目前处于积极开发阶段,重点追求快速迭代、优秀的音质和简★ 159KaraFanKaraFan 是一个基于人工智能的音乐分离开源项目,旨在从混合音频中提取人声和伴奏,尤其适用于卡拉OK伴奏制作。它利用深度学习模型对音频信号进行源分离,核心能★ 151TTSizerTTSizer 是一个自动生成高质量、按说话人区分的文本转语音(TTS)数据集的工具。它解决的是构建 TTS 模型时数据准备繁琐的痛点:以往需要手动转录音频、切★ 145vstvst 是一个开源的音频插件项目,它允许用户直接在数字音频工作站(DAW)中通过输入文字来生成声音。该项目基于 C++ 开发,核心功能是将自然语言描述转化为音频★ 141