audio-processing

本站收录 36 个带「audio-processing」标签的 AI 开源项目

mediapipeMediaPipe 是 Google 开源的跨平台机器学习解决方案框架,专为实时和流媒体场景设计。它解决的是开发者难以高效构建、部署和优化多模态 ML 应用的问★ 37,118speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962SnapOtterSnapOtter 是一个开源、可自托管的文件处理工具,旨在解决个人和企业处理图片、视频、音频、PDF 及文档时依赖云端服务导致的数据隐私和合规问题。它集成了格★ 2,755ailia-modelsailia-models 是一个汇集了预训练、前沿 AI 模型的集合,专为 ailia SDK 设计。它解决了 AI 模型从研究到部署之间的鸿沟,提供了统一、易★ 2,393SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538SoniTranslateSoniTranslate 是一个开源的视频同步翻译与配音工具,专注于将视频中的语音自动翻译成其他语言,并生成与画面同步的配音。它解决了视频内容跨语言传播时人工★ 1,416LanPaintLanPaint 是一个面向 Stable Diffusion 系列模型的免训练图像修复(inpainting)方案,同时提供 ComfyUI 自定义节点。它要★ 1,416StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294TTS-Audio-SuiteTTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)和语音转换(VC)提供一站式解决方案。它★ 1,216APTAPT 是一个开源的 AI 生产力工具,旨在通过本地化部署和隐私保护提升用户效率。它内置了 ChatGPT、DeepSeek、Phi、Qwen 等模型的本地专属★ 770awesome-large-audio-models这是一个收录大型语言模型(LLM)在音频AI领域应用资源的精选列表,旨在为研究人员和开发者提供一站式导航。项目系统梳理了音频理解、生成、多模态交互等方向的前沿模★ 742audio-development-toolsAudio Development Tools (ADT) 是一个面向音频技术研发的开源项目,旨在整合声音、语音和音乐领域的开发工具链。它解决音频开发者缺乏统一★ 469WhisperHalluWhisperHallu 是一个实验性开源项目,专注于音频预处理,旨在减少 OpenAI Whisper 语音识别模型产生的幻觉文本(即模型在无语音片段中虚构输★ 351kokoro-ioskokoro-ios 是一个基于 Kokoro TTS 引擎的 iOS 和 macOS 原生文本转语音应用,使用 Swift 和 SwiftUI 构建,并利用 ★ 290speech-dataset-generatorspeech-dataset-generator 是一个用于创建带标签语音数据集的 Python 工具,主要解决语音识别、说话人识别等任务中训练数据难以获取和标★ 263On-Device-Speech-to-Speech-Conversational-AI这是一个纯CPU上运行的实时语音对话系统,实现与AI模型的双向语音交流。它采用连续流式架构,支持即时响应和自然的打断处理,让对话流畅自然。项目整合了语音识别(A★ 257web-voice-processorweb-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题是:网页应用想接入麦克风做语音识别或★ 249awesome-NLP-resources这是一个精选的自然语言处理(NLP)资源和工具集合,汇总了从基础到前沿的各类NLP项目,涵盖文本分类、命名实体识别、机器翻译、问答系统、知识图谱、语音处理等多个★ 239video-SALMONN-2video-SALMONN-2 是清华大学电子工程系与字节跳动联合开发的新一代音视频大语言模型,旨在解决视频理解中音频与视觉信息融合不足的问题。该模型能够接收视★ 219vox-boxvox-box 是一个兼容 OpenAI API 的语音服务端,提供文本转语音(TTS)和语音转文本(STT)能力。它解决了语音应用开发中多模型集成和 API ★ 217asmr-dubberasmr-dubber 是一个用 Python 编写的音视频字幕与配音工具,主要面向 ASMR、音声作品等需要跨语言处理的场景。它把语音识别(ASR)、台本导入★ 212lalalaiLALAL.AI 的官方 API 示例库,专注于音频分离与处理。它提供了一系列 Python 脚本,演示如何调用 LALAL.AI 的云端服务,实现人声与伴奏分★ 196paper-listpaper-list 是一个自动更新的论文列表项目,专注于图像生成领域,同时覆盖动作识别、异常检测、音频处理、分类、深度估计、图神经网络等多个方向。它通过自动化★ 161voxvox 是一个用 Rust 编写的通用 AI 工具包,专注于高性能的语音转文字(STT)和文字转语音(TTS)处理。它旨在解决实时语音交互场景中的低延迟问题,并★ 161whisper-clipWhisperClip 是一个基于 OpenAI Whisper 的轻量级桌面工具,核心目标是让语音转文字变得像按一下按钮一样简单。它解决了日常记录、会议速记或★ 139voiceblendervoiceblender 是一个可编程的语音 AI 平台,基于 Go 语言构建,专注于解决语音通话场景中 AI 能力的集成与编排问题。它通过 REST API、★ 122sub-to-audiosub-to-audio 是一个将字幕文件转换为音频的工具,它利用 Coqui-ai TTS 引擎,根据字幕文件中的时间轴和文本内容,自动生成与字幕同步的语音音★ 120model-composemodel-compose 是一个受 docker-compose 启发的 AI 服务部署工具,旨在通过一个 YAML 文件快速定义和部署生产级的 AI 服务,★ 117facetfacet 是一个基于 NodeJS 和浏览器的实时编码与合成工具,专为生成艺术和算法创作设计。它让用户通过编写 JavaScript 代码,在浏览器中实时生成★ 111chatterbox-finetuningChatterbox 微调工具包,专为 Chatterbox TTS 和 TURBO 模型设计,支持 23 种语言,具备智能词汇扩展、离线预处理、自动 VAD ★ 111ComfyUI-audioComfyUI-audio 是一个为 ComfyUI 平台开发的音频生成工具集,旨在将音乐生成、文本转语音等音频能力集成到 ComfyUI 的可视化节点工作流中★ 106jkinco-listen-openjkinco-listen-open 是一个本地优先的智能会议纪要工作台,专为需要数据隐私和离线可用的团队设计。它把会议录音转写、场景识别、纪要生成和文档导出整★ 102Voice-Chat-BotVoice-Chat-Bot 是一个基于 Python 的实时 AI 语音对话机器人项目,它整合了 Deepgram 的语音识别(STT)与语音合成(TTS)能★ 79audiotokenaudiotoken 是一个专注于音频令牌化的开源项目,旨在以最快的方式将音频信号转换为离散的令牌序列,供音频生成模型(如音乐生成、语音合成)使用。它解决了传统★ 56NeuralTextToAudioNeuralTextToAudio 是一个基于文本提示生成合成音频的开源项目,旨在通过自然语言描述来控制音频生成过程,解决传统音频制作依赖专业设备和手工编辑、门★ 53