nonverspeech38k

让AI学会笑、叹、哼,生成自然非语言人声

NonVerbalSpeech-38K 是一个用于非语言语音(如笑声、叹息、哼声等)生成与理解的开源项目,源自同名论文。它提供了一套可扩展的数据处理流水线,能够从大规模音频中自动提取和标注非语言发声,并构建了包含38,000个样本的数据集。项目核心能力包括:非语言发声的检测与分类、基于文本或情感标签的合成生成、以及用于训练和评估的标准化工具。它解决了现有TTS系统无法自然生成非语言声音的问题,填补了该领域的数据和工具空白。项目采用HTML技术栈,可能包含演示界面和文档,适合研究人员和开发者用于情感计算、人机交互、游戏音效等场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 71
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队nonverbalspeech38k
所属国家
定价模式free
价格说明开源项目,代码公开,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议
主要语言HTML
技术栈/模型non-verbal-vocalisation,text-to-speech
GitHub 星标★ 71
30天Star增速
HF 下载量
上线时间2025-08-02 00:00:00
最近更新2026-08-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 首个聚焦非语言发声的规模化数据集,38K样本覆盖多种发声类型
  • 提供可复现的数据处理流水线,支持自定义扩展新发声类别
  • 与TTS系统集成,可增强语音合成的自然度和情感表现力

不足之处

  • 项目处于早期阶段,文档和社区支持尚不完善
  • 依赖特定音频数据源,泛化到不同语言或文化背景可能有限

适用场景

  • 情感语音合成,为虚拟助手或游戏角色增加真实感
  • 非语言发声识别,用于医疗监护或人机交互中的情绪检测
  • 语音数据集构建,为多模态AI模型提供训练素材

替代项目

EmotionVoice、VocalSound、MSP-Podcast

项目介绍

nonverspeech38k 是音频音乐领域的开源项目,由 nonverbalspeech38k 开发,2025 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 71。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-18。代码公开,可自行部署使用,无付费版本。

它主要面向的使用场景是:情感语音合成,为虚拟助手或游戏角色增加真实感。同类可对比的替代方案包括 EmotionVoice、VocalSound、MSP-Podcast。

上一篇:brasiltts

下一篇:elevenlabs

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09