end-to-end
本站收录 17 个带「end-to-end」标签的 AI 开源项目
espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974
wav2letterwav2letter 是 Facebook AI Research 开源的端到端自动语音识别工具包,基于 C++ 实现,专注于高效、高性能的 ASR 研究与应用★ 6,437
deepvoice3_pytorchdeepvoice3_pytorch 是百度 Deep Voice 3 文本转语音(TTS)模型的 PyTorch 非官方实现。Deep Voice 3 是一种★ 1,977
VideoChatVideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支★ 1,313
TraceTrace 是一个面向 AI Agent 的端到端生成式优化框架,旨在解决智能体在复杂任务中表现不稳定、难以自动调优的问题。它通过将 Agent 的执行轨迹(t★ 760
FlashLabs-ChromaFlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音对话系统延迟高、音色不自然、无法个性化定制的问题。★ 550
Comprehensive-Data-Science-AI-Project-Portfolio这是一个精选的AI、数据工程和DevOps项目合集,包含真实世界应用、先进技术和教程,面向数据科学和机器学习的学习者与实践者。项目以Jupyter Notebo★ 351
NeuralDialog-CVAENeuralDialog-CVAE 是卡内基梅隆大学赵天成等人发布的对话生成模型开源实现,对应 ACL 2017 论文。它基于条件变分自编码器(CVAE),将知★ 310
ResearchClawBenchResearchClawBench 是一个用于评估 AI 智能体在自动化科研任务中能力的基准测试平台,覆盖从“重新发现”已知科学结论到“新发现”未知规律的完整科★ 265
IDvs.MoRecIDvs.MoRec 是一个面向多模态推荐系统的端到端训练框架,由快手主导开源。它针对当前推荐系统中广泛使用的 ID 序列建模与新兴的多模态内容(如文本、图像、★ 169
Comprehensive-E2E-TTS这是一个基于 PyTorch 的非自回归端到端文本转语音(TTS)项目,直接将文本转换为语音波形,无需中间声学特征。它集成了多种前沿的无监督时长建模方法,支持 ★ 147
wavegrad2WaveGrad2 是一个非官方的 PyTorch 实现,基于 Google 提出的 WaveGrad 2 模型,用于高质量语音合成。它解决的是文本到语音(TT★ 111
Tacotron-pytorchTacotron-pytorch 是一个基于 PyTorch 实现的 Tacotron 端到端文本转语音(TTS)模型。Tacotron 是 Google 提出★ 110
e2e-mlops-project这是一个端到端的 MLOps 示例项目,旨在根据个人的身体特征和饮食习惯分类肥胖等级。项目完整覆盖机器学习生命周期,包括数据准备、模型训练、验证、部署和监控等环★ 76
FastPitchFormantFastPitchFormant 是 NCSOFT 提出的 FastPitchFormant 模型的 PyTorch 非官方实现,该模型基于源-滤波器(sour★ 74
WaveGrad2WaveGrad2 是谷歌大脑团队提出的 WaveGrad 2 模型的非官方 PyTorch 实现,专注于文本到语音(TTS)合成。它采用非自回归架构,通过迭代★ 68
MagicBokehMagicBokeh 是一个专为高倍变焦场景设计的端到端散景渲染开源项目,由 CVPR 2026 Oral 提名并入围最佳论文候选。它解决了传统散景算法在长焦拍★ 59