multilingual

本站收录 43 个带「multilingual」标签的 AI 开源项目

VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137ebook2audiobookebook2audiobook 是一个将电子书自动转换为有声书的开源工具,支持 EPUB、PDF 等格式,内置 1158 多种语言和声音克隆功能。它解决了传统有★ 20,249supertonicsupertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS、Flutter、Node.js、P★ 13,789supertonicsupertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,无需云端依赖。它解决了传统 TTS 服务★ 13,789awesome-nano-banana-pro-prompts这是一个专门为 Google Gemini 图像生成模型(Nano Banana Pro)打造的开源提示词库,号称全球最大,收录了超过 10,000 条精选提示★ 13,515awesome-gpt-image-2这是全球最大的 GPT Image 2 提示词库,每日更新,收录超过 2000 条精选提示词,每条都附带预览图,支持 16 种语言。项目旨在解决用户在使用 Op★ 9,975SenseVoiceSenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音★ 9,408MeloTTSMyShell.ai 开源的高质量多语言 TTS 库,支持英语、西班牙语、法语、中文、日语、韩语六种语言。合成速度快、音质自然,支持本地部署与批量推理,适合多语★ 7,650MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147claude-blogClaude Code 博客写作技能套件:包含 30 个子技能、5 个 Agent 与 5 道门控的 Blog Delivery Contract 交付体系,内★ 2,294MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50 多种语言,并集成时间戳和声学事件识★ 2,096MOSS-TTSDMOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模、说话人灵活控制和多语言支持方面的不足,能够从短音频参考中★ 1,400Foundation-Models-Framework-Lab这是一个基于 Apple 新发布的 Foundation Models 框架的实战实验室,旨在帮助开发者快速上手构建、测试和评估基于 Apple 基础模型的应用★ 1,185Multilingual_Text_to_Speech这是一个基于 Tacotron 2 的多语言文本转语音(TTS)实现,专注于支持多语言实验,包括参数共享、语码切换和声音克隆。项目解决了单一语言 TTS 模型无★ 844retro-boardretro-board 是一个敏捷回顾会议(Agile Retrospective)的在线协作白板,旨在帮助团队在迭代结束后高效地总结优点、不足和改进点。它解决★ 817biblebible 是一个开源的多语言圣经文本数据集,以 JSON 和 XML 两种结构化格式提供,覆盖 35 种语言的 90 个圣经版本。它解决的是开发者、研究者和内★ 742WitNoteWitNote 是一款本地优先的 AI 写作伴侣,支持 macOS 与 Windows 双平台。数据默认保存在本地,隐私安全有保障;AI 能力无缝融入写作流程,★ 571GTSingerGTSinger 是一个面向歌唱语音合成研究的全球多技术歌唱语料库,由 NeurIPS 2024 Spotlight 论文提出。它解决了现有歌唱数据集在技术覆盖★ 529xiaoniu小牛视频翻译是一款面向视频本地化场景的AI工具,主要解决视频翻译效率低、流程繁琐的问题。它支持本地视频文件翻译、字幕文件独立翻译,以及直接下载并翻译YouTub★ 408hayamimihayamimi(早耳)是一个纯 CPU 运行的实时多语言语音转文字工具,基于 sherpa-onnx 实现,无需 GPU 和云服务即可在本地完成识别。它解决的★ 348KokoroSharpKokoroSharp 是一个基于 C# 和 ONNX Runtime 的本地 TTS(文本转语音)推理引擎,专注于为 .NET 开发者提供即插即用的语音合成能★ 245QTranslateQTranslate 是一款快速、可扩展的桌面翻译套件,支持翻译、OCR 文字识别、文本转语音和拼写检查,并内置插件系统。它基于 Kotlin 和 Java S★ 227piper-pluspiper-plus 是一个多语言神经语音合成(TTS)引擎,基于 VITS 模型并引入韵律增强,支持日语、英语、中文、西班牙语、法语、葡萄牙语等 6 种语言(★ 217Mental-health-Chatbot这是一个多语言心理健康聊天机器人,旨在为面临心理困扰的人群提供情感支持和资源引导。项目通过集成语言翻译功能,打破语言障碍,使不同语言背景的用户都能获得心理援助。★ 213kokoclonekokoclone 是一个基于 Kokoro TTS 的语音克隆工具,它将语音克隆能力直接集成到 Kokoro 文本转语音引擎中。该项目解决了用户需要自然多语言★ 203orukeetorukeet 是一个多语言自动语音识别(ASR)开源项目,核心创新在于用「拟合后冻结的 Gabor 卷积核」替代传统可学习卷积,把声学前端固定下来,减少训练参★ 139Qwen3-TTS-EasyFinetuningQwen3-TTS-EasyFinetuning 是一个面向 Qwen3-TTS 模型的简易微调工具,旨在让开发者快速实现声音克隆和多语言高质量语音合成。它解决★ 125guardian-sdkGuardian SDK 是 Ethicore Engine™ 的开源组件,一个专注于 AI 安全、伦理与合规的防护平台。它通过多层分析流水线,保护 AI 应用★ 122Sora-FullStackSora-FullStack(SoraFlows)是一个基于 OpenAI Sora 模型的开源全栈 Web 应用,旨在让用户通过文本或图片轻松生成、编辑和分享★ 111chatterbox-finetuningChatterbox 微调工具包,专为 Chatterbox TTS 和 TURBO 模型设计,支持 23 种语言,具备智能词汇扩展、离线预处理、自动 VAD ★ 111qwen3-ttsqwen3-tts 是一个纯 C 语言实现的 Qwen3-TTS 文本转语音推理引擎,旨在摆脱 Python 和 PyTorch 的依赖,仅用 C 和 BLAS★ 109murf-python-sdkmurf-python-sdk 是 Murf 文本转语音 API 的 Python 封装库,旨在让开发者通过几行代码快速调用 Murf 的 AI 语音合成能力。★ 108LLMeBenchLLMeBench 是一个用于基准测试大型语言模型(LLM)的开源工具,旨在标准化评估流程,帮助开发者比较不同模型的性能。它解决了 LLM 评测中缺乏统一框架、★ 108ebook2audiobookpiper-ttsebook2audiobookpiper-tts 是一个将电子书转换为有声书的开源工具,核心基于 Piper TTS 引擎,支持多种语言。它解决了传统 TTS ★ 107M3ExamM3Exam 是一个多语言、多模态、多层次的 LLM 评测基准,提供配套数据与代码,用于全面检验大语言模型在多样化考试场景中的能力表现,是学术研究者评估模型综合★ 105OkapiOkapi 是一个面向多语言场景的指令微调大语言模型项目,核心解决非英语语言(如中文、西班牙语、印地语等)在指令跟随和对话质量上表现不足的问题。项目基于 LLa★ 96neon-tts-plugin-coquineon-tts-plugin-coqui 是 Neon AI 开源智能语音助手生态中的文本转语音(TTS)插件,基于 Coqui AI 的 TTS 引擎实现。★ 85PolyLangVITSPolyLangVITS 是一个基于 VITS 的多语言语音合成项目,支持韩语、日语、英语和中文四种语言。它利用 VITS 的端到端架构,将文本直接转换为语音,★ 75don-cheli-sddDon Cheli 是一个面向 AI 代理的规范驱动开发(SDD)框架,旨在将 AI 编程从随意对话转变为严谨的工程流程。它通过 88+ 命令、51 项技能和 ★ 57vllm-chatterbox-streamvllm-chatterbox-stream 是一个基于 vLLM 推理引擎的多语言文本转语音(TTS)服务,兼容 OpenAI API 接口,支持实时 PCM★ 55ml-talking-face这是一个基于CVPR 2022论文的AI数字人说话视频生成项目,通过输入一段音频和一张静态人脸照片,即可生成人物嘴巴与音频同步的说话视频。项目核心解决的是数字人★ 54MLC-SLM-BaselineMLC-SLM-Baseline 是 INTERSPEECH 2025 多语言对话语音语言模型研讨会的官方基线系统,旨在为参与者提供语音识别和说话人日志的参考实★ 51