streaming
本站收录 55 个带「streaming」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
pathwayPathway 是一个用 Python 编写的开源 ETL 与流处理框架,核心定位是把批处理和流处理统一到同一套代码里。它解决的是传统数据管道中批与流两套系统割★ 62,215
WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103
seatunnelSeaTunnel(原名Waterdrop)是一个高性能、分布式、海量数据集成工具,支持多模态数据同步。它解决了传统数据同步工具在异构数据源间传输效率低、配置复★ 9,688
LiveTalkingLiveTalking 是一个面向实时交互场景的开源数字人项目,主打流式生成和低延迟对话。它通过音频驱动口型同步,结合 NeRF 三维重建与渲染技术,让虚拟形象★ 9,655
materializeMaterialize 是一个用 Rust 编写的实时数据层,核心思路是让开发者直接用标准 SQL 定义物化视图,并随着底层数据变化自动、增量地保持结果最新。它★ 6,379
json_repairjson_repair 是一个 Python 库,专门用于修复来自大语言模型(LLM)、API、日志或用户输入中的畸形 JSON 字符串。它解决了 AI 生成内★ 5,118
memgraphMemgraph 是一个高性能的开源内存图数据库,专为实时图分析和 AI 场景设计,尤其适用于 GraphRAG、AI 记忆和智能体应用。它使用 C++ 编写,★ 4,584
MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147
ai这是一个基于 TypeScript 的 AI 开发工具包,主打类型安全与供应商无关。它解决了开发者在对接不同大模型(如 OpenAI、Anthropic、Gem★ 3,150
kiro-gatewaykiro-gateway 是一个专为 Kiro IDE 和 CLI 设计的代理 API 网关,主要面向 Amazon Q Developer 和 AWS Cod★ 2,299
CyberVerseCyberVerse 是一个自托管的实时数字人智能体平台,旨在帮助开发者快速构建以语音交互为核心的 AI 代理。它解决了传统语音助手缺乏人格化形象和记忆能力的问★ 1,685
OllamaSharpOllamaSharp 是 .NET 生态中最简单的 Ollama 客户端库,旨在让 C# 开发者无缝调用本地或远程的 Ollama 推理服务。它解决了 .NE★ 1,404
MOSS-TTSDMOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模、说话人灵活控制和多语言支持方面的不足,能够从短音频参考中★ 1,400
VideoChatVideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支★ 1,313
sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302
vuiVui 是一个实时语音助手框架,基于 WebRTC 流式传输,集成了 faster-whisper 语音识别、本地 LLM(如 Qwen)和 Vui Nano ★ 769
openclaw-plugin-wecomopenclaw-plugin-wecom 是一个企业微信 AI 机器人插件,专为 OpenClaw 框架设计。它解决了企业微信场景下接入 AI 助手时遇到的集★ 705
openai这是面向 Dart 和 Flutter 开发者的非官方 OpenAI SDK,填补了官方长期缺少 Dart 生态支持的空白。它覆盖 OpenAI 全部主要 AP★ 668
semantic-drawSemanticDraw 是 CVPR 2025 论文的官方实现,旨在解决图像扩散模型在交互式内容创作中实时性不足的问题。传统扩散模型生成图像需要多次迭代采样,★ 590
domddomd 是一个仅约 30KB 的 Markdown 原生所见即所得编辑器,专为 React 打造。它要解决的核心问题是:现有富文本编辑器要么体积庞大、要么对 ★ 576
NexusRAGNexusRAG 是一个混合检索增强生成(RAG)系统,旨在解决传统向量检索在复杂查询中上下文缺失、答案不准确的问题。它结合了向量搜索、知识图谱(基于 Ligh★ 530
FirebotFirebot 是一个专为 Twitch 主播打造的多功能一体化聊天机器人,使用 TypeScript 编写。它解决了主播在直播过程中需要管理聊天互动、自动化流★ 477
clawappClawApp 是一个专为 OpenClaw AI 智能体打造的移动端聊天客户端,以 PWA 和 APK 形式提供。它解决的是在手机上无法方便地与 OpenCl★ 445
SwiftStreamingMarkdownSwiftStreamingMarkdown 是一个专为 iOS 和 macOS 平台设计的高性能 Markdown 渲染库,核心解决 LLM 流式输出场景下 ★ 371
feathubFeatHub 是一个面向实时机器学习的流批统一特征存储系统,旨在解决特征工程中训练与推理不一致、特征复用困难、实时与离线特征割裂等问题。它提供统一的 API ★ 352
LLMVoXLLMVoX 是一个将任意大型语言模型(LLM)转换为支持流式语音对话的端到端系统。它解决了传统语音助手需要额外语音识别和合成模块、延迟高且交互不自然的问题。核★ 312
MOSS-Audio-TokenizerMOSS-Audio-Tokenizer 是一个基于因果 Transformer 架构(CAT)的音频分词器,旨在将连续音频信号转换为离散 token,为音频语★ 258
voxtreamVoXtream 是一个全流式零样本文本转语音(TTS)模型,主打极低延迟和语速控制。它解决了传统 TTS 需要等待完整音频生成才能播放的问题,以及零样本克隆中★ 252
piper-pluspiper-plus 是一个多语言神经语音合成(TTS)引擎,基于 VITS 模型并引入韵律增强,支持日语、英语、中文、西班牙语、法语、葡萄牙语等 6 种语言(★ 217
yoagentyoagent 是一个用 Rust 编写的智能体框架,专注于提供核心的 agent 循环(agent loop)能力。它解决了 Rust 生态中缺乏成熟、统一的★ 179
generative-uigenerative-ui 是一个面向生成式 UI 应用的开源工具与模板集合,专注于移动端优先的体验,并针对 Expo 进行了深度优化。它解决的核心问题是:在 ★ 171
ai-react-markdownai-react-markdown 是一个专为 AI 对话场景设计的 React Markdown 渲染组件库。它解决的核心问题是:大模型流式输出的 Markd★ 168
busbarbusbar 是一个用 Rust 编写的 LLM API 网关,旨在解决多模型供应商接入和故障转移的痛点。它通过提供一个统一的 URL,让现有 SDK 无需改动★ 154
calfkit-sdkcalfkit-sdk 是一个用于构建分布式、事件驱动 AI 代理的 Python 开发套件。它解决的是在复杂业务场景中,单个 AI 代理难以独立完成任务的问题★ 148
svelte-markdownsvelte-markdown 是一个专为 Svelte 5 设计的 Markdown 和 HTML 渲染器,主要面向流式 AI 智能体输出场景,例如 Clau★ 142
model-composemodel-compose 是一个受 docker-compose 启发的 AI 服务部署工具,旨在通过一个 YAML 文件快速定义和部署生产级的 AI 服务,★ 117
llmllm 是一个零依赖的 JavaScript AI 聊天组件,专为前端开发者设计,可快速嵌入任意网页。它通过 SSE(Server-Sent Events)实现★ 117
litellm-rslitellm-rs 是一个用 Rust 编写的高性能 AI 网关,旨在统一调用 100 多种 LLM API。它兼容 OpenAI 的 API 格式,让开发者★ 116
mediamoldermediamolder 是一个用 Go 重写的 FFmpeg 风格多媒体处理工具,目标是做「AI 时代的 FFmpeg」。它保留转码、封装、编解码等传统能力(支★ 109
docker-whisperdocker-whisper 是一个把 Whisper 语音识别服务打包成 Docker 镜像的开源项目,目标是让用户在自己的服务器上快速搭建一套兼容 Open★ 108
SIMURGSIMURG 是一个面向大语言模型流式输出的在线异常检测与防护工具。它解决的核心问题是:LLM 在解码过程中常出现重复循环、语言漂移、乱码等退化现象,而传统方案★ 108
stt-serverstt-server 是一个用 Python 编写的实时语音转文字 WebSocket 服务,目标是把 ASR 能力以流式接口暴露给前端或后端应用。它通过可插拔★ 107
LLMinatorLLMinator 是一个基于 Gradio 的对话助手工具,旨在让用户直接从 Hugging Face 运行开源大语言模型。它解决了普通用户配置本地 LLM ★ 98
alloyalloy 是一个基于 Elixir 和 OTP 构建的模型无关智能体框架,旨在为 Elixir 生态提供原生的 AI 智能体开发体验。它解决了 Elixir ★ 90
cosyvoice-dockerCosyVoice 是阿里通义实验室开源的语音合成(TTS)大模型,支持中文、英文、日文等多种语言,具备零样本声音克隆、跨语种语音合成、情感控制等能力。本项目将★ 88
beneathBeneath 是一个基于 Go 语言构建的无服务器实时数据平台,旨在简化数据管道的搭建与运维。它解决了传统数据基础设施中服务器管理、扩展性和实时处理复杂的问题★ 84
vpscheckvpscheck 是一个用 Shell 编写的 VPS 全能检测脚本,主要解决用户在购买或使用 VPS 后,需要快速了解服务器网络解锁能力、IP 质量和硬件性能★ 71
AITuberFlowAITuberFlow 是一个面向 AI VTuber 的可视化工作流编辑器,基于 TypeScript 和 React Flow 构建,后端采用 Python★ 67
TorchStreamTorchStream 是一个让 PyTorch 模型支持流式推理的 Python 库。它解决了传统 PyTorch 模型在推理时必须一次性处理完整输入的问题,★ 67
moltstreammoltstream 是一个面向智能体(Agent)的原生流式传输基础设施,专为非人类广播者设计的流式运行时。它解决了传统直播平台和流媒体工具无法满足 AI 智★ 65