real-time

本站收录 69 个带「real-time」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

redisRedis 是一个开源的内存数据结构存储系统,常被用作数据库、缓存和消息代理。它支持字符串、哈希、列表、集合、有序集合等多种数据结构,并提供丰富的数据操作命令。★ 76,547pathwayPathway 是一个用 Python 编写的开源 ETL 与流处理框架,核心定位是把批处理和流处理统一到同一套代码里。它解决的是传统数据管道中批与流两套系统割★ 62,215llm-app开箱即用的云端模板,快速搭建 RAG、AI 流水线与企业级实时数据搜索应用。Docker 友好,可实时同步 SharePoint、Google Drive、S3★ 58,870dorisApache Doris 是一款基于 MPP 架构的实时分析型数据库,同时融合了全文检索与向量检索能力,定位为面向 AI Agent 场景的混合搜索数据库。它主★ 16,011agentsagents 是 OpenAI 推出的开源 Python 框架,用于构建实时语音 AI 智能体。它解决的核心问题是:开发者通常需要自己拼接语音识别、大模型推理、★ 14,422cocoindexcocoindex 是一个面向长时程智能体的增量计算引擎,用 Rust 编写。它解决的是智能体在长时间运行中需要持续感知和利用不断变化的数据(如代码库、文档、用★ 11,630ten-frameworkTEN Framework 是一个面向对话式语音 AI 智能体的开源开发框架,用 Python 编写,主打实时、多模态交互。它要解决的核心问题是:开发者想搭建能★ 11,143WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103seatunnelSeaTunnel(原名Waterdrop)是一个高性能、分布式、海量数据集成工具,支持多模态数据同步。它解决了传统数据同步工具在异构数据源间传输效率低、配置复★ 9,688liveblocksLiveblocks 是一个为多人在线应用和 AI 智能体提供实时协作基础设施的开源平台。它解决了开发者在构建协同编辑、实时状态同步和 AI 协作功能时面临的复★ 4,741fastrtcfastrtc 是一个专注于实时通信的 Python 库,旨在简化 WebRTC 音频/视频流的接入,让开发者能快速构建支持语音对话、实时转录和文本转语音的 A★ 4,629TensorFlowTTSTensorFlowTTS 是一个基于 TensorFlow 2 的实时语音合成工具包,旨在提供最先进的语音合成能力。它解决了从文本到语音(TTS)的完整流程问★ 3,995LiveCaptions-TranslatorLiveCaptions-Translator 是一款基于 Windows LiveCaptions 的轻量级实时音频/语音翻译工具。它利用 Windows 1★ 3,786FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927VieNeu-TTSVieNeu-TTS 是一个专注于越南语的端侧实时文本转语音(TTS)引擎,支持即时声音克隆,无需云端依赖即可在本地 CPU 上运行,输出 24kHz 高质量音★ 2,712LongLiveLongLive 是一个面向长视频生成的基础设施项目,旨在解决当前视频生成模型在生成长序列视频时面临的显存不足、计算效率低下和推理延迟高等问题。它通过并行化、模★ 2,647Matrix-GameMatrix-Game 是一个实时流式交互式世界模型,旨在解决长时程视频生成中的记忆与交互问题。它基于Genie架构,支持生成超过10分钟的长视频,并能在生成过★ 2,342HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176parlorparlor 是一个运行在 Apple 芯片设备上的实时多模态 AI 助手,功能类似 GPT-Live,但完全本地化。它解决了云端 AI 助手延迟高、隐私泄露和★ 2,069DEIMv2DEIMv2 是一个基于 DINOv3 的实时目标检测框架,旨在解决传统检测器在速度和精度之间难以平衡的问题。它利用 DETR 风格的 Transformer ★ 2,049comfyui-mixlab-nodesMixlab Nodes 是一个 ComfyUI 的扩展节点包,旨在将 ComfyUI 从专业工作流工具升级为更易用的应用平台。它解决了 ComfyUI 原生界★ 1,862globalthreatmapGlobal Threat Map 是一个开源交互式全球威胁地图,用 TypeScript 构建,旨在帮助用户直观了解全球战争、冲突、军事基地和国家历史。它解决★ 1,842lightly-trainlightly-train 是一个面向视觉模型的一体化训练框架,支持 YOLO、ViT、RT-DETR、DINOv3 等主流架构,覆盖预训练、微调和蒸馏全流程。★ 1,692gpu-hotgpu-hot 是一个基于 JavaScript 开发的实时 NVIDIA GPU 监控仪表盘,以网页形式直观展示 GPU 的实时状态。它解决的是开发者和运维人★ 1,634sokujisokuji 是一款面向双语会议场景的实时双向语音翻译工具,支持自动检测说话语言并双向翻译,可运行于云端或完全离线的本地设备。它提供桌面应用(Windows/m★ 1,356VideoChatVideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支★ 1,313my-translatormy-translator 是一款基于 Tauri 的桌面实时语音翻译工具,支持 macOS 和 Windows。它解决的是跨语言实时沟通中的延迟和隐私问题,无★ 1,291docx-editordocx-editor(SuperDoc)是一个基于 TypeScript 的开源 DOCX 编辑器与 Agent SDK,目标是让 AI 智能体能够直接读写、★ 1,062Real-Time-Latent-Consistency-Model这是一个展示多种实时扩散模型管线的开源应用,基于 Diffusers 库实现。它主要解决传统 Stable Diffusion 推理速度慢、难以用于实时交互场景★ 914AlphaAvatarAlphaAvatar 是一个基于 LiveKit 构建的实时交互式全模态数字人框架,目标是把数字人拆解成可插拔的开源组件,让开发者自由组合实时模型、视觉形象、★ 816rcmrCM(Rectified Consistency Models)是一个专注于视频扩散模型蒸馏的开源项目,旨在将大规模视频扩散模型转化为少步生成模型,实现双向和★ 814mossmoss 是一个面向生产环境 AI 系统的检索层,主打闪电般的搜索速度(<10ms),且无需依赖向量数据库。它专为浏览器、边缘设备、端侧和云端场景设计,旨在解决★ 790ten-turn-detectionten-turn-detection 是一个用于全双工对话通信的转折点检测开源模型。它解决的是在实时语音对话中,如何准确判断用户何时说完、何时应该由AI接管发言★ 616ctxctx 是一个面向 AI 智能体开发者的仓库感知推荐工具,核心解决的是「在浩如烟海的技能、智能体、MCP 服务器和模型 harness 中,如何快速找到适合当前★ 587auto-captionauto-caption 是一款基于 Electron 与 Python 构建的跨平台实时字幕显示软件,核心目标是把麦克风或系统音频中的语音实时转写为文字并叠加★ 584plotoptixplotoptix 是一个基于 NVIDIA OptiX 9.1 框架的 Python 数据可视化和光线追踪库。它旨在将高性能的光线追踪渲染能力引入 Pytho★ 518ai-avatar-system开箱即用的 AI 数字人平台,上传一张照片、克隆一段声音,即可通过唇形同步视频与任意面孔实时对话。完全开源、支持自托管,基于 Claude、Whisper、Ch★ 511omnitalkerOmniTalker 是一个基于 NeurIPS 2025 论文实现的实时文本驱动说话头生成项目,采用 JavaScript 技术栈,核心能力是在音频-视觉风格★ 426FILTER.jsFILTER.js 是一个用纯 JavaScript 实现的图像、视频处理与计算机视觉库,目标是在浏览器和 Node.js 环境中提供类似 OpenCV 的能力★ 399large-performance-model.github.ioLPM 1.0 是一个基于视频的角色表演模型,旨在从视频中提取并生成角色的动态表演。它解决的是传统角色动画制作中流程复杂、成本高的问题,核心能力包括实时视频驱动★ 366AL_YoloAL_Yolo 是一个基于 YOLOv5 的实时计算机视觉系统,专注于低延迟的视觉目标检测与跟踪。它把 YOLOv5 的检测能力与屏幕采集、鼠标控制等模块结合,★ 366hayamimihayamimi(早耳)是一个纯 CPU 运行的实时多语言语音转文字工具,基于 sherpa-onnx 实现,无需 GPU 和云服务即可在本地完成识别。它解决的★ 348web-voice-processorweb-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题是:网页应用想接入麦克风做语音识别或★ 249liquid-logoliquid-logo 是一个免费开源的浏览器端工具,用于创建具有液态金属美感的动态 Logo。它解决了设计师和开发者快速生成高质量动态 Logo 的需求,无需★ 228TensorVoxTensorVox 是一个用 C++ 编写的桌面端神经语音合成应用,专注于将文本实时转换为自然语音。它解决了传统 TTS 工具依赖云端、延迟高、集成复杂的问题,★ 214kokoclonekokoclone 是一个基于 Kokoro TTS 的语音克隆工具,它将语音克隆能力直接集成到 Kokoro 文本转语音引擎中。该项目解决了用户需要自然多语言★ 203voxvox 是一个用 Rust 编写的通用 AI 工具包,专注于高性能的语音转文字(STT)和文字转语音(TTS)处理。它旨在解决实时语音交互场景中的低延迟问题,并★ 161ai4rsai4rs 是一个面向遥感视觉的开源项目,基于 MMDetection、MMRotate、MMLab 生态构建,专注解决遥感图像中的目标检测、旋转框检测(OBB★ 158OmniDictateOmniDictate 是一款免费开源的 Windows 实时听写工具,完全本地运行,无需云端,保护隐私。它利用 faster-whisper 等 AI 模型实★ 154pair-programmerpair-programmer 是一个为 AI 编程助手(Claude Code、Codex 和 Cursor)提供结对编程能力的开源工具。它通过引入多角色协作★ 131