realtime

本站收录 42 个带「realtime」标签的 AI 开源项目

redisRedis 是一个开源的内存数据结构存储系统,常被用作数据库、缓存和消息代理。它支持字符串、哈希、列表、集合、有序集合等多种数据结构,并提供丰富的数据操作命令。★ 76,547frigateFrigate 是一个开源的网络录像机(NVR),专为 IP 摄像头设计,内置实时本地对象检测功能。它解决了传统监控系统依赖云端或高延迟检测的问题,通过边缘计算★ 36,178InsForgeInsForge 是一个开源的、面向智能体编程的全栈后端平台,旨在为 AI 编码智能体提供一站式基础设施。它整合了数据库(PostgreSQL + pgvect★ 13,030RealtimeSTTRealtimeSTT 是一个基于 Python 的实时语音转文字库,专注于低延迟和高效能。它解决了语音交互场景中常见的痛点:传统 STT 需要手动控制录音起止★ 10,158LiveTalkingLiveTalking 是一个面向实时交互场景的开源数字人项目,主打流式生成和低延迟对话。它通过音频驱动口型同步,结合 NeRF 三维重建与渲染技术,让虚拟形象★ 9,655Vision-AgentsVision-Agents 是 Stream 推出的开源框架,用于快速构建语音与视觉智能体。它解决了开发者需要集成多种模型和视频提供商、并实现低延迟实时交互的痛★ 8,147Orpheus-TTSOrpheus-TTS 是一个开源文本转语音(TTS)项目,旨在生成接近真人发音的语音。它基于大型语言模型(LLM)技术,支持实时语音合成,能处理复杂文本并输出★ 6,345rivetRivet 是一个用 Rust 编写的开源基础设施项目,核心概念是 Actor——一种面向有状态工作负载的编程原语。它主要解决 AI 智能体、协作应用和持久化执★ 6,206MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428RealtimeTTSRealtimeTTS 是一个专注于实时文本转语音(TTS)的 Python 库,旨在解决传统 TTS 引擎延迟高、难以集成到实时应用中的问题。它提供了统一的 ★ 4,039deep-chatdeep-chat 是一个高度可定制的 AI 聊天机器人前端组件,专为网站集成而设计。它解决了开发者需要快速嵌入对话功能但又不想从零构建的痛点,提供开箱即用的 ★ 3,727ElatoAIElatoAI 是一个面向硬件开发者的实时语音 AI 框架,专注于在 Arduino ESP32 等低功耗微控制器上运行 100 多种语音模型。它解决了传统 A★ 2,024yomoYoMo 是一个基于 Rust 构建的 Serverless AI Agent 框架,专注于地理分布式边缘 AI 基础设施。它解决了传统集中式 AI 服务在延迟★ 1,928SeekStormSeekStorm 是一款用 Rust 实现的高性能搜索库,同时支持向量检索与词法检索,提供进程内库和多租户服务器两种形态。它兼具速度与灵活性,适合构建高性能、★ 1,917ParallelWaveGANParallelWaveGAN 是一个基于 PyTorch 的非官方实现,集成了多种主流神经声码器,包括 Parallel WaveGAN、MelGAN、多频带★ 1,646open-trading-apiopen-trading-api 是一个面向韩国投资与证券(Korea Investment & Securities)开放 API 的 Python 封装库,★ 1,625LocalAIVoiceChatLocalAIVoiceChat 是一个本地运行的 AI 语音对话助手,基于 Zephyr 7B 大语言模型,结合 RealtimeSTT(使用 faster-★ 737FabricFabric 是一个受 Quartz Composer 启发的节点式创意编程工具,使用 Swift 编写,面向 macOS 平台。它把 3D 渲染、图像处理、计★ 570open-research-ANAopen-research-ANA 是一个开源的、AI 智能体原生的研究画布应用,旨在解决深度研究场景中信息检索与人工审核脱节的问题。它通过 CopilotKi★ 411RealVideoRealVideo 是一个实时流式对话视频生成系统,利用自回归扩散模型将文本交互转化为连续、高保真的视频响应。它解决了传统视频生成延迟高、无法实现实时对话式交互★ 343fastapifastapi 是一个用 Go 编写的企业级 LLM API 快速集成网关,旨在统一接入 OpenAI、Azure、文心一言、讯飞星火、通义千问、智谱 GLM、★ 300DeLiveDeLive 是一款本地优先的桌面端实时字幕与语音识别工作台,用 Electron + TypeScript 构建,核心解决会议、直播、听课等场景下系统音频难以★ 280fastapi-adminfastapi-admin 是一个用 Go 语言构建的企业级 LLM API 快速集成系统,旨在统一管理并代理多种主流大语言模型接口。它解决了企业在接入 Ope★ 258web-voice-processorweb-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题是:网页应用想接入麦克风做语音识别或★ 249qiscus-sdk-androidQiscus SDK for Android 是一个帮助开发者在 Android 应用中快速集成聊天功能的 SDK。它解决了从零构建聊天系统的高成本问题,提供了★ 203react-speech-highlight-demo这是一个演示如何在 React 和原生 JavaScript 中实现文本转语音(TTS)并高亮当前朗读单词和句子的开源项目。它解决了有声内容制作中“听到的与看到★ 188OrderWorderOrderWorder 是一个基于 Next.js 和 SCSS 构建的全栈 AI 餐饮应用,旨在通过无接触方式革新餐厅服务。它集成了二维码菜单、智能聊天机器人★ 138build-and-deploy-real-time-feature-pipeline这是一个用Python构建和部署实时特征管道的开源项目,旨在解决机器学习中特征工程从离线批处理向实时流处理迁移的难题。项目结合Bytewax(流处理框架)和Ho★ 137crypto-trading-arenacrypto-trading-arena 是一个开源的加密货币交易竞技场,旨在为算法交易和 AI 代理提供一个公平、透明的对战平台。它解决了交易策略回测和比较中★ 128realtime-interview-copilotRealtime Interview Copilot 是一款桌面应用,旨在面试过程中实时辅助用户生成回答。它通过语音转文字技术捕获面试官的问题,并利用大语言模型★ 125agentcraftagentcraft 是一个用 Python 编写的 AI 智能体模拟项目,旨在 Minecraft 世界中生成动态的定居点。它利用 AI 智能体模拟居民的行为★ 104microbium-appmicrobium-app 是一个基于 JavaScript 的创意绘图工具,旨在让用户通过简单的操作绘制出全新的世界。它解决了传统绘图软件上手门槛高、创作过程★ 104jargojargo 是一个基于 Go 语言、以 WebRTC 原生和音频优先的对话式 AI 框架。它解决了在实时语音交互场景中,开发者难以快速集成语音识别(STT)、语★ 98animartrixanimartrix 是一个面向微控制器的 LED 动画库,专注于在具有硬件浮点运算单元(FPU)的芯片上实现高保真、高分辨率的动画效果,支持 Teensy 4★ 81Voice-Chat-BotVoice-Chat-Bot 是一个基于 Python 的实时 AI 语音对话机器人项目,它整合了 Deepgram 的语音识别(STT)与语音合成(TTS)能★ 79KALO-ESP32-Voice-Chat-AI-Friends这是一个基于ESP32的语音对话设备项目,旨在打造能与多个自定义AI机器人聊天的小型硬件。它通过I2S接口连接INMP441麦克风录制用户提问,利用Eleven★ 75subjective-zerosubjective-zero 是一款面向创意编程与实时视觉特效的智能体编辑器,基于 Swift 和 Metal 构建,运行于 macOS 平台。它通过节点图(★ 73chatgpt-web-voice这是一个通过逆向工程调用 ChatGPT 网页版实时语音接口的开源项目。它利用 WebRTC 和 DataChannel 技术,让开发者能够使用免费的 web ★ 73WG-WaveNetWG-WaveNet 是一个基于 Python 的实时高质量语音合成项目,其核心卖点是在没有 GPU 的条件下实现高保真语音生成。它通过改进 WaveNet 的★ 73obs-squawkobs-squawk 是一个内置于 OBS Studio 的实时文本转语音(TTS)AI 引擎插件,采用 C++ 编写。它解决了在直播或录播场景中需要动态生成语★ 71RealTimeSingingSynthesizerRealTimeSingingSynthesizer 是一个基于 Python 的实时歌唱合成器,封装了 sinsy-NG 引擎,支持通过 live codin★ 60stimmstimm 是一个开源的语音代理平台,专注于通过 WebRTC 实现超低延迟的实时对话。它解决了构建实时语音 AI 应用时面临的管道编排复杂、延迟高、集成困难等★ 52