face-emotion-recognition
开源
摄像头前做表情,AI陪你聊情绪
这是一个基于轻量级CNN的实时人脸表情识别系统,结合OpenCV进行摄像头推理,并集成GroqCloud提供聊···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
face-emotion-recognition
开源
摄像头前做表情,AI陪你聊情绪
这是一个基于轻量级CNN的实时人脸表情识别系统,结合OpenCV进行摄像头推理,并集成GroqCloud提供聊···
Falcon-Perception
开源
原生多模态模型推理,看图识文一步到位
Falcon-Perception 是 Falcon 系列多模态模型的推理仓库,包含 Falcon-Perception 与 Falcon-OCR 两···
LIGHT
开源
无需分类器,轻松生成自然的人-物交互3D动画
LIGHT 是一个面向数字人3D动画的开源项目,专注于人体-物体交互(HOI)动画生成。它提出了一种无需···
Graph-CAD
开源
用自然语言直接生成 CAD 模型,几何感知更精准
Graph-CAD 是一个面向文本到 CAD 建模任务的开源项目,旨在通过学习层级化且几何感知的图表示来提升···
MagicBokeh
开源
一键生成高倍变焦电影级散景,告别生硬抠图
MagicBokeh 是一个专为高倍变焦场景设计的端到端散景渲染开源项目,由 CVPR 2026 Oral 提名并入围最···
TurboOCR
开源
每秒200+张图,TensorRT加速的OCR服务,开箱即用。
TurboOCR 是一个基于 C++ 实现的高性能 OCR 服务,专为追求极致吞吐量的场景设计。它集成了百度飞桨···
HandX
开源
让数字人双手协作,生成自然交互动作
HandX 是一个面向双手(双人)运动与交互生成的开源项目,发表于 CVPR 2026。它解决的是现有数字人···
MonoArt
开源
从单张照片,逐步推理出带关节的3D模型
MonoArt 是论文“MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Recon···
DART
开源
用前沿模型实时检测视频里的任何目标
DART 是一个基于前沿目标检测模型的实时检测工具,用 Python 实现,核心目标是把高性能检测模型落地···
paddleocr-local
开源
本地把 PDF/Office 转 Markdown,五种 OCR 模型随你换
paddleocr-local 是一个本地优先的文档解析工作台,把 PDF、Office 等格式的文件转换成 Markdown,···
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
modlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)···
noai-watermark
开源
一键去除 AI 隐形水印,清理生成痕迹
noai-watermark 是一个开源的 Python 命令行工具,用于移除图像中的隐形 AI 水印(如 SynthID、Sta···
OccAny
开源
让3D占用预测适配任意城市,开箱即用
OccAny 是一个面向城市级 3D 占用预测的统一框架,旨在解决传统模型在多样化和非受限城市场景中泛化···
oximedia
开源
用纯 Rust 一站式搞定音视频与视觉处理,安全无专利负担
OxiMedia 是一个用纯 Rust 编写的开源多媒体处理框架,目标是重建 FFmpeg 与 OpenCV 的能力并统一到···
AWESOME-OCR-LLM
开源
一张清单看懂大模型时代 OCR 怎么选
AWESOME-OCR-LLM 是一个聚焦“大语言模型时代的 OCR”的开源资源集合,系统整理了将 LLM 与多模态大···
liteparse
开源
秒级解析 PDF 和扫描件,提取文本数据,开源免费。
liteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本···
PAct
开源
一张照片,生成可活动的3D关节模型
PAct 是一个面向单张图像的三维关节物体生成项目,被 SIGGRAPH Asia 2026 条件接收。它解决的是从单···
CC-Pan
开源
用扩散模型高效融合遥感图像,全色锐化又快又准
CC-Pan 是论文《CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening···
AdaRefSR
开源
一张参考图,单步扩散,超分又快又真
AdaRefSR 是一个基于参考图像的单步扩散超分辨率框架,论文已被 ICLR2026 接收。它解决传统参考超分···
AnomalyVFM
开源
零样本异常检测,无需训练直接部署
AnomalyVFM 是一个面向工业视觉异常检测的零样本检测框架,发表于 CVPR 2026。它旨在解决传统异常检···
fashn-vton-1.5
开源
上传衣服和照片,秒出试穿效果,无需手动抠图
FASHN VTON v1.5 是一个基于扩散模型的虚拟试穿(Virtual Try-On)开源项目,专注于在像素空间实现···
RotoAI
开源
用一句话描述视频中的物体,自动完成逐帧分割抠像。
RotoAI 是一个开源的视频分割工作室,专注于提示词驱动的视频分割(rotoscoping)任务。它结合了 S···
jietuba
开源
Windows 截图后长截图、OCR、翻译、录屏一站搞定
jietuba 是一款面向 Windows 平台的开源截图工具,使用 Python 与 PySide6 构建,目标是把日常截图···
GutenOCR
开源
用 VLM 做 OCR 的训练评测一条龙工具
GutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心···