
Falcon-Perception
原生多模态模型推理,看图识文一步到位
Falcon-Perception 是 Falcon 系列多模态模型的推理仓库,包含 Falcon-Perception 与 Falcon-OCR 两个模型。它们采用早期融合(early-fusion)架构,是原生多模态的稠密自回归 Transformer,而非把视觉编码器外挂到语言模型上的拼接方案。项目主要解决多模态模型在图像理解与文档 OCR 场景下的推理部署问题:用户可以通过该仓库加载权重、运行图像描述、视觉问答、文档文字识别等任务。核心能力包括统一的图文 token 序列建模、对密集文本图像(如扫描件、截图、表格)的识别,以及基于自回归生成的多模态输出。仓库以 Python 实现,提供推理脚本与模型加载入口,适合研究者复现和开发者做二次集成。作为早期项目,它更偏向模型能力验证与推理参考实现,而非开箱即用的生产级服务。
开源
free
计算机视觉
GitHub 星标
★ 773
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队tiiuae
所属国家
定价模式free
价格说明开源推理仓库,免费使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 773
30天Star增速
HF 下载量
上线时间2026-03-31 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 早期融合架构,视觉与文本在同一 Transformer 内建模,非外挂式拼接
- 同时覆盖通用图像理解与 OCR 文档识别两类任务
- 基于稠密自回归 Transformer,推理流程与主流 LLM 生态接近,便于改造
不足之处
- 仅提供推理代码,缺少训练与微调流程
- 作为早期项目,文档与示例覆盖有限,部署工具链不完整
适用场景
- 扫描件、发票、表格等文档的批量文字提取
- 对截图或图片做视觉问答与内容描述
- 研究早期融合多模态架构的推理复现实验
替代项目
Qwen2-VL、InternVL、MiniCPM-V
项目介绍
上一篇:lw.PPOCR.C
下一篇:readur
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3