Falcon-Perception

原生多模态模型推理,看图识文一步到位

Falcon-Perception 是 Falcon 系列多模态模型的推理仓库,包含 Falcon-Perception 与 Falcon-OCR 两个模型。它们采用早期融合(early-fusion)架构,是原生多模态的稠密自回归 Transformer,而非把视觉编码器外挂到语言模型上的拼接方案。项目主要解决多模态模型在图像理解与文档 OCR 场景下的推理部署问题:用户可以通过该仓库加载权重、运行图像描述、视觉问答、文档文字识别等任务。核心能力包括统一的图文 token 序列建模、对密集文本图像(如扫描件、截图、表格)的识别,以及基于自回归生成的多模态输出。仓库以 Python 实现,提供推理脚本与模型加载入口,适合研究者复现和开发者做二次集成。作为早期项目,它更偏向模型能力验证与推理参考实现,而非开箱即用的生产级服务。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 773
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队tiiuae
所属国家
官网地址
定价模式free
价格说明开源推理仓库,免费使用
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 773
30天Star增速
HF 下载量
上线时间2026-03-31 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 早期融合架构,视觉与文本在同一 Transformer 内建模,非外挂式拼接
  • 同时覆盖通用图像理解与 OCR 文档识别两类任务
  • 基于稠密自回归 Transformer,推理流程与主流 LLM 生态接近,便于改造

不足之处

  • 仅提供推理代码,缺少训练与微调流程
  • 作为早期项目,文档与示例覆盖有限,部署工具链不完整

适用场景

  • 扫描件、发票、表格等文档的批量文字提取
  • 对截图或图片做视觉问答与内容描述
  • 研究早期融合多模态架构的推理复现实验

替代项目

Qwen2-VL、InternVL、MiniCPM-V

项目介绍

Falcon-Perception 是一个计算机视觉领域的开源项目,官方简介:Inference repo for Falcon-Perception and Falcon-OCR model, early-fusion, natively multimodal, dense Autoregressive Transformer models.。项目使用 Python 开发,在 GitHub 上获得 773 星标。

上一篇:lw.PPOCR.C

下一篇:readur

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14