image-to-text
本站收录 11 个带「image-to-text」标签的 AI 开源项目
modlensmodlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文★ 4,071
MORTMORT 是一款基于 C# 开发的实时游戏翻译工具,主要面向韩文游戏玩家。它通过屏幕 OCR 技术识别游戏画面中的文本,再调用在线翻译服务将韩文等内容实时转换为★ 1,775
PaddleMIXPaddleMIX是百度飞桨生态下的多模态大模型套件,旨在统一支持主流多模态任务,包括图文理解、视觉问答、图像生成等。它集成了端到端的大规模多模态预训练模型和扩★ 723
RSTGameTranslationRSTGameTranslation 是一款面向 Windows 游戏玩家的开源实时翻译工具,核心思路是把 OCR 文字识别与大模型翻译串成一条流水线:截取屏幕★ 655
mac-ocrmac-ocr 是一个基于苹果 Vision 框架的 macOS 命令行工具,用 Swift 编写,用于对图片和 PDF 做文字识别,并生成可搜索的 PDF。它★ 521
reconstruction-alignmentReconstruction Alignment 是 ICLR 2026 论文的官方实现,旨在通过自监督学习提升统一多模态模型(如文本到图像、图像编辑、图像理解★ 417
tifaTIFA 是一个用于评估文本到图像生成模型忠实度的开源工具,由微软研究院开发。它通过将输入文本提示分解为若干原子问题,并利用视觉问答(VQA)模型对生成的图像进★ 189
Mobile-OMobile-O 是一个面向移动设备的统一多模态理解与生成框架,旨在让手机端也能高效运行图像理解、图像编辑和文本生成图像等任务。它解决的是大模型在资源受限设备上★ 159
HermesFlowHermesFlow 是一个多模态大语言模型(MLLM)项目,旨在弥合视觉理解与生成之间的鸿沟。它通过统一框架同时支持图像到文本(如描述、问答)和文本到图像(如★ 78
safe-clipSafe-CLIP 是一个针对视觉-语言模型的安全增强工具,主要解决 CLIP 类模型在图像生成和检索任务中可能生成或检索到 NSFW(不宜工作场所)内容的问题★ 68
Symposium2023Symposium2023 是一个用 Pascal 语言编写的多功能 AI 演示项目,整合了语音识别、文本转语音、语言翻译、OAuth2 认证、图像生成、人脸检★ 66