vlms
本站收录 10 个带「vlms」标签的 AI 开源项目
anomaly-detection-resources这是一个异常检测领域的精选资源清单,汇集了书籍、论文、视频和工具箱,覆盖从经典统计方法到深度学习、大语言模型(LLM)和视觉语言模型(VLM)的最新进展。项目持★ 9,406
oumioumi 是一个专注于开源大语言模型(LLM)微调、评估和部署的全流程工具包。它旨在简化从模型选择到生产部署的复杂流程,支持 Qwen、Gemma、Llama ★ 9,392
docextdocext 是一个本地部署的、无需 OCR 的非结构化数据提取与 Markdown 转换工具包,同时提供基准测试能力。它主要解决企业从 PDF、Word、扫描★ 2,086
Awesome-Jailbreak-on-LLMs这是一个聚焦大语言模型越狱攻击方法的精选资源库,系统整理了学术界和工业界关于LLM安全漏洞的最新研究。项目收集了论文、代码、数据集、评估工具和分析报告,覆盖从提★ 1,659
VLM3VLM3 是论文“VLM³: Vision Language Models Are Native 3D Learners”的官方实现,旨在让视觉语言模型(VLM★ 436
HallusionBenchHallusionBench 是一个针对多模态大语言模型(如 GPT-4V、LLaVA-1.5)的图像上下文推理基准测试集,旨在揭示模型在视觉问答中因视觉错觉或★ 343
openai-scala-clientopenai-scala-client 是一个用 Scala 编写的 OpenAI API 客户端,同时也支持 Anthropic、Gemini、AWS Bed★ 250
FM-AD-SurveyFM-AD-Survey 是一个持续更新的综述论文仓库,专注于大型基础模型(Foundation Models)在自动驾驶场景生成与分析中的应用。它系统收集和整★ 238
GutenOCRGutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版式、手写体或低质★ 191
GutenOCRGutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版面、手写体、多语★ 191