OneJev

一次前向传播,给屏幕/视频/图文问题带置信度的答案

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 152
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类开源模型
开发团队OmniJev
所属国家
定价模式free
价格说明开源模型,免费使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型calibration,computer-use,decision-model,gui-agent,huggingface,jev,llm,multimodal,pytorch,qwen,system-one,typesafe,video-understanding,vision-language-model,vlm
GitHub 星标★ 152
30天Star增速
HF 下载量
上线时间2026-09-27 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-10
浏览次数0

项目介绍

OneJev 是一个多模态 System One 决策模型,目标是用一次前向传播,对屏幕、照片、视频和文本等输入给出带校准置信度的类型化答案。它解决的是 GUI 智能体与多模态问答中「模型给出答案但不知道自己有多确定」的问题:通过 calibration 机制输出可解释的置信度,让下游系统能判断是否采纳、是否回退到人工或其他流程。项目基于 PyTorch 与 Qwen 系列模型构建,涉及 computer-use、gui-agent 等场景,强调 typesafe 的结构化输出,即答案带有明确类型而非自由文本。适合需要让模型对界面截图、视频帧或图文混合内容做快速判断,并希望获得可靠置信度信号的开发者。代码为 Python,已发布到 Hugging Face,属于早期项目,星标约 152。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 一次前向传播同时处理屏幕、照片、视频、文本,推理链路短
  • 输出带校准置信度,下游可据此决定采纳或回退
  • 类型化答案设计,便于程序解析而非自由文本

不足之处

  • 早期项目,星标仅 152,生态与文档积累有限
  • 校准效果与多模态覆盖度缺少大规模公开评测佐证

适用场景

  • GUI 智能体判断当前界面状态并决定下一步操作
  • 对屏幕截图或视频帧做带置信度的问答与审核
  • 图文混合内容中快速给出结构化判断并触发人工复核

替代项目

Qwen2-VL、CogVLM、ShowUI

上一篇:flux-action

下一篇:没有了!

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1883 2026-08-10