Open-Interface

让大模型直接操控你的电脑,一句话完成复杂操作。

Open-Interface 是一个利用大语言模型(LLM)控制计算机的开源框架,旨在将自然语言指令转化为具体的桌面操作,实现“用嘴编程”或“用嘴操作电脑”。它解决了传统自动化脚本难以适应复杂、动态界面变化的问题,通过视觉理解和智能规划,让AI能像人一样“看”屏幕、“点”按钮、“输入”文字。核心能力包括:屏幕截图与元素识别、基于LLM的决策引擎、跨平台(Windows/macOS/Linux)的鼠标键盘控制、以及可扩展的插件系统。项目提供简洁的Python API,开发者可以快速构建自定义的AI代理或自动化工作流。目前处于成长阶段,社区活跃,但文档和生态尚在完善中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2723
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队AmberSahdev
所属国家
官网地址
定价模式free
价格说明开源项目,GPL-3.0许可,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议GPL-3.0
主要语言Python
技术栈/模型assistant,assistant-computer-control,automation,gpt,gpt4,gpt4v,gpt4vision,linux,llm,machine-learning,macos,openai,pyautogui,pyinstaller,python,self-driving,self-driving-software,windows
GitHub 星标★ 2723
30天Star增速
HF 下载量
上线时间2024-01-25 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 8 步

环境要求

  • Windows 10 / Ubuntu 20.04(官方已测试)/ macOS(含 Apple Silicon 与 Intel)
  • 方式二脚本运行需安装 Python 3.12 或更新版本
  • 一个可用的 OpenAI API Key(用于 GPT-4o,账号需充值,解锁 GPT-4o 最低 5 美元)
  • macOS 需授予辅助功能(控制键鼠)和屏幕录制权限

安装与启动步骤

  1. 1下载安装包

    打开最新 Release 页面,按系统下载 macOS 二进制、Linux zip 或 Windows zip。

  2. 2安装并启动程序

    macOS 解压后拖入 Applications 再启动;Windows 解压后把 exe 放到目标位置双击运行。

  3. 3授予系统权限

    macOS 首次启动会申请辅助功能与屏幕录制权限,若未弹出需到系统设置-隐私与安全性手动添加。

  4. 4克隆仓库(脚本方式)

    不想用安装包时可用源码运行,先克隆仓库并进入目录。

    git clone https://github.com/AmberSahdev/Open-Interface.git
    cd Open-Interface
  5. 5创建虚拟环境

    可选步骤,避免污染全局环境;pyenv 对 tkinter 支持异常,需自行排查。

    python -m venv .venv
    source .venv/bin/activate
  6. 6安装依赖

    在项目根目录安装 requirements.txt 中的全部 Python 依赖。

    pip install -r requirements.txt
  7. 7启动应用

    用 Python 直接运行主程序,脚本方式启动界面。

    python app/app.py
  8. 8配置 API Key

    右上角 Settings 填入 OpenAI Key;用 Gemini 或自定义 LLM 则在 Advanced Settings 选择模型并填写地址。保存后必须重启应用。

关键配置

配置项必填说明示例
OpenAI API Key是默认后端凭证,用于调用 GPT-4o 解析并执行指令sk-xxxxxxxxxxxxxxxx
Gemini API Key否在 Advanced Settings 选择 Gemini 模型后填入的替代后端凭证AIzaSyxxxxxxxxxxxx
Custom Base URL否自定义 OpenAI 风格后端的接口地址,如本地 Llava 服务http://localhost:8000/v1/
Model Name否Advanced Settings 中指定的自定义模型名称llava

如何确认成功

应用正常打开界面,Settings 中填好 Key 并重启后,输入自然语言指令可看到屏幕截图与自动键鼠操作。

常见问题

Q:macOS 提示“Open Interface cannot be opened”怎么办?

A:点击 Cancel,然后进入 System Preferences(系统设置)-> Security and Privacy(隐私与安全性),选择 Open Anyway(仍要打开)即可。

Q:用这个项目需要花钱吗?

A:需要。Open Interface 依赖 GPT-4o,需在 OpenAI 账户充值,解锁 GPT-4o 的最低预付费为 5 美元。

Q:填完 API Key 后没有生效?

A:首次设置 API Key 后必须重启应用;修改 Gemini 或自定义 LLM 设置后同样需要重启。

Q:接本地 Llama 等模型失败怎么排查?

A:API Key 输入框可填随机字符串如 xxx;base URL 末尾可能需要追加 /v1/。若接口非 OpenAI 风格,可用 litellm 之类的库做转换。

Q:Linux 和 Windows 支持哪些版本?

A:Linux 二进制目前仅在 Ubuntu 20.04 上测试过,Windows 二进制在 Windows 10 上测试过,其他版本未验证。

注意事项

  • 本项目通过模拟键鼠操作电脑,运行时请勿手动抢占鼠标键盘。
  • API Key 会保存在应用设置中,请勿在共享电脑上随意填写。
  • 必须授予屏幕录制权限,否则无法截图评估进度,代理会失效。
  • 自定义 LLM 需兼容 OpenAI API 风格,否则需额外做接口转换。

核心亮点

  • 纯视觉驱动,不依赖系统API,能适应各种桌面应用和网页界面
  • 基于LLM的意图理解,支持自然语言指令,无需编写复杂脚本
  • 跨平台支持,提供Python API,易于集成到现有AI工作流

不足之处

  • 执行速度和稳定性受限于LLM推理延迟和视觉识别精度
  • 文档和社区生态尚在早期,示例和最佳实践较少

适用场景

  • 自动化桌面软件测试,模拟用户操作
  • 为残障人士提供语音/文字控制电脑的辅助工具
  • 构建个人AI助理,自动完成文件整理、邮件发送等日常任务

替代项目

OpenInterpreter、Self-Operating Computer、UI-TARS

项目介绍

Open-Interface 是智能体领域的开源项目,由 AmberSahdev 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,723)位列前 30%,在智能体分类的 2,517 个项目里位列前 14%。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。GPL-3.0许可,可自行部署使用,无付费版本。

它主要面向的使用场景是:自动化桌面软件测试,模拟用户操作。同类可对比的替代方案包括 OpenInterpreter、Self-Operating Computer、UI-TARS。

上一篇:harness-books

下一篇:jadx-ai-mcp

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 199 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12