Photo-agents

让AI记住屏幕所见,自写技能,越用越聪明地操控电脑。

Photo-agents 是一个面向计算机操作场景的自主进化智能体框架。它解决的是传统 LLM 智能体缺乏长期记忆和技能积累能力的问题,核心创新在于视觉锚定的分层记忆系统(Vision-grounded layered memory)和智能体自编写技能(self-written skills)。该框架允许智能体通过视觉信息感知屏幕状态,将交互经验分层存储,并自动生成可复用的操作技能,从而在后续任务中无需重复学习。项目基于 Python 实现,强调自主性和进化性,适合构建能持续适应复杂桌面环境的自动化助手。目前处于早期阶段,但设计理念新颖,为计算机使用类智能体提供了新的记忆与技能管理范式。

开源 free 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 674
维护状态 维护中
是否开源
定价模式 free

项目数据

分类智能体
开发团队jmerelnyc
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型agent-memory,ai-agents,autonomous-agents,computer-use,llm,photo-agents,photographic-memory,python,self-evolving-agents,vision-agents
GitHub 星标★ 674
30天Star增速
HF 下载量
上线时间2026-05-04 00:00:00
最近更新2026-09-18 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 视觉锚定记忆:将屏幕截图与操作关联,记忆更贴近真实使用场景
  • 分层记忆架构:区分短期/长期记忆,提升信息检索效率
  • 自进化技能:智能体可自动生成并更新操作技能,减少人工干预

不足之处

  • 早期项目,文档和社区支持尚待完善
  • 依赖视觉模型,对计算资源要求可能较高

适用场景

  • 桌面自动化:自动完成重复性软件操作任务
  • 个人助理:根据屏幕上下文提供实时操作建议
  • 软件测试:自主探索UI并记录操作路径

替代项目

AutoGPT、BabyAGI、CogAgent

项目介绍

Photo-agents 是智能体领域的开源项目,由 jmerelnyc 开发,是 2026 年新上线的项目。

它收录于智能体分类,该分类目前共有 2,499 个项目,GitHub 星标数为 674。

项目仍在小幅维护中,最近一次代码更新于 2026-09-18。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:桌面自动化:自动完成重复性软件操作任务。同类可对比的替代方案包括 AutoGPT、BabyAGI、CogAgent。

上一篇:dreamgraph

下一篇:Foundry

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 195 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12