generative-media-skills

让AI编码助手直接产出专业级图像视频音频,一站式生成媒体内容

这是一个面向AI编程助手的生成式媒体技能集,旨在为Claude、Copilot、Cursor等编码助手提供图像、视频、音频、语音等生成式媒体的生产级能力。项目基于研究验证的方法,将复杂的媒体生成流程封装为可复用的Agent技能和工具,解决AI助手在媒体创作中缺乏专业性和可控性的问题。核心能力包括:提供标准化的媒体生成接口、集成多种生成模型、支持工作流编排与参数调优,以及输出符合行业规范的媒体文件。通过将媒体生成的专业知识注入AI助手,使得开发者能在编码环境中直接完成从文本到图像、视频、音频的创作,提升内容生产效率。项目处于早期阶段,但已具备清晰的架构和扩展性。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 179
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队calesthio
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型agent,agentic-ai,ai,ai-audio,ai-video,claude,codex,copilot,cursor,generative-media,github-copilot,image-generation,open-source,openai,prompt-engineering,skill,text-to-speech,text-to-video,video-generation,video-production
GitHub 星标★ 179
30天Star增速
HF 下载量
上线时间2026-07-11 00:00:00
最近更新2026-09-20 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 基于研究验证的方法,生成质量有保障,非简单封装
  • 覆盖图像、视频、音频、语音多模态,能力全面
  • 与主流AI编码助手(Claude、Copilot、Cursor)深度集成,即插即用

不足之处

  • 项目处于早期阶段(123星),文档和社区生态待观察
  • 依赖外部生成模型API,可能带来额外成本和延迟

适用场景

  • 在编码环境中快速生成产品原型图或UI素材
  • 为视频脚本自动生成配图和配音,加速内容制作
  • 在开发文档中嵌入AI生成的示意图或演示视频

替代项目

ComfyUI、Stable Diffusion WebUI、LangChain

项目介绍

generative-media-skills 是智能体领域的开源项目,由 calesthio 开发,是 2026 年新上线的项目。

它收录于智能体分类,该分类目前共有 2,517 个项目,GitHub 星标数为 179。

项目仍在小幅维护中,最近一次代码更新于 2026-09-20。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:在编码环境中快速生成产品原型图或UI素材。同类可对比的替代方案包括 ComfyUI、Stable Diffusion WebUI、LangChain。

上一篇:skills

下一篇:open-dungeon

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 199 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12