ergouzi-image-gen:自研图片/视频模型专用 Skills

安装 ergouzi-image-gen 和 ergouzi-video-gen,通过自然语言生成、编辑并下载图片或视频。

两个 Skill 分别做什么

公开仓库:https://github.com/aiman-labs/ergouzi-agent-skills

Skill支持的模型适用任务
ergouzi-image-gene-image、e-image-edit、e-image-ideogram、e-image-try-on、e-image-upscale、ergouzi/e-rmbg生图、图片编辑、文字排版、虚拟试衣和放大
ergouzi-video-gene-video、e-video-animate、e-video-avatar、e-video-replace视频生成、动作驱动、数字人口播和人物替换

两个 Skill 共支持 6 个图片模型和 4 个视频模型。它们会替 AI 处理本地媒体文件、任务提交、状态轮询和结果下载。

在 Codex 中生图需要两种密钥

完整链路需要两把用途不同的密钥:

  1. Codex 的 GPT/文本模型密钥:按正常方式配置给 Codex。
  2. Skill 的自研模型 API 密钥:让AI配置给 ergouzi-image-gen 与 ergouzi-video-gen,用于驱动 Skill 使用图片/视频模型。

[!IMPORTANT] 在 Codex 中使用生图或生视频需要两把密钥,Skill 密钥 不是 gpt 模型密钥,不能写入 Codex 的 config.toml。

为什么 Skill密钥 必须单独配置

自研模型的接口协议,不兼容当前的openai协议

使用 Codex 自动配置

已经配置好 Ergouzi 中转的 Codex,可以直接复制下面的完整提示词:

请根据 https://doc.ergouzi.life/ai-guides/ergouzi-image-gen
将 ergouzi-image-gen 与 ergouzi-video-gen skill 安装到 Codex ,
url: https://api.ergouzi.life,
密钥:sk-xxxx(你自己在网站创建的图片/视频分组密钥)
完成后生成一张图片示例,并告诉我图片和视频各怎么使用。

[!IMPORTANT] Claude Code 或其他 Agent,都可以将安装本 skill 来使用。

生成第一张图片

完成安装和密钥配置后,直接告诉 AI:

使用 ergouzi-image-gen 生成一张 16:9 图片:
雨夜上海街头,电影感摄影,霓虹灯倒映在湿润路面,细节丰富,无文字、无水印。

AI 会读取 Skill,提交一次任务、等待完成,并把图片下载到:

output/ergouzi-image-gen/

生成第一段视频

直接告诉 AI:

使用 ergouzi-video-gen 生成一段 5 秒、16:9 的视频:
清晨云海缓慢流过山谷,电影感航拍。

默认视频输出目录是:

output/ergouzi-video-gen/

成功后应能看到模型 ID、task_ 开头的任务 ID、succeeded 状态和文件保存路径。

使用本地图片、视频或音频

需要编辑图片、虚拟试衣、图生视频或数字人时,可以把本地文件的绝对路径直接交给 AI,并明确目标模型和要求。例如:

使用 ergouzi/e-image-edit 编辑 C:\images\product.png:
保持产品不变,把背景换成干净的摄影棚白色背景。
使用 ergouzi/e-video-avatar,把 C:\media\person.png 和 C:\media\voice.mp3
生成一段 720p 口播视频。

Skill 支持 JPEG、PNG、WebP,以及模型所需的 MP4、MP3、WAV、FLAC 文件。

常见问题

密钥验证失败

  • 确认密钥所属分组支持目标图片或视频模型。
  • 确认密钥没有多余空格、没有失效。
  • 不要默认认为普通文本模型分组一定支持自研媒体模型,以模型广场和控制台显示为准。

系统找不到 Python

安装 Python 3.10 或更高版本,并确认 python --version 或 python3 --version 可以正常执行。

任务一直没有返回文件

先记录任务 ID,再用对应 Skill 的 status --wait --download 恢复原任务。