ergouzi-image-gen:自研图片/视频模型专用 Skills
安装 ergouzi-image-gen 和 ergouzi-video-gen,通过自然语言生成、编辑并下载图片或视频。
两个 Skill 分别做什么
公开仓库:https://github.com/aiman-labs/ergouzi-agent-skills
| Skill | 支持的模型 | 适用任务 |
|---|---|---|
ergouzi-image-gen | e-image、e-image-edit、e-image-ideogram、e-image-try-on、e-image-upscale、ergouzi/e-rmbg | 生图、图片编辑、文字排版、虚拟试衣和放大 |
ergouzi-video-gen | e-video、e-video-animate、e-video-avatar、e-video-replace | 视频生成、动作驱动、数字人口播和人物替换 |
两个 Skill 共支持 6 个图片模型和 4 个视频模型。它们会替 AI 处理本地媒体文件、任务提交、状态轮询和结果下载。
在 Codex 中生图需要两种密钥
完整链路需要两把用途不同的密钥:
- Codex 的 GPT/文本模型密钥:按正常方式配置给 Codex。
- Skill 的自研模型 API 密钥:让AI配置给
ergouzi-image-gen与ergouzi-video-gen,用于驱动 Skill 使用图片/视频模型。
[!IMPORTANT] 在 Codex 中使用生图或生视频需要两把密钥,Skill 密钥 不是 gpt 模型密钥,不能写入 Codex 的
config.toml。
为什么 Skill密钥 必须单独配置
自研模型的接口协议,不兼容当前的openai协议
使用 Codex 自动配置
已经配置好 Ergouzi 中转的 Codex,可以直接复制下面的完整提示词:
请根据 https://doc.ergouzi.life/ai-guides/ergouzi-image-gen
将 ergouzi-image-gen 与 ergouzi-video-gen skill 安装到 Codex ,
url: https://api.ergouzi.life,
密钥:sk-xxxx(你自己在网站创建的图片/视频分组密钥)
完成后生成一张图片示例,并告诉我图片和视频各怎么使用。
[!IMPORTANT] Claude Code 或其他 Agent,都可以将安装本 skill 来使用。
生成第一张图片
完成安装和密钥配置后,直接告诉 AI:
使用 ergouzi-image-gen 生成一张 16:9 图片:
雨夜上海街头,电影感摄影,霓虹灯倒映在湿润路面,细节丰富,无文字、无水印。
AI 会读取 Skill,提交一次任务、等待完成,并把图片下载到:
output/ergouzi-image-gen/
生成第一段视频
直接告诉 AI:
使用 ergouzi-video-gen 生成一段 5 秒、16:9 的视频:
清晨云海缓慢流过山谷,电影感航拍。
默认视频输出目录是:
output/ergouzi-video-gen/
成功后应能看到模型 ID、task_ 开头的任务 ID、succeeded 状态和文件保存路径。
使用本地图片、视频或音频
需要编辑图片、虚拟试衣、图生视频或数字人时,可以把本地文件的绝对路径直接交给 AI,并明确目标模型和要求。例如:
使用 ergouzi/e-image-edit 编辑 C:\images\product.png:
保持产品不变,把背景换成干净的摄影棚白色背景。
使用 ergouzi/e-video-avatar,把 C:\media\person.png 和 C:\media\voice.mp3
生成一段 720p 口播视频。
Skill 支持 JPEG、PNG、WebP,以及模型所需的 MP4、MP3、WAV、FLAC 文件。
常见问题
密钥验证失败
- 确认密钥所属分组支持目标图片或视频模型。
- 确认密钥没有多余空格、没有失效。
- 不要默认认为普通文本模型分组一定支持自研媒体模型,以模型广场和控制台显示为准。
系统找不到 Python
安装 Python 3.10 或更高版本,并确认 python --version 或 python3 --version 可以正常执行。
任务一直没有返回文件
先记录任务 ID,再用对应 Skill 的 status --wait --download 恢复原任务。