⏳ This skill is pending AI review.
Scores will appear once the review pipeline completes.
gpt-image2-ppt
Generate visually striking PPT slides via OpenAI's gpt-image-2 -- use any style in styles/<collection>/STYLE_ID.md or mimic a user-supplied .pptx template; outputs high-res slide PNGs and a 16:9 .pptx. Use when the user asks to make a presentation, slides, deck, pitch deck, investor PPT, magazine-style PPT, or 做一份 PPT / 生成幻灯片 / 用 gpt-image 生成 PPT / 按这个模板生成 PPT.
Choose how to use this skill
You do not need every option. Choose the path your AI client supports. The stable page stays the same; versioned files are immutable.
1. Native installer
This listing has no registered native installer command. Use the complete package or source fallback below, depending on what your client supports.
Do not guess an installer command or replace an existing version without reviewing the diff.
2. Complete package recommended
Download the ZIP when available. It includes SKILL.md plus the references, security notes and version metadata.
No complete ProSkills package is published for this listing yet.3. Prompt-only
Copy the prompt above when the agent can read the stable page or when you want to adopt the workflow without installing a skill.
Need only the instruction file?
Download SKILL.md only if your client requires a single file. The complete ZIP is safer for a full installation because it preserves the references and release context.
No path installs or executes anything by itself. Your agent still needs access to the project files. Before updating, compare the installed version and review the diff.
// RATINGS
Not yet listed on ClawHub or SkillsMP
// README
gpt-image2-ppt-skills
用 OpenAI gpt-image-2 一键生成高审美、高完成度的 PPT。
Claude Code / Codex / OpenClaw / Hermes 等支持 Skills 的 agent 均可原生使用。装进 agent 后,用一句自然语言生成 16:9 高清图片 + 打包好的 .pptx,也可以仿任意 .pptx 模板出全新内容。
它不走传统“模板填字”的路线,而是充分发挥 gpt-image-2 的审美、构图和排版能力,把每一页都当成完整视觉稿生成,力求让输出从封面到内页都足够精美、统一、可直接展示。
同时,项目对图片型 PPT 的后续编辑做了专门优化:默认模式仍以整页视觉稿保证 gpt-image-2 的构图与审美;如果用户明确要求文字、图形和素材可单独编辑,可以启用默认关闭的可编辑模式,把完整视觉稿重建为 PowerPoint 原生文本、基础图形、连接线和独立图片层。
🌐 English → docs/README.en.md
🎬 效果演示:喂一张模板,仿出一套新内容
🧩 可编辑模式示例(默认关闭)
可编辑模式不会限制 gpt-image-2 的初始设计:模型仍先生成包含完整文字与主视觉的成品页,再把已知文字、基础图形和复杂素材重建成 PowerPoint 对象。
这个示例的 PPTX 实测包含 13 个可选对象:5 个原生文本、6 个原生 shape、1 个 clean plate,以及 1 个可移动、可缩放的毛绒角色与粽子冰淇淋独立图片层。文字和基础图形可以直接在 PowerPoint 中修改,复杂主视觉仍保留 gpt-image-2 的完整质感。
需要可编辑交付时,可以直接这样说:
帮我生成一份可编辑模式的 PPT。文字和基础图形要能在 PowerPoint 里直接修改,复杂主视觉要能单独移动,同时尽量保留 gpt-image-2 的完整设计感。
只有明确提出“可编辑模式”“文字可以改”“元素可以拆开”或类似要求时,Skill 才会执行对象级重建。如果不特别说明,默认仍走视觉效果优先的整页图片模式。
⚠️ 可编辑模式需要本机具备 PPTX 回渲染能力。 与模板克隆模式相同,运行前必须有可执行的 Windows PowerPoint、macOS Keynote 或 LibreOffice。用户无需执行检查命令,只要像上面那样用自然语言说明需要可编辑交付;Skill 会自动检查环境,生成后把
-editable.pptx回渲染到editable_renders/page-XX.png,再由多模态 AI 逐页看图验收。没有可用渲染后端时,不会把未经回渲染检查的可编辑文件标记为成功。
可编辑重建采用效果优先、生成轮次受控的策略:允许多轮本地预检和回渲染;优先用字体、坐标、裁切等确定性修复,其次进行原像素提取与遮挡补全,只对失败的复杂图层进行 AI 重绘,只有整体构图失败时才重新生成整页。这样不会为了追求单轮而牺牲效果,也不会因为局部问题反复重做整页。
🚀 快速开始
1. 让 AI 安装 Skill
把下面这段话发给 Claude Code、Codex、OpenClaw、Cursor、Trae、Hermes Agent,或其他支持 Skills 的 AI 助手:
帮我安装 gpt-image2-ppt-skills: https://github.com/JuneYaooo/gpt-image2-ppt-skills
AI 会根据当前环境完成安装并提示你重启。
2. 安装后直接说需求
普通生成
帮我做一份关于「AI 如何改变内容创作」的 6 页 PPT,先生成一页封面给我确认,整体风格要有高级科技感。
仿模板
我上传了
company-template.pptx,请参考它的版式、配色和视觉语言,做一份关于「年度产品战略」的 8 页 PPT。
如果手头没有现成模板,也可以打开 SlideCraft Template Gallery,在网页中浏览并复制喜欢的模板,再把复制的模板内容直接发给 AI 使用。
可编辑交付
帮我生成一份可编辑模式的 PPT。文字和基础图形要能直接修改,复杂主视觉要能单独移动,同时尽量保留 gpt-image-2 的完整设计感。
AI 会整理内容、先做单页视觉确认、再生成完整 PPT,并把图片、PPTX 和输出目录交给你。
✨ 能做什么
- 🎨 在线模板画廊 — 集中展示目前收录的模板,可按场景和风格搜索、筛选,复制喜欢的模板 Prompt 后直接交给 AI 使用
- 🧬 模板质量验证 — 候选模板会实际生成封面、章节、内容和数据页,检查整套一致性、可读性和布局效果后再入库
- 🧭 Prompt Recipes 示例库 —
examples/提供产品发布、融资路演、周报、课程课件、论文答辩、读书分享等常见场景的slides_plan.md起步模板 - 🪄 模板克隆模式 — 丢一个
.pptx进去,AI 会参考原模板的版式、配色和插画语汇,像上面那张图一样换成新内容 - 🎯 自然语言精准编辑 — 直接说“改第 3 页副标题”“删掉页脚”“把三个数据换成新数字”,AI 会通过图生图只重生成目标页,尽量保持原风格和版式不变
- 🎮 双产出 — 每页 PNG 高清原图 + 16:9
.pptx直接用 - ⚡ 默认 10 路并发出图 — 10 页 ~30 秒出完
- 🧪 先看一页再跑全量 — 默认建议先出封面给你确认,满意后再生成整套
- 🧾 可追踪、可回滚 — 修改过哪些页、生成过哪些版本都能追踪,方便继续改
- 🖼️ 真实素材双模式 — 用户给的真实图默认保真嵌入;用户明确允许时,也可以作为参考图融合重绘
- 🧩 可编辑模式(默认关闭) — 用户明确要求时,把文字、基础图形、连接线和复杂主视觉拆成可单独编辑的 PowerPoint 对象
✅ 适合哪些用户场景
| 场景 | 适合程度 | 说明 |
|---|---|---|
| 从主题生成一套新 PPT | 很适合 | 适合汇报、路演、培训、课程、产品介绍。 |
| 按公司模板仿一套新内容 | 很适合 | 上传 .pptx 模板,先出封面确认,再跑全量。 |
| 改标题、副标题、日期、页脚 | 很适合 | 当前最稳定的编辑场景。 |
| 更新数据卡片和关键数字 | 适合 | 可批量改,但交付前要逐项核对数字。 |
| 只改复杂多页 PPT 的某一页 | 适合 | 只更新目标页,其他页不重新生成。 |
| 密集表格、财报、法务长文 | 不建议直接承诺 | 小字和数字需要更严格人工验收。 |
🎨 在线模板画廊
目前收录的模板统一通过 SlideCraft Template Gallery 展示。你可以按场景和风格搜索、筛选,查看模板的真实生成效果;选中喜欢的模板后,复制 Prompt 并直接交给 Codex、Claude Code 或其他 AI 助手使用。
点进任意模板后,可以逐页预览整套版式,并复制模板 ID 或完整 Prompt:
点击图片进入对应页面。模板会持续补充,README 不再维护容易过时的完整模板清单。
模板库不只看单张封面:新模板会用封面、章节、内容和数据等多类页面验证整套效果,并与现有版本对照。只有整体质量更好且关键页面没有明显退步时才会更新正式模板。
使用画廊风格时,复制喜欢的 Prompt 交给 AI 即可;需要沿用自己的品牌模板时,直接上传 .pptx,建议先生成一页确认效果,再生成整套 PPT。
🧪 修改能力测评
如果你关心“到底能不能稳定改 PPT”,先看这份面向用户的图文测评:
docs/edit_guide.md— 标题替换、日期修改、删除页脚、数据更新、新增 logo、复杂多页只改一页,以及当前不足和交付前检查清单
核心结论:
| 能力 | 当前表现 |
|---|---|
| 改短文本 | 稳定,适合日常交付。 |
| 改多个明确元素 | 可用,建议一次说清楚“其他不要动”。 |
| 改数据页 | 可用,但必须核对数字。 |
| 加小图标 / logo | 可用;真实品牌 logo 需要提供素材。 |
| 原生 PPT 对象级编辑 | 默认模式仍是整页图片;明确启用可编辑模式后,可输出原生文本、shape、connector 和独立图片层。 |
🛠 手动安装与高级配置
普通用户优先使用上面的自然语言安装方式。需要自己管理仓库和环境时,可以手动安装:
git clone [email protected]:JuneYaooo/gpt-image2-ppt-skills.git
cd gpt-image2-ppt-skills
bash install_as_skill.sh --target claude # Claude Code
# 或
bash install_as_skill.sh --target codex # Codex
脚本会把 skill 装到对应 agent 的目录:
- Claude Code:
~/.claude/skills/gpt-image2-ppt-skills/ - Codex:
~/.codex/skills/gpt-image2-ppt-skills/
如果你走 API 直连模式,需要给 agent 注入环境变量。推荐使用当前 agent 框架的标准配置,而不是把密钥写进业务项目根目录 .env:
- Claude Code:用户级
~/.claude/settings.json,或项目级.claude/settings.local.json - OpenClaw / 自定义 Agent:用
apiKey/ env reference 引用系统环境变量 - CI / 服务器:用系统环境变量、Docker Compose、Kubernetes Secret 或 CI Secret
- standalone CLI:可设置
GPT_IMAGE2_PPT_ENV=/path/to/private.env,或使用 skill 安装目录下的.envfallback
# 变量名如下:
OPENAI_BASE_URL=https://api.openai.com # 或任意 OpenAI 兼容中转
OPENAI_API_KEY=sk-... # 必需
GPT_IMAGE_MODEL_NAME=gpt-image-2
GPT_IMAGE_QUALITY=high # low / medium / high / auto
配置优先级固定为:当前进程环境变量 > 平台注入的 gpt-image2-ppt_* 变量 > GPT_IMAGE2_PPT_ENV / skill 目录下的 .env;JULING_GPT_IMAGE2_* 只作为没有对应 OPENAI_* 配置时的兼容 fallback,不会覆盖显式配置。
在 Codex 里如果当前 agent 自带原生图片生成能力,可以直接走
SKILL.md里的原生路径,不必配置OPENAI_API_KEY。🔒 不会误吃密钥:脚本只读取当前进程环境、平台注入变量、显式
GPT_IMAGE2_PPT_ENV和 skill 安装目录.envfallback,不会向上递归读调用者项目目录的.env。🪄 模板克隆模式和可编辑模式都需要本机可执行的 PPTX 渲染后端(Windows PowerPoint / macOS Keynote / LibreOffice)。模板克隆需要先把模板转成图片供 AI 看版式;可编辑模式需要把交付文件重新转成图片供 AI 验收。
render_template.py --check会执行一个最小真实转换,而不是只检查程序版本;如果当前环境不支持,AI 会提示安装可用后端。模板克隆还可以改用手动导出的模板页面图片。
模板克隆模式下,skill 需要先"看懂"你的 .pptx 模板的视觉风格。如果你的 AI 助手本身就是多模态的(Claude Code 走 Claude Opus/Sonnet,Codex 走 GPT 多模态等),agent 会直接自己看图抽取风格,生成带 reference_image 的 template_profile.json 后通过 --template-profile 传给 CLI,不需要额外配置。
只有当你用的 agent 是纯文本模型时(例如只接入 DeepSeek 文本模型),才需要配下面这组环境变量,走一个独立的多模态模型来分析模板:
# 可选:模板克隆的 vision 分析
// HOW IT'S BUILT
KEY FILES

