本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:
- 我的帖子已经打上 开源推广 标签: 是
- 我的开源项目完整开源,无未开源部分: 是
- 我的开源项目已链接认可 LINUX DO 社区: 是
- 我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
- 以上选择我承诺是永久有效的,接受社区和佬友监督: 是
以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出
前情提要
本人并不爱写PPT,但工作需要写PPT,于是忍无可忍!
历时半个月,我终于手搓了一个专注于让Agent按照模板生成PPT的Skill
仓库: GitHub - CxyZyr/PPTX-Template-Skills: Two composable skills that turn a PowerPoint template into a freshly filled deck — without an agent ever hand-reading shape indices off a slide. Parsing produces a portable, machine-readable contract; generation fills that contract page by page while preserving the template's original visual logic. · GitHub
执行流程
本项目实际包含两个skill,一个负责解析模板,一个负责使用解析后的产物适配并生成新的PPT。项目对PPT中的大部分可填元素进行了全面的解析,非解析部分遵循模板。支持自动替换图像以及Icon图标,图像部分采用Tavily API,配置对应api-key即可。
模板.pptx ─\[解析\]→ spec.json ─\[生成\]→ 填好的新 PPT
- 解析 skill:把模板的每个形状分类(标题/正文/卡片/图标/logo/配图/图表/表格),识别每页角色,输出一份机器可读的「填充契约」
spec.json
- 生成 skill:读契约,按页填文字 → 图标 → logo → 配图,保留模板原本的几何、对齐、主题色、段落样式
测试结果
在几十个模板上进行了适配性测试,基本能够稳定产出文件,但任然会存在一些小瑕疵,需要人工进行细微的修正。支持迁移至弱模型,已使用deepseek-v4-flash测试,消耗如下:
- Total duration (API): 5m 2s
- Total code changes: 133 lines added, 535 lines removed
- deepseek-v4-flash: 69.7k input, 28.9k output, 4.0m cache read, 0 cache write
可视化展示:


使用提示以及限制
- 配合 Claude Code / Codex 这类带 skill 机制的 agent 用 —— 把仓库里
skills/ 丢进 skill 目录,直接跟它说「按 skill 流程,用这个模板生成 PPT」就行
- 收尾过程涉及视觉校验,模型不支持会自动跳过,如果打算自行进行微调,也可以要求agent无需执行视觉校验,以节省生成时间
- 图像部分建议预先作为材料提供给Agent,优先使用已有图像。如果未提供,skill的执行过程中会使用API从网络检索图像(匹配机制较为严格,实际很难命中),图像未命中则保持模板图像不变
- Icon这类小图标的设计思路来源于前端开发中的icon库,能够解决PPT中一些小图标的适配问题
- 尽管skill中预先设计了较多的执行边界,动态适配策略。在实际测试中可能仍然会产生一些疏漏,需要人工进行小批量的矫正
- 弱模型尽管已经证明可以按照skill产出对应文件,但是依然可能会偷懒
最后
欢迎 Star / Issue / PR。也欢迎拿自己的奇葩模板来试,解析翻车了开 issue 我瞅瞅!