开源项目 · AIGC 工具
设计图 → 可编辑 PPT
把单张设计图重建为可编辑的 PowerPoint 幻灯片(背景、卡片、文本框、图片块)。
已开源 · 持续改进RESOURCES
01问题
现有截图转 PPT 工具只输出"一整张图"作为幻灯片,文字不可编辑、元素不可调整;不真正可编辑等于不可用。
02方案
两种模式:layout-assisted(接收外部 layout JSON 高保真重建)+ image-only(自动识别背景 / 卡片 / 图块 / 文本,RapidOCR + macOS Vision 双后端 OCR,按区域重跑提高小字稳定性)。
03我的职责
独立开发:架构设计、OCR 后处理、自动渲染策略。
01 · 背景与痛点
初版依赖单一 Swift OCR 脚本,真实图片上不稳定;小字文本识别后经常丢失样式(颜色 / 字号 / 加粗)。
02 · 产品设计与 Agent 架构
方案:两种模式:layout-assisted(接收外部 layout JSON 高保真重建)+ image-only(自动识别背景 / 卡片 / 图块 / 文本,RapidOCR + macOS Vision 双后端 OCR,按区域重跑提高小字稳定性)。
我的职责:独立开发:架构设计、OCR 后处理、自动渲染策略。
工作流设计
A[输入设计图] --> B{有 layout JSON?}\nB -- 是 --> C[Mode A 高保真重建]\nB -- 否 --> D[Mode B 图像分析]\nD --> E[OCR 双后端 + 区域重跑]\nE --> F[可编辑 PPTX + sidecar layout]
03 · 复盘
单图重建 PPT 的管线拆成‘布局检测 → 区域分类 → 元素重建’三阶段后,每种失败模式才各有归口(背景 / 卡片 / 文本框 / 图片块)。复盘:先给错误分类、再谈准确率,否则调参等于瞎调。
04 · 成果与产品思考
单命令 `python3 image_to_editable_pptx.py input.jpg -o output.pptx`;对干净的封面 / 标题卡 / 图+文 hero 布局表现稳定。
产品思考:工具的意义不是覆盖所有情况,而是把高频场景做深。
Open source · AIGC tool
Image to Editable PPT
Rebuild a single design image into an editable PowerPoint slide — background, cards, text boxes, image blocks.
Open source · IteratingRESOURCES
01Problem
Existing screenshot-to-PPT tools only output "one flat image" as the slide — text can't be edited, elements can't be adjusted; not truly editable means unusable.
02Approach
Two modes: layout-assisted (takes external layout JSON for high-fidelity rebuild) + image-only (auto-detect background/card/image-block/text via RapidOCR + macOS Vision dual-backend OCR, region re-run for small-text stability).
03My role
Solo development: architecture design, OCR post-processing, auto render strategy.
01 · Background & Pain
The first version depended on a single Swift OCR script, unstable on real images; small text often lost its style (color / size / bold) after OCR.
02 · Product Design & Agent Architecture
Approach: Two modes: layout-assisted (takes external layout JSON for high-fidelity rebuild) + image-only (auto-detect background/card/image-block/text via RapidOCR + macOS Vision dual-backend OCR, region re-run for small-text stability).
My role: Solo development: architecture design, OCR post-processing, auto render strategy.
Workflow design
A[输入设计图] --> B{有 layout JSON?}\nB -- 是 --> C[Mode A 高保真重建]\nB -- 否 --> D[Mode B 图像分析]\nD --> E[OCR 双后端 + 区域重跑]\nE --> F[可编辑 PPTX + sidecar layout]
03 · Pitfalls & Hard Lessons
[TBD: share 1-2 of the hardest debugging / cost-cutting / architecture decisions]
04 · Outcome & Product Thinking
Single command `python3 image_to_editable_pptx.py input.jpg -o output.pptx`; stable on clean covers, title cards, and image+text hero layouts.
Product thinking: A tool's value is not covering every case, but going deep on high-frequency ones.