摘要:这周字节"豆包工作"、阿里"千问办公"接连抢办公入口,PPT 成了各家的兵家必争之地。可你有没有发现:真到了周会要上台那一刻,手里常常只有一份客户发来的 PDF,一句"帮我把 PDF 做得能改、能讲"就卡住三四个工具来回倒手。这篇讲一个省事的做法——给 Agent 装一个能把 PDF 转成可编辑 PPT 的 skill,让"只要有个 PDF,一分钟到能讲课的幻灯片"这件事闭环。
一、办公 Agent 大战,战火偏偏烧在 PPT 上
最近一周,办公入口的争夺明显加码。8 月 25 日字节正式把"豆包工作"摆上台面,主打文档、表格、PPT 多内容生成,还能"指哪改哪"并且跟飞书上下文打通;阿里把 QoderWork、悟空、MuleRun 整合成"千问办公",腾讯的 WorkBuddy、百度"搭子"也都挤进了这个赛道。你会发现一个共同点:这些产品宣传页面里,PPT 能力都是最先被拿出来演示的那一屏。
原因很直白。聊天式 AI 已经普及,下一步的差异化在"能不能直接交出一份成品"。而在职场里,最高频的成品交付物,恰恰就是幻灯片。
(一)为什么办公 Agent 第一个要交的成品是 PPT
汇报、方案、培训、对外路演,几乎都落在 pptx 这种格式上。文档性强一点的可以接受 Word,但真正的"上台讲"环节,PPT 是唯一且必须的。办公 Agent 想证明自己"会干活",最容易被感知的场景就是:你一句话,它给你一版能改、能讲、能发给对外的幻灯片。
(二)可客户发的偏偏是 PDF
但现实里,需求方发过来的十有八九不是 pptx,而是 PDF。合同扫描件、产品手册、别人家整理好的方案报告、外网的只读资料——到了你手里全是"只能看、不好改"的 PDF。你想让它变成能继续编辑、能再加你公司品牌、能上台讲的 PPT,这一步就卡住了。
二、从 PDF 到能讲的 PPT,中间隔着"编辑权"
很多人以为"PDF 转 PPT"就是把 PDF 当图片贴进幻灯片,那其实是另一种东西——PDF 转图片流,转出来的每页都是一张静态图,字体、文字、数据全锁死了,想改一个字都要重新画。真正能用的转 PPT,是要把 PDF 里的段落、标题、文字重新组织进可编辑的文本框。
(一)两种"转 PPT"的本质差别
| 方式 | 输出形态 | 能不能改文字 | 能不能当空白模板复用 |
|---|---|---|---|
| PDF 转图片再贴 | pptx 里的图 | 不能,改一个字重画 | 不推荐 |
| PDF 转可编辑 PPT | pptx 里的文本框/表格 | 能,直接编辑 | 推荐 |
所以做这个转换的时候,要选真正"识别内容、重建对象"的方式,而不是简单贴图。这也是我后面接 Skill 时重点看的一点。
(二)把"转 PPT"装进 Agent,它能顺手接的是全流程
当 Agent 有了"PDF → 可编辑 PPT"这一步,后续就顺产了:先转成 pptx,再用 AI 做排版、补图表、对文案,最后导出或直接讲。Agent 的路径从"读了一个 PDF,只能总结两句",变成"给一个 PDF 交付,可上台"。
三、实操:一句话,把客户 PDF 变成能讲的 PPT
下面这套是我按 SkillHub 上该 Skill 的官方接入说明整理的落地流程,字段与枚举均对官网真实参数。核心就三步:装 Skill → 上传 PDF 建转换任务 → 下载可编辑 PPTX,再交给演示类能力去成稿。
第一步·装什么:按官网说明认准三个枚举
在 Agent 里挂的,是你需要先到 SkillHub 安装 foxit-pdf365-convert 这一步。这个 Skill 的功能描述写得很清楚——PDF 文档格式转换(PDF转Word、PDF转PPT、压缩PDF)。要点:转 PPT 要选能识别 PDF 文字层级的转换类型,而不是简单贴图。官方 JobType 对照表里就三档,一眼能对上:
| 枚举(JobType) | 说明 | 输出扩展名 |
|---|---|---|
PDF_2_WORD | PDF 转 Word | .docx |
PDF_TO_PPT | PDF 转 PPT | .pptx |
COMPRESS_PDF | 压缩 PDF | .pdf |
拿到接入说明,核心就一句话:上传 PDF 拿 fileUrl,再按目标类型创建转换任务。SkillHub 页面上真实写明了客户端要带的鉴权头和一个官方上传端点:
# 福昕 PDF 转换 Skill 官方上传接口(来自 SkillHub 说明)
POST https://open.pdf365.cn/documentConvert/upload
Content-Type: multipart/form-data
X-API-KEY: <你的 PDF365-MCP- 开头完整 Key>
# form-data 字段:file = 你的 .pdf(≤100MB)
# 成功返回:{ "data": { "fileUrl": "..." }, "code": 0, "msg": "success" }
第二步·接回来:用官方三个 MCP 工具跑通"上传→转换→下载"
SkillHub 页面提供了 Skill 打开后可直接调用的 MCP 工具签名,一共三个:createConvertTask、getConvertTaskStatus、downloadConvertResult。PDF 转 PPT 的完整调用链,就是这三次(下面代码按官网返回字段标注,属通用过程示意):
# ① 创建转换任务:传入上传拿到的 fileUrl + 目标类型 PDF_TO_PPT
createConvertTask(fileUrl, jobType="PDF_TO_PPT")
# 成功返回 data.taskId=任务ID
# ② 轮询任务状态(间隔约 3 秒)
getConvertTaskStatus(taskId)
# 返回 WAITING / RUNNING 则继续等;
# 返回 FINISH 且 success=true 说明转完了
# ③ 下载结果
downloadConvertResult(taskId)
# 有额度:返回 downloadUrl,直接拿 .pptx
# 无额度:返回报文里带支付页链接,完成后再次调用本工具
注意官网一个细节:文件格式只收 .pdf,且 ≤100MB。拿到 downloadUrl 后把 .pptx 落回原文件目录(如 报告.pdf → 报告.pptx)就闭环了。这三步串起来,就是 Agent「PDF → 可编辑 PPT」的落地路径。
第三步·跑通最小闭环
最小闭环就是一句话:客户发来 PDF → Agent 转可编辑 PPT → 你改两处 → 上台。我建议第一次就拿一份 5 页左右的 PDF 试,看看从"收到文件"到"能上台的 PPTX"一共几步、每个坑记下来。
四、避坑:这类转换最容易在哪三处翻车
(一)贴图充数,把"可编辑"做成"只能看"
最常见的坑,就是转出来是整页图片,PPT 里全是位图。判断也很简单:点一下文字,看能不能选中、能不能改。不能选 = 不可编辑 = 白转。
(二)版式错乱,表格和分页丢
带复杂表格、目录的 PDF 转换后,偶尔会出现排版位移。别指望一次完美,走过一遍后记下这份 PDF 的特点,下回同类输入直接命中。
(三)以为转完就完事,忘了还要"给别人改"
PPT 是协作产物。转出来之后一定要确认对方拿到的是能编辑、能传回给你的 .pptx,而不是又回到一张不能再改的图。
五、FAQ:被问得最多的 5 个问题
Q1:PDF 转 PPT 和 PDF 转 Word 是一个东西吗?
不是。前者输出 .pptx 幻灯片格式,适合"讲";后者输出 .docx 文档,适合"写"。办公 Agent 里两者分工很清晰,按交付物类型选即可。
Q2:转出来的 PPT 文字能改吗?
取决于能不能识别内容。真正的"内容转"会保留可编辑文本,"贴图转"只能看到图片。推荐优先选可编辑的那种。
Q3:这种 Skill 一般装在哪类 Agent 里?
凡是能挂外部工具/Skill 的 Agent 都能用,比如 VS Code、Claude Code、Cursor、WorkBuddy 这类具备工具接入能力的终端。关键不在装哪,在于"需要时能自动调"。
Q4:客户只给 PDF,我是不是必须手动转成 PPT 再做?
不必。把「PDF → PPT」做成 Skill 是标准的 Agent 一步,让 Agent 先转、再渲染、再打磨。转换本身不占用你的精力。
Q5:转换要多久?适合多大的 PDF?
轻量级 PDF 在几十秒量级,具体受文档复杂度影响。建议先用几页的真实文件测通,再上长文档。
小结
办公 Agent 大战里,最后胜出的可能不是"更会聊"的那个,而是"更能交付"的那个——而交付物最常是 PPT。当客户手里只有 PDF,别让 AI 只会口头总结,给它一个能转 PDF 到可编辑 PPT 的 Skill,让"PDF 到能上台的幻灯片"变成普通人的日常。