美团智能海报生成技术解密:PosterCraft + PosterOmni + PosterReward

6 阅读5分钟

说实话,以前听到"AI生成海报",我的第一反应就是——换个背景、加几个字,撑死了再换个字体。但看完美团智能创作团队用三篇顶会论文(ICLR 2026 + CVPR 2026 x 2)搭起来的那套"生成-编辑-评判"技术闭环,我承认,是我格局小了。

我们直接聊技术,不整虚的。

先说说难在哪。如果你以为 AI 做海报就是"给个 prompt 出一张图",那估计是被市面上的生图玩具惯坏了。真正的商业海报,难点不是"能不能画出来",而是五个字——文字不准崩

你没有听错,商业海报里文字是零容错的。标题多一个字、少一个笔画,整张图就得废。主流的扩散模型在中文多行文字、小字号文本上翻车是家常便饭——不是缺胳膊少腿,就是糊成一团。这第一个坎,就没多少模型迈得过去。

再加上版式布局的"设计感"、色彩搭配的行业差异(餐饮要食欲感、美妆要精致感、科技要未来感)、局部编辑和全局创作的统一——单拎出来哪个都是坑。

那美团是怎么搞的?

他们搞了三板斧,分别对应"能生成、能编辑、能评判"。

第一板斧:PosterCraft(ICLR 2026)

核心思路很简单粗暴——不要流水线。之前的做法是先由视觉语言模型规划布局,再把文字叠到背景上。听起来没毛病,但问题是每个模块都有自己的短板,拼出来的东西上限就卡在那了。

PosterCraft 直接端到端训练,搞了一个四阶段级联优化:

第一阶段,搞了 200 万张图片的 Text-Render-2M 数据集,纯练文字渲染。第二阶段,筛选了 10 万张高质量海报,用"区域感知校准"机制——文字区域权重低一点,非文字区域权重高一点,平衡文字准确和整体艺术性。第三阶段,用 Best-of-N 偏好优化(DPO),让模型学会啥叫"好看"。第四阶段,微调了一个 VLM 评论家做迭代优化。

最后的效果:文字召回率和准确率已经接近 Gemini 2.0-Flash-Gen 那个级别的闭源系统。开源模型做到这个水平,说实话挺能打的。

图片

第二板斧:PosterOmni(CVPR 2026)

现实场景里,设计师拿着参考图说"按这个风格帮我改一下布局"才是常态,而不是从零开始写 prompt。所以 PosterOmni 核心干的事是——把六类任务塞进一个模型

哪六类?扩图、补全、比例调整、主体保持、版式迁移、风格迁移。你想想,局部编辑(换文字、补空位)和全局创作(换风格、改版式)根本就是两种能力,放在一个模型里,很容易互相打架。

怎么解决的?先分别训练两个专家——一个专攻局部编辑,一个专攻全局创作——然后用蒸馏技术合到一个学生模型里。再训练一个统一奖励模型,不仅判断好不好看,还要判断"任务做没做对"。

最后在 PosterOmni-Bench 上六类任务全面领先开源方案,甚至反超 Seedream-4.0。注意,是单一模型,不是串几个模型。

图片

第三板斧:PosterReward(CVPR 2026)

这一步很有意思。你生成了一堆海报,怎么判断哪张好哪张不好?FID、IS 这些传统指标完全不管排版质量和文字准确性,人工评估又贵到飞起。

所以美团搞了一个专门给海报打分用的奖励模型。思路分两条线走:一条是对存量海报做结构化解析——定位里面 12 种元素(文案、价格、Logo、菜品等),然后从构图、色彩、氛围感三个维度打分。另一条是训练端到端的偏好模型 PosterReward,在专项评测上干到了 86% 的准确率——对比之下,现有基线基本都在 40%–53% 徘徊。

讲道理,这个差距属于"别人在及格线挣扎,你直接优秀"。

而且这套评估体系不是只用来打分的,它还能反向驱动生成模型进化——RL 强化学习的奖励信号就来自于它。说白了就是自循环:生成多一点→反馈多一条→模型更聪明。

图片

最后聊聊闭环

这三个模型不是孤立存在的。PosterCraft 做基础生成 → PosterOmni 拓展编辑能力 → PosterReward 做质量守门 → 反馈信号反哺前两个模型。就像一条生产线,每一环节都跟上下游联动。

而且他们全开源了,代码在 GitHub 的 MeiGen-AI 仓库,论文也挂在 arxiv 上。感兴趣的同学直接把代码拉下来跑跑看,感受一下工业级海报生成技术到底是什么水平。

我个人觉得,这套技术体系最大的意义不在于"AI 做得有多好",而在于它让百万量级的中小商家也能用上专业级的海报设计——这在以前,想都不敢想。

你在项目里用过 AI 生图技术吗?是踩了坑还是真香?评论区聊聊。