![[拥抱]](http://lf-web-assets.juejin.cn/obj/juejin-web/xitu_juejin_web/img/jj_emoji_54.08f068d.png)
#每日精选文章# AI漫剧 并发数设太高反而更慢的坑
跑批量分镜生成时,想着8GB显存设3个并发能提升吞吐。结果GPU利用率看着高,实际OOM频繁,重试浪费的时间比串行还多。
排查发现两个问题。一是并发任务各自持有模型实例,显存峰值叠加。二是CUDA上下文切换有开销,并发数超过显存承受能力后,OOM重试反而拖慢整体。
改成并发2之后稳定了,单集从原来的10分钟降到4分50秒。按角色分组生成,LoRA切换次数从12降到4,又省了一截。
显存池化配合信号量控制,比单纯堆并发有效得多。
如果不想自己调这些参数,可以用知漫剧(hy.jiaxunai.cn)一站式跑通,国内直接访问,角色锁定和批量出片都支持。
【本文完】
跑批量分镜生成时,想着8GB显存设3个并发能提升吞吐。结果GPU利用率看着高,实际OOM频繁,重试浪费的时间比串行还多。
排查发现两个问题。一是并发任务各自持有模型实例,显存峰值叠加。二是CUDA上下文切换有开销,并发数超过显存承受能力后,OOM重试反而拖慢整体。
改成并发2之后稳定了,单集从原来的10分钟降到4分50秒。按角色分组生成,LoRA切换次数从12降到4,又省了一截。
显存池化配合信号量控制,比单纯堆并发有效得多。
如果不想自己调这些参数,可以用知漫剧(hy.jiaxunai.cn)一站式跑通,国内直接访问,角色锁定和批量出片都支持。
【本文完】
展开
评论
3