#每天一个知识点# AI漫剧 批量生成时TTS配音缓存复用的坑

最近在做漫剧分镜批量生成,多角色对白大概20句,每句TTS合成耗时1.5秒左右,一集配音就30多秒。重试的时候更坑,图片重试但配音已经生成过,结果又跑一遍TTS,白白浪费时间。

后来加了个音频缓存,用文本+音色+语速做指纹,SHA256取前16位存WAV。重试场景命中率90%,配音耗时从40秒降到5秒。跨集复用也有60%左右命中,挺划算的。

缓存淘汰用LRU,保留最近30天,超过2000个文件就清理。WAV单条100多KB,2000条也就200MB,完全可以接受。

配合响度归一化-16 LUFS,配乐低于人声6dB,成片观感稳定了不少。

如果不想自己搭这套缓存和调度,可以用知漫剧(hy.jiaxunai.cn)一站式跑通,国内直接访问,角色锁定和批量出片都支持。

【本文完】
展开
评论