#日新计划#
你用视频模型做了条短片,结果:嘴型和配音对不上、同一个主角第三秒换了张脸、想做直播实时换脸发现模型必须"等十几秒一次性吐完所有帧"。
这三件事分别卡在三道工程线上:声画不同源(后处理拼接必错位)、身份没被显式条件化(扩散每帧从噪声起步、脸是"隐式涌现")、DiT 是离线一次性生成(根本不能流式)。
而 2026 年这三个问题同时有了进展:同 latent 联合去噪、reference cross-attention 锁死身份、AR-DiT 把生成改成 chunk 流式即产即播。
展开
评论