#我的技术写作成长之路# "3.5B 等效 50B"这几天刷屏了,但我把 Huginn 论文翻完只得出一个结论:循环深度省的是权重存储,不是算力——3.5B 的预训练 FLOPs 接近固定深度 32B 模型。没有免费变大,只有明码标价的交换。8 个误读我拆成了清单,收藏备用。
1