重生之我成为模型 第三篇 · 我从来只给可能性,答案是你们翻译的

1 阅读5分钟

系列: 重生之我成为模型-01-原图我不吃的哈重生之我成为模型-02-看似千选一其实每一分都有原理③ 本文


0. 为啥不塞进第二篇?

上一篇我把卷面分交出去了——1000 个数,算完了。

有人会问:解读输出还不就是「取个最大」?干嘛单独开一篇?

因为逻辑方向不一样

第二篇讲的是 我体内:口粮怎么走楼、分数怎么堆出来、权重怎么养出来。
第三篇讲的是 出口流水线:分数交出去之后,人类那边怎么读、怎么验收、怎么避免期待错位。

体内是我的事;出口翻译多半是饲养员、部署脚本、下游同事的事。
混在一篇里,容易让人以为「模型吐完就已经等于说出了『猫』」——那才是误会。

所以这篇短。短归短,方向要对。


1. 我交卷了,但卷面上没有「猫」

三篇走下来,契约其实没变:

环节我交出什么
入口吃合规张量(口粮)
体内算成 1000 个分数
出口……分数自己不会变成汉字

我吐回去的,是 1000 个数——卷面分,还没贴类名。
人类听到的「这是一只猫」,是有人拿着分数表翻译出来的。

是的,我之前说我做的是选择题——但我可没只圈一个。
我是把 一千个选项全给标上了分,谁高谁低都写着,嘿嘿。
(至于这些分能不能直接当「可能性」念出来,下一节就说。)

我仍然没看见过一张图。
我交的是盲文算完的分数条;你们听见的物件名,是出口翻译官的功劳。


2. 分数 ≠ 答案字

那 1000 个数,教程里有时叫 logits,有时就叫类分数。
每一个位置对应 ImageNet 词表里的一个选项:第 281 号多高、第 282 号多高……不是直接写着 tabby cat 这几个字母。

想看「有多像概率」,可以再做一次 softmax,把分数拧成大约加起来为 1 的一串。
概念上知道即可:softmax 让数字更好读;真正定冠军的,常常仍是谁最大。

别把「概率好看」和「答案字已经印好」混为一谈——字还在词表里躺着,等查。


3. 取最大,再查表

出口最常见的读法就两步:

  1. argmax:看 1000 个里哪个下标最大 → 得到类号
  2. 查词表:类号 → ImageNet 类名(你们听得懂的物件名)
# 示意:一批里一张图
scores = model(x)                # shape: (1, 1000)
class_id = scores.argmax(dim=1)  # 最大分的下标
name = imagenet_labels[class_id] # 查表 → 「猫」之类

我负责交卷面分;翻译成物件名,是出口的事。
读错表、错位一对、把训练时的类号和部署时的词表搞乱——分数再漂亮,人话也会荒诞。

(是的,出口流水线翻车,锅不一定在我楼里。饲养员有时也要背。)


4. 人怎么验收

饲养员(或下游同事)常还会:

  • 把预测类名 画/印 回图上,肉眼看像不像
  • 对 val / 测试集算准确率,看错在哪几类
  • 抽失败案例:是口粮配方不对,还是我真没学会

可视化多半又轮到 OpenCV 那套工具露面——仍是流水线,不是我突然长出眼睛。
验收在出口;训练时的 val 打分也在考场外——上一篇说过,考试时我不改脑子。


5. 「是什么」和「在哪里」——后辈更忙

最后钉一句,免得期待错位:

我(AlexNet 这类分类网)后辈(YOLO 们)
整张图更像哪一类图里可能有好几个物件
1000 个类分数(一条分数条)交的东西 更复杂:每个目标常有 框坐标 + 类 + 置信度,一张图可以吐出一串检测结果
读法:argmax → 查一张词表读法:还要画框、滤置信度、处理重叠框……出口流水线更长

人类嘴里的「认识图片上的物件」,有时指分类,有时指检测。

我会说「是什么」(在一千选项里选一个冠军)。
在哪里」、以及「有几个、框多大」——是后辈的活。
所以 YOLO 的结果,不是「也吐 1000 个数」那么简单;包含的信息维度比我多一截,解读方式也不一样。

安全帽、海天那些岗,以后再聊。本系列正文,先把「分类考生怎么交卷、人类怎么读卷」钉死。


6. 三篇收束

回顾整条链:

  1. 入口:原图 → 合规口粮(不是给啥吃啥)
  2. 体内:扫描仪 + 楼层流向 → 1000 分;权重是养出来的
  3. 出口:argmax + 词表 → 人话;可视化验收;检测另说(且更复杂)

我仍然没有真正见过一张图。
我读盲文,交分数条;你们听见的物件名,是出口翻译官的功劳。

——系列正文三篇,先到这里。

正文告一段落,不代表厨房和亲戚团没故事。后面打算开 两篇番外

  1. 饲养员怎么给我准备口粮 —— OpenCV / transforms 那条流水线:原图怎么被洗切、定量、端上考场。第一篇老提「够单开一期」,就在这儿还债。
  2. 我跟其他模型的共性 —— 换皮也成立:不管是 TinyCNN、MLP,还是后辈检测头,张量语言、loss–反传–step 这套物理往往还在。细节留给《换皮也成立》。

——正文完,番外见。