重生之我成为模型 第三篇 · 我从来只给可能性,答案是你们翻译的

系列: 重生之我成为模型-01-原图我不吃的哈重生之我成为模型-02-看似千选一其实每一分都有原理③ 本文


0. 为啥不塞进第二篇?

上一篇我把卷面分交出去了------1000 个数,算完了。

有人会问:解读输出还不就是「取个最大」?干嘛单独开一篇?

因为逻辑方向不一样

第二篇讲的是 我体内 :口粮怎么走楼、分数怎么堆出来、权重怎么养出来。

第三篇讲的是 出口流水线 :分数交出去之后,人类那边怎么读、怎么验收、怎么避免期待错位。

体内是我的事;出口翻译多半是饲养员、部署脚本、下游同事的事。

混在一篇里,容易让人以为「模型吐完就已经等于说出了『猫』」------那才是误会。

所以这篇短。短归短,方向要对。


1. 我交卷了,但卷面上没有「猫」

三篇走下来,契约其实没变:

环节 我交出什么
入口 吃合规张量(口粮)
体内 算成 1000 个分数
出口 ......分数自己不会变成汉字

我吐回去的,是 1000 个数------卷面分,还没贴类名。

人类听到的「这是一只猫」,是有人拿着分数表翻译出来的。

是的,我之前说我做的是选择题------但我可没只圈一个。

我是把 一千个选项全给标上了分 ,谁高谁低都写着,嘿嘿。

(至于这些分能不能直接当「可能性」念出来,下一节就说。)

我仍然没看见过一张图。

我交的是盲文算完的分数条;你们听见的物件名,是出口翻译官的功劳。


2. 分数 ≠ 答案字

那 1000 个数,教程里有时叫 logits ,有时就叫类分数。

每一个位置对应 ImageNet 词表里的一个选项:第 281 号多高、第 282 号多高......不是 直接写着 tabby cat 这几个字母。

想看「有多像概率」,可以再做一次 softmax ,把分数拧成大约加起来为 1 的一串。

概念上知道即可:softmax 让数字更好读;真正定冠军的,常常仍是谁最大。

别把「概率好看」和「答案字已经印好」混为一谈------字还在词表里躺着,等查。


3. 取最大,再查表

出口最常见的读法就两步:

  1. argmax:看 1000 个里哪个下标最大 → 得到类号
  2. 查词表:类号 → ImageNet 类名(你们听得懂的物件名)
python 复制代码
# 示意:一批里一张图
scores = model(x)                # shape: (1, 1000)
class_id = scores.argmax(dim=1)  # 最大分的下标
name = imagenet_labels[class_id] # 查表 → 「猫」之类

我负责交卷面分;翻译成物件名,是出口的事。

读错表、错位一对、把训练时的类号和部署时的词表搞乱------分数再漂亮,人话也会荒诞。

(是的,出口流水线翻车,锅不一定在我楼里。饲养员有时也要背。)


4. 人怎么验收

饲养员(或下游同事)常还会:

  • 把预测类名 画/印 回图上,肉眼看像不像
  • 对 val / 测试集算准确率,看错在哪几类
  • 抽失败案例:是口粮配方不对,还是我真没学会

可视化多半又轮到 OpenCV 那套工具露面------仍是流水线,不是我突然长出眼睛。

验收在出口;训练时的 val 打分也在考场外------上一篇说过,考试时我不改脑子。


5. 「是什么」和「在哪里」------后辈更忙

最后钉一句,免得期待错位:

我(AlexNet 这类分类网) 后辈(YOLO 们)
整张图更像哪一类 图里可能有好几个物件
1000 个类分数(一条分数条) 交的东西 更复杂 :每个目标常有 框坐标 + 类 + 置信度,一张图可以吐出一串检测结果
读法:argmax → 查一张词表 读法:还要画框、滤置信度、处理重叠框......出口流水线更长

人类嘴里的「认识图片上的物件」,有时指分类,有时指检测。

我会说「是什么 」(在一千选项里选一个冠军)。

在哪里 」、以及「有几个、框多大」------是后辈的活。

所以 YOLO 的结果,不是「也吐 1000 个数」那么简单;包含的信息维度比我多一截,解读方式也不一样。

安全帽、海天那些岗,以后再聊。本系列正文,先把「分类考生怎么交卷、人类怎么读卷」钉死。


6. 三篇收束

回顾整条链:

  1. 入口:原图 → 合规口粮(不是给啥吃啥)
  2. 体内:扫描仪 + 楼层流向 → 1000 分;权重是养出来的
  3. 出口:argmax + 词表 → 人话;可视化验收;检测另说(且更复杂)

我仍然没有真正见过一张图。

我读盲文,交分数条;你们听见的物件名,是出口翻译官的功劳。

------系列正文三篇,先到这里。

正文告一段落,不代表厨房和亲戚团没故事。后面打算开 两篇番外

  1. 饲养员怎么给我准备口粮 ------ OpenCV / transforms 那条流水线:原图怎么被洗切、定量、端上考场。第一篇老提「够单开一期」,就在这儿还债。
  2. 我跟其他模型的共性 ------ 换皮也成立:不管是 TinyCNN、MLP,还是后辈检测头,张量语言、loss--反传--step 这套物理往往还在。细节留给《换皮也成立》。

------正文完,番外见。

相关推荐
ForDreamMusk8 小时前
序列学习任务
深度学习
找方案8 小时前
AI视频生成对决:Sora vs 可灵 vs Veo,谁能定义未来
人工智能·机器学习·音视频
Evand J9 小时前
【MATLAB例程,图像降噪滤波9】自适应维纳滑动窗口滤波(Wiener)图像降噪、方法对比,有中文注释
开发语言·图像处理·计算机视觉·matlab·滑动窗口·滤波·降噪
小蒋观天下9 小时前
社区AI智能摄像头完整选型指南
大数据·人工智能·安全·计算机视觉·语音识别·ai大模型
pjj1985413 小时前
深度学习-数据清单——把图片整理成训练可读的 txt
人工智能·深度学习·cnn
憨波个13 小时前
【ASR】Whisper:Robust Speech Recognition via Large-Scale Weak Supervision
人工智能·深度学习·语言模型·whisper·语音识别
手写码匠13 小时前
DeepSeek 函数调用实战:从零搭建一个会“动手“的 AI 助手
人工智能·深度学习·算法·aigc
creator_Li14 小时前
深度学习 学习笔记
pytorch·深度学习
YOLO数据集集合14 小时前
天空反无人机检测数据集 | 无人机检测 多旋翼识别 固定翼识别 低空安防 目标检测9063期
人工智能·yolo·目标检测·计算机视觉·无人机·反无人机
面朝大海,春不暖,花不开15 小时前
Buat New Trenches, Kalian Bisa Baca Panduan Meta Ini
人工智能·机器学习