深度学习中的温度参数(Temperature Parameter)是什么?

参考:温度系数是可学习的参数,会在训练过程中被优化器更新

深度学习中的温度参数(Temperature Parameter)是什么?-CSDN博客

1. 温度系数的作用机制

当增大T 的值时,分布变得更加的平坦(较大的值变得更小,较小的值变得更大);当减小T 的值使,分布变得更加尖峰(较大的值变得更大,较小的值变得更小)。

也就是说:

温度系数越小,分布越尖锐(温度系数控制剪碎程度的)

比如attention中计算每个token的得分的时候,在计算score的时候加了温度系数:

2. 为什么要这样做?

防止注意力崩溃到均匀分布

在训练中,attn_guide_loss 使用 label smoothing 的 soft target(接近均匀分布)来监督注意力权重。如果没有温度下限约束,优化器会:

  1. 不断降低 temperature → 让 softmax 变得更平滑(趋向均匀)

  2. 极端情况temperature → 0 时,softmax 完全均匀分布

  3. 这会导致 ATT模块无法聚焦到真正重要的 token,失去了 attention pooling 的意义

3. 实际例子

假设有 77 个 token(含 padding):

  • temperature = 2.0:注意力权重相对均匀,每个 token 权重约 1.3%

  • temperature = 0.5:注意力更集中,可能 top-5 token 占 80% 权重

  • temperature = 0.1:极度集中,top-1 token 可能占 99%+ 权重

通过 clamp temperature ≥ 1.0,防止 softmax 过于均匀,保持注意力机制的选择性。

相关推荐
龙萱坤诺25 分钟前
无限画布 + gpt-image-2:用智狐AI工作台把AI草图直接拖进排版区
人工智能·ai短剧·无限画布
马***4118 小时前
适配成人英语学习痛点,打造落地性强的学习辅助方式
人工智能·学习
夜焱辰8 小时前
浏览器端 Agent 的文件版本管理:不用 Git,基于 OPFS + SQLite 自己造了一个
前端·人工智能
Ricky05538 小时前
CTRL-WORLD:一种用于机器人操控的可控生成世界模型(中美2025年联合研究)
人工智能·机器人·世界模型
jeffer_liu8 小时前
Spring AI 生产级实战:工具调用
java·人工智能·后端·spring·ai编程
阿乔外贸日记8 小时前
2026尼日利亚五项清关政策更新,拉高能源装备进口综合成本
大数据·人工智能·搜索引擎·智能手机·云计算·能源
民乐团扒谱机9 小时前
【AI笔记】短时纯音时长对音高感知偏移效应研究综述
人工智能·笔记
侃谈科技圈9 小时前
破除数据中台落地困境:2026数据治理平台差异化能力与选型决策指南
大数据·人工智能
大象说9 小时前
Python多进程共享队列无报错僵死 120G Nginx访问日志清洗踩坑全记录
人工智能·自然语言处理
Cosolar9 小时前
AutoGen 精通教程:从零到企业级多 Agent 系统架构师
人工智能·后端·面试