nn.functional.softmax(X, dim=-1)

dim=-1表示在最后一个维度(大概率是一行)应用Softmax函数,将值标准化为概率分布。

实例

假设我们有一个张量X,形状为(2,3),内容如下:

复制代码
import torch  
import torch.nn.functional as F  

X = torch.tensor([[1.0, 2.0, 3.0],  
                  [1.0, 2.0, 3.0]])  

# 计算 Softmax  
softmax_result = F.softmax(X, dim=-1)  
print(softmax_result)

输出:

复制代码
tensor([[0.0900, 0.2447, 0.6652],  
        [0.0900, 0.2447, 0.6652]])

可以看到,每一行的输出值加起来为 1,这表示已经进行了Softmax操作。

相关推荐
倔强的石头1064 分钟前
【Transformer】上下文长度扩展技术综述
人工智能·深度学习·transformer
Rocky Ding*13 分钟前
MaskGIT技术深度解析:图像生成如何从逐Token排队走向掩码并行预测
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·maskgit
Rocky Ding*2 小时前
Muse技术深度解析:用掩码并行生成图像,速度、语义与编辑能力如何同时成立
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·muse
论文复现现场8 小时前
AutoDL、算家云与公有云 GPU 怎么选?环境复现、计费与断点恢复对比
pytorch·深度学习·云计算·gpu
唠点键盘之外的8 小时前
15 微调 vs RAG:到底怎么选
人工智能·机器学习·面试·aigc
硅谷秋水10 小时前
EmbodiedMemory-Bench:面向长时程具身任务的具身记忆基准测试
机器学习·语言模型·机器人
楚来客10 小时前
AI基础概念之十四:时空Transformer架构
人工智能·深度学习·transformer
patton_smile11 小时前
配电网电压预测 GNN 模型优化
深度学习·配电网·图神经网络·电压预测
Ivanqhz12 小时前
层归一化、残差、前馈网络与激活函数简述
服务器·数据库·人工智能·深度学习·算法
I Am a robert girl15 小时前
STEPQuant:Delta-Rule 循环状态量化中,误差何时何地才真正致命
深度学习·模型部署·量化·kv cache·线性注意力·显存优化·循环状态