论文阅读——DistilBERT

ArXiv:https://arxiv.org/abs/1910.01108

Train Loss:

DistilBERT:

DistilBERT具有与BERT相同的一般结构,层数减少2倍,移除token类型嵌入和pooler。从老师那里取一层来初始化学生。

The token-type embeddings and the pooler are removed while the number of layers is reduced by a factor of 2. Most of the operations used in the Transformer architecture (linear layer and layer normalisation) are highly optimized in modern linear algebra frameworks。

we initialize the student from the teacher by taking one layer out of two.

大batch,4k,动态mask,去掉NSP

训练数据:和BERT一样

相关推荐
计算机编程-吉哥26 分钟前
小麦叶病害识别系统:基于MobileNet的智能农业病害检测实战【计算机毕业设计选题推荐、深度学习】
人工智能·深度学习·毕业设计·课程设计·计算机毕业设计选题·机器学习毕业设计·大数据毕业设计选题推荐
EDPJ28 分钟前
(2026|CVPR|安大,可学习正常/异常 token,空间感知交叉注意力)VisualAD:基于 ViT 的语言无关零样本异常检测
深度学习·计算机视觉·缺陷检测·异常检测
weixin_440213291 小时前
深度学习正则化方法详解|Dropout / BN / L1&L2 正则
深度学习·dropout·正则化·过拟合·泛化能力
流浪0011 小时前
大模型技术全景(五):开源大模型生态指南,Hugging Face 与魔搭社区
人工智能·深度学习·llm
手写码匠2 小时前
华为云Flexus+DeepSeek征文|DeepSeek R1 推理优化实战:让复杂任务的回答又快又稳
人工智能·深度学习·算法·aigc
Zguigo2 小时前
Coding Agent 上下文压缩:从 Claude Code / Codex / Pi 到自研策略
深度学习·vllm
月华路2 小时前
《模型不玄学》第16章 概率校准
人工智能·深度学习·机器学习
问天_观心11 小时前
大模型微调学习(二)
人工智能·python·深度学习·学习·语言模型·transformer
指掀涛澜天下惊11 小时前
强化学习进阶篇八 策略梯度算法
深度学习·学习·算法·强化学习
Mickey Q15 小时前
【深度学习】数值稳定性和模型初始化
人工智能·深度学习