Bert浅谈

优点

首先,bert的创新点在于利用了双向transformer,这就跟openai的gpt有区别,gpt是采用单向的transformer,而作者认为双向transformer更能够融合上下文的信息。这里双向和单向的区别在于,单向只跟当前位置之前的tocken相连,双向与当前位置之后的tocken也有连接。跟ELMo相比的优势在于,transformer对特征的提取能力比lstm要强得多。

模型输入

首先是对输入的句子做tocken embedding,也就是将句子映射为一维向量,可以是word2vec的结果,猜想一下,如果不是维度过高也可以是one-hot,第二部分segment embedding 是在模型训练过程中自动学习得到的,猜想这里可以用全连接,也可以用transformer,最后是position embedding,主要用以区别"我喜欢妈妈"和"妈妈喜欢我",虽然这两句话的单词一样,但是因为位置不同,所以含义不同。

模型参数

BERTBASE (L=12, H=768, A=12, Total Parameters=110M)

BERTLARGE (L=24, H=1024,

A=16, Total Parameters=340M).

L表示层数,H为隐层维度,A为注意力头的数量

两种任务

Masked LM

这个任务主要是随机将某句话的某几个位置做处理,这里的处理可能是3种,80%的概率用mask代替,10%的概率保留原来的单词,10%的概率用其他单词代替。就像是英语考试中的完形填空

Next Sentence Prediction (NSP)

主要利用输入的第一个tockencls和中间的tockensep,其中cls用来表示后面一句是否为前一句的下一句,sep表示两个句子的间隔。从文本语料库中随机选择 50% 正确语句对和 50% 错误语句对进行训练。就像是与语文中的句子排序。

参考:BERT模型的详细介绍

相关推荐
澜舟孟子开源社区8 分钟前
从流程自动化到认知智能化:LangClaw 携手澜舟智库打造业务决策型数字专家
人工智能
云端漫步198721 分钟前
HarmonyOS NEXT AI 智能生活助手:AI 代码解释
人工智能·华为·生活·harmonyos
console.log('npc')21 分钟前
OptMem 使用教程
人工智能·ai编程·记忆
世优科技虚拟人25 分钟前
数字人厂商赋能学校教育:校史馆党建科普导览AI数字人应用观察
人工智能·智慧校园·ai数字人·数字人一体机·大屏数字人
sali-tec26 分钟前
C# 基于OpenCv的视觉工作流-章100-抠图
图像处理·人工智能·opencv·计算机视觉
精益数智工坊29 分钟前
账龄分析怎么做才不流于形式?如何真正落地账龄分析?
大数据·人工智能·数据可视化
June`33 分钟前
warp shuffle指令
c++·人工智能·算法·cuda
内蒙深海大鲨鱼36 分钟前
3.Introduction to PyTorch YouTube Series--Autograd
人工智能·pytorch·python
星核0penstarry40 分钟前
276B 总参 / 12B 激活,8 卡 B200 跑 648 tok/s:Inkling‑Small 技术解读**2
大数据·人工智能·ai
weixin_4462608543 分钟前
AtumAI:面向数据中心控制平面策略的规范化智能体生成框架
人工智能·平面