Bert浅谈

优点

首先,bert的创新点在于利用了双向transformer,这就跟openai的gpt有区别,gpt是采用单向的transformer,而作者认为双向transformer更能够融合上下文的信息。这里双向和单向的区别在于,单向只跟当前位置之前的tocken相连,双向与当前位置之后的tocken也有连接。跟ELMo相比的优势在于,transformer对特征的提取能力比lstm要强得多。

模型输入

首先是对输入的句子做tocken embedding,也就是将句子映射为一维向量,可以是word2vec的结果,猜想一下,如果不是维度过高也可以是one-hot,第二部分segment embedding 是在模型训练过程中自动学习得到的,猜想这里可以用全连接,也可以用transformer,最后是position embedding,主要用以区别"我喜欢妈妈"和"妈妈喜欢我",虽然这两句话的单词一样,但是因为位置不同,所以含义不同。

模型参数

BERTBASE (L=12, H=768, A=12, Total Parameters=110M)

BERTLARGE (L=24, H=1024,

A=16, Total Parameters=340M).

L表示层数,H为隐层维度,A为注意力头的数量

两种任务

Masked LM

这个任务主要是随机将某句话的某几个位置做处理,这里的处理可能是3种,80%的概率用mask代替,10%的概率保留原来的单词,10%的概率用其他单词代替。就像是英语考试中的完形填空

Next Sentence Prediction (NSP)

主要利用输入的第一个tockencls和中间的tockensep,其中cls用来表示后面一句是否为前一句的下一句,sep表示两个句子的间隔。从文本语料库中随机选择 50% 正确语句对和 50% 错误语句对进行训练。就像是与语文中的句子排序。

参考:BERT模型的详细介绍

相关推荐
S.C.Dragon10 分钟前
DeepReseach Agent Harness:面向复杂研究任务的可恢复多智能体系统
人工智能·ai
这是程序猿12 分钟前
百度 AI 搜索新手快速上手指南
人工智能
就是一顿骚操作12 分钟前
SSD:单阶段多尺度目标检测的经典解读
人工智能·深度学习·目标检测·计算机视觉·论文解读
用户2986985301413 分钟前
Markdown 转 PDF 免费在线攻略:简单几步轻松搞定
人工智能·后端·markdown
不断学习加努力15 分钟前
【一看就会】视觉传感器分类和整理
人工智能·深度学习
格林威18 分钟前
C#高位深相机图像保存:12位16位图像保存方案,OpenCvSharp和Halcon实现
开发语言·人工智能·数码相机·计算机视觉·c#·视觉检测·工业相机
zx_7414848119 分钟前
【计算机视觉入门】两大 OpenCV 案例:答题卡判分与图像全景拼接
人工智能·opencv·计算机视觉
樊小肆20 分钟前
DeepSeeker-Code源码导读10-代码智能tsHost
人工智能·agent
武子康22 分钟前
262K 跑过,128K 却被脚本拦下:A6000 跑分里的三种“失败”不能混为一谈
人工智能·llm·agent
互联网志22 分钟前
机器人物理AI操作系统问世 多形态设备协同训练重构智能作业模式
人工智能·重构·机器人