预训练模型

来自https://datawhalechina.github.io/base-llm/#/chapter5/13_Bert

BERT仅采用Transfromer中的编码器结构构建,其核心优势在于双向性,适用于语言理解

因为它在预测时能看到整个输入序列,而生成模型(以GPT为代表的),在预测下一个词时,必须严格遵守单向规则("只能看到过去")

BERT可以作为一个词向量生成工具,也是一个强大的预训练语言模型

BERT的工作范式

分为预训练和微调两个阶段

!\[Pasted image 20260117234907.png]

微调阶段以BERT模型作为 任务模型的基础结构,根据具体任务在BERT模型上增加一个小的、任务相关的输出层,最后在自己的任务数据集上对整个模型或仅对顶部的输出层进行训练

这种预训练+微调的训练范式,属于迁移学习的一种实现

从海量数据中学到的通用语言知识迁移到数据量有限的特定任务中

相关推荐
AIkk869 分钟前
手机释放内存用什么工具方便?2026全平台工具实测科普
人工智能
阿里云大数据AI技术10 分钟前
从 VDBBench 到 MMEB 榜首:阿里云 AI Search 从引擎到模型的全栈优化
人工智能·elasticsearch·agent
小白说大模型1 小时前
LLM集成数据库的幻觉治理:当AI给出的SQL建议是错的
数据库·人工智能·sql·oracle·重构·开源
火山引擎开发者社区1 小时前
豆包大模型测评招募丨寻找行业资深 AI 实践者
人工智能
ITyunwei09871 小时前
技术管理者视角:AI 重构 ITSM 的四个工程化落点
运维·人工智能
千维百策6661 小时前
AI 软件开发中的人与智能体:软件工程循环、人在环路中与框架工程
大数据·人工智能·软件工程
专注仿真1 小时前
问答大模型技术方案算法实现-熵权法融合算法 + 交叉编码器重排算法
人工智能·python·算法·语言模型·问答大模型关键算法·熵权融合算法·交叉编码器重排算法
阿里云大数据AI技术2 小时前
DataWorks Data Agent 实战课堂(五):AI 多模态智能数据处理
人工智能·agent
又折桃枝换酒钱2 小时前
SASAV:自主科学分析与可视化智能体(翻译与解读)
人工智能