bert

打工仔折腾 AI4 天前
人工智能·后端·python·深度学习·语言模型·bert
从Attention到BERT:双向预训练语言模型到底解决了什么问题几年前我做过一个情感分类的小任务,数据量不大,大概几千条中文评论。当时第一反应是用 Word2Vec 训练词向量,再套一个 LSTM 做分类。结果跑出来准确率一直卡在 80% 出头,怎么调都上不去。
布吉岛的石头7 天前
java·人工智能·深度学习·bert·transformer
Java 程序员第 49 阶段5:BERT 预训练目标 MLM+NSP 的工程含义在大模型工程落地里,这个话题绕不开。很多 Java 同学刚接触时容易只看结论、不究原理,一旦线上出问题就无从下手。先把「为什么重要」说清楚,后面才好理解它怎么用。
倔强的石头1067 天前
语言模型·bert·transformer
【Transformer】BERT_双向预训练语言模型的开端摘要:BERT 是理解型预训练语言模型的里程碑。它不像 GPT 那样从左到右预测下一个 token,而是使用 Encoder-Only Transformer 双向阅读整段文本,并通过 Masked Language Modeling 学习上下文表示。BERT 让“先在海量文本上预训练,再在具体任务上微调”成为 NLP 的主流范式,也为今天的 embedding、rerank、分类、信息抽取等系统打下基础。本文从 BERT 出现前的 NLP 困境讲起,解释 Encoder-Only、MLM、NSP、[CL
wshzd8 天前
人工智能·深度学习·bert
LLM之Agent(103)|当「快思考」遇上「深理解」:Laya 和 BERT 到底有什么区别?一个让我愣住的问题几个月前,我在 GitHub trending 上看到了一个项目:Laya — "Multilingual, non-autoregressive System 1 decision engine. Typed decisions over 100+ languages in a single forward pass — 33 ms — trained with reinforcement learning against strictly proper scoring rules."
ai大模型-探索者14 天前
bert
BERT模型-蒸馏实战配套项目:今日头条新闻 10 分类(BERT 教师 + BiLSTM 学生)。你已经训练出一个很准的 BERT 模型(409MB,准确率 95%+),但上线时遇到问题:
ai大模型-探索者17 天前
bert
BERT模型压缩-量化实战配套项目:今日头条新闻 10 分类(BERT 微调模型)。你辛苦训练的 BERT 模型有 409MB,效果很好(准确率 95%+),但是——
月疯1 个月前
人工智能·深度学习·bert
bert的架构解析结构介绍:简介:设置场景(词汇表大小=5,维度=2,句子“我 [MASK] 自然”)。步骤1:嵌入 + 位置编码(具体数字)。
Jialu.1 个月前
人工智能·深度学习·bert
模型压缩实战:BERT 量化从 390MB 到 146MB 的实践模型训练通常使用 FP32 浮点数。它精度高,但参数占用空间较大。量化可以使用更低位数的数据表示参数,从而减少模型体积,并在部分硬件上提升推理速度。
Kobebryant-Manba1 个月前
人工智能·学习·bert
学习Bert微调dense就是全连接层理论上拿哪个都行,但人家大模型训练是对<cls>"class意思"这个学习的,要用人家训练好的东西微调,那最好就得一样了(用cls是因为我们在预训练bert的时候nsp就是用cls去进行预测的 这样下游任务与预训练尽量保持统一)
Jialu.1 个月前
人工智能·pytorch·分类·微软·nlp·bert
中文 BERT 多任务分类项目:从模型结构到训练细节项目将评论分析拆成三个独立分类任务:投诉分流四分类、虚假评论二分类、广告骚扰二分类。每个任务使用自己的训练数据和分类头。
Jialu.1 个月前
深度学习·nlp·bert
从 102M 到 34M:BERT 到 BiLSTM 的完整知识蒸馏实现BERT 语义能力强,但参数量约 102M,模型文件约 390MB。直接部署会带来较大的内存占用和推理成本。
傲笑风1 个月前
人工智能·python·自然语言处理·nlp·bert·openvino
【openvino】tinybert基于openvino服务化部署(四)与tinybert-mediapipe的文件夹结构完整一样,只有部分文件需要更改:其实配置文件config.json基本不变,只是改了name和base_path而已,其它保持不变
Lee_jerome1 个月前
微调·bert·迁移学习·文本分类·预训练·小样本·冻结特征
python神经网络编程入门(四十四)——微调预训练 BERT 做下游任务📍 路标:本篇位于《从零构建 Transformer》系列 第 15/16 章 · 实战篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16·本篇) ▸ 知识收官
Tbisnic1 个月前
算法·自然语言处理·大模型·bert·transformer·注意力机制
BGE-M3 算法详解:从模型架构到三种检索方式的数学原理2024年1月30日,智源研究院(BAAI)发布了BGE家族的新成员——BGE-M3。BGE-M3是首个集多语言(Multi-Linguality)、多粒度(Multi-Granularity)、多功能(Multi-Functionality)三大技术特征于一体的语义向量模型-。
bulingg2 个月前
人工智能·深度学习·bert
bert输入长度有限,如何处理超长文本?在自然语言处理中,处理超长文本是一个常见挑战。模型通常有最大输入长度限制,对于超过限制(如1万token)的文本,核心思路分为模型架构改造和输入策略适配两大类。
bittersuite2 个月前
人工智能·深度学习·bert
BERT,fine-tuningBERT(预训练) NLP 迁移学习的思路是:用大规模预训练模型(如 Word2vec、语言模型)提供通用语言知识,再加任务特定层做微调。但传统方法有时序或方向上的局限,而 Transformer(尤其是其双向 Self-Attention)为更好的预训练模型(BERT 等)提供了架构基础。
leoZ2312 个月前
开发语言·人工智能·视觉检测·bert·php·超分辨率重建·openvino
AI 辅助开发的五道坎12 个问题、两天时间、无数次排查。回头看这些坑不是孤立的——它们共同指向五个系统性缺陷。理解了这五道坎,不只是 SD,任何 AI 辅助开发项目都能少走弯路。
一碗白开水一2 个月前
人工智能·深度学习·机器学习·自然语言处理·分类·bert
入门实践工程九:基于 BERT 的中文情感分类微调~附:安装依赖库及工程源码🔥 别再死磕枯燥理论了!AI 时代,拿实战作品说话才是硬道理!(原创不易哈,希望可以帮到还有些许学习劲儿的同学们) 🔥 【进阶版还在创作中,耗费精力中……】
科里 Coralyx2 个月前
gpt-3·bert·transformer
Transformer、BERT、GPT-3:大模型时代的三块地基【边界层·算法&论文】第1期Transformer、BERT、GPT-3:大模型时代的三块地基AI 这两年变化快到让人疲劳:新模型、新产品、新概念几乎按周刷新。越是在这种时候,回头看几篇打地基的论文反而更有价值,因为它们解释了为什么今天的繁荣能发生、行业为何会沿着某些路线走到现在。
半兽先生2 个月前
人工智能·分类·bert
意图分类模型,使用ber分类和LLM分类有哪些优缺点?导读:在构建企业级RAG(检索增强生成)应用时,"意图识别"往往是决定用户体验的第一道关卡。用户是想闲聊?想查文档?还是想执行某个工具调用?针对这个环节,业界主要有两种主流技术路线:传统的BERT分类模型和基于Prompt的LLM大模型分类。很多开发者在选择时容易纠结:是用轻量级的BERT,还是用理解力更强的LLM?本文将结合图片中的核心观点,从稳定性、上下文理解、扩展性及性能瓶颈四个维度进行深度对比,助你做出最合适的架构决策。