bert

月疯6 天前
人工智能·深度学习·bert
bert的架构解析结构介绍:简介:设置场景(词汇表大小=5,维度=2,句子“我 [MASK] 自然”)。步骤1:嵌入 + 位置编码(具体数字)。
Jialu.9 天前
人工智能·深度学习·bert
模型压缩实战:BERT 量化从 390MB 到 146MB 的实践模型训练通常使用 FP32 浮点数。它精度高,但参数占用空间较大。量化可以使用更低位数的数据表示参数,从而减少模型体积,并在部分硬件上提升推理速度。
Kobebryant-Manba9 天前
人工智能·学习·bert
学习Bert微调dense就是全连接层理论上拿哪个都行,但人家大模型训练是对<cls>"class意思"这个学习的,要用人家训练好的东西微调,那最好就得一样了(用cls是因为我们在预训练bert的时候nsp就是用cls去进行预测的 这样下游任务与预训练尽量保持统一)
Jialu.13 天前
人工智能·pytorch·分类·微软·nlp·bert
中文 BERT 多任务分类项目:从模型结构到训练细节项目将评论分析拆成三个独立分类任务:投诉分流四分类、虚假评论二分类、广告骚扰二分类。每个任务使用自己的训练数据和分类头。
Jialu.13 天前
深度学习·nlp·bert
从 102M 到 34M:BERT 到 BiLSTM 的完整知识蒸馏实现BERT 语义能力强,但参数量约 102M,模型文件约 390MB。直接部署会带来较大的内存占用和推理成本。
傲笑风14 天前
人工智能·python·自然语言处理·nlp·bert·openvino
【openvino】tinybert基于openvino服务化部署(四)与tinybert-mediapipe的文件夹结构完整一样,只有部分文件需要更改:其实配置文件config.json基本不变,只是改了name和base_path而已,其它保持不变
Lee_jerome19 天前
微调·bert·迁移学习·文本分类·预训练·小样本·冻结特征
python神经网络编程入门(四十四)——微调预训练 BERT 做下游任务📍 路标:本篇位于《从零构建 Transformer》系列 第 15/16 章 · 实战篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16·本篇) ▸ 知识收官
Tbisnic25 天前
算法·自然语言处理·大模型·bert·transformer·注意力机制
BGE-M3 算法详解:从模型架构到三种检索方式的数学原理2024年1月30日,智源研究院(BAAI)发布了BGE家族的新成员——BGE-M3。BGE-M3是首个集多语言(Multi-Linguality)、多粒度(Multi-Granularity)、多功能(Multi-Functionality)三大技术特征于一体的语义向量模型-。
bulingg1 个月前
人工智能·深度学习·bert
bert输入长度有限,如何处理超长文本?在自然语言处理中,处理超长文本是一个常见挑战。模型通常有最大输入长度限制,对于超过限制(如1万token)的文本,核心思路分为模型架构改造和输入策略适配两大类。
bittersuite1 个月前
人工智能·深度学习·bert
BERT,fine-tuningBERT(预训练) NLP 迁移学习的思路是:用大规模预训练模型(如 Word2vec、语言模型)提供通用语言知识,再加任务特定层做微调。但传统方法有时序或方向上的局限,而 Transformer(尤其是其双向 Self-Attention)为更好的预训练模型(BERT 等)提供了架构基础。
leoZ2311 个月前
开发语言·人工智能·视觉检测·bert·php·超分辨率重建·openvino
AI 辅助开发的五道坎12 个问题、两天时间、无数次排查。回头看这些坑不是孤立的——它们共同指向五个系统性缺陷。理解了这五道坎,不只是 SD,任何 AI 辅助开发项目都能少走弯路。
一碗白开水一1 个月前
人工智能·深度学习·机器学习·自然语言处理·分类·bert
入门实践工程九:基于 BERT 的中文情感分类微调~附:安装依赖库及工程源码🔥 别再死磕枯燥理论了!AI 时代,拿实战作品说话才是硬道理!(原创不易哈,希望可以帮到还有些许学习劲儿的同学们) 🔥 【进阶版还在创作中,耗费精力中……】
科里 Coralyx1 个月前
gpt-3·bert·transformer
Transformer、BERT、GPT-3:大模型时代的三块地基【边界层·算法&论文】第1期Transformer、BERT、GPT-3:大模型时代的三块地基AI 这两年变化快到让人疲劳:新模型、新产品、新概念几乎按周刷新。越是在这种时候,回头看几篇打地基的论文反而更有价值,因为它们解释了为什么今天的繁荣能发生、行业为何会沿着某些路线走到现在。
半兽先生2 个月前
人工智能·分类·bert
意图分类模型,使用ber分类和LLM分类有哪些优缺点?导读:在构建企业级RAG(检索增强生成)应用时,"意图识别"往往是决定用户体验的第一道关卡。用户是想闲聊?想查文档?还是想执行某个工具调用?针对这个环节,业界主要有两种主流技术路线:传统的BERT分类模型和基于Prompt的LLM大模型分类。很多开发者在选择时容易纠结:是用轻量级的BERT,还是用理解力更强的LLM?本文将结合图片中的核心观点,从稳定性、上下文理解、扩展性及性能瓶颈四个维度进行深度对比,助你做出最合适的架构决策。
伍树明2 个月前
人工智能·深度学习·bert
NER 序列标注横向评测:BERT (Linear/CRF) VS 大模型 LoRA 微调 + API 方案实测对比如果说分类是"这段新闻讲的是什么",序列标注就是"这段话里哪些是人名、哪些是地名、哪些是机构名"。典型应用场景:
uncle_ll2 个月前
llm·nlp·bert·huggingface·hf-mirror·hf
深入探索 Hugging Face核心组件及实践随着大语言模型(LLM)技术的全面爆发,自然语言处理正式迈入工业化落地阶段。无论是企业垂直场景的智能问答、情感舆情分析,还是个人开发者的AI创意应用开发,几乎所有大模型落地项目都绕不开一个核心平台——Hugging Face。
Kobebryant-Manba2 个月前
人工智能·深度学习·机器学习·bert
Hugging Face中transformers库目录使用预训练好的bert来对你的文本做嵌入向量我们需要用一个向量来代表整句话的意思。通常有两种做法:
Kobebryant-Manba2 个月前
人工智能·深度学习·bert
Bert预训练代码目录预训练Bert用Bert表示文本:1.加载WikiText-2数据集作为小批量的预训练样本,用于遮蔽语言模型和下一句预测。批量大小是512,BERT输入序列的最大长度是64。注意,在原始BERT模型中,最大长度是512。
HySpark2 个月前
人工智能·深度学习·bert
情感识别实践(三):模型怎么选?BERT只是起点,多模态才是终点前两篇主要聊的是熙瑾会悟的数据集建设。从原始数据采集、数据清洗,到结合会议、访谈场景制定标注规范,基本把模型训练前的数据准备工作梳理了一遍。
Tbisnic2 个月前
gpt·自然语言处理·大模型·nlp·bert·预训练模型
28.NLP 三大预训练模型 ELMo/BERT/GPT + HuggingFace Transformers从词向量到双向上下文,从特征提取到微调,一篇文章理清现代 NLP 的基石如果你刚接触自然语言处理(NLP),一定会在 ELMo、BERT、GPT 这三个名字前感到困惑:它们都是预训练模型,为什么 BERT 在阅读理解上封神,GPT 成了写作利器,而 ELMo 却渐渐淡出大众视野?它们的训练方式、底层架构、适用场景到底差在哪里?