技术栈
bert
月疯
6 天前
人工智能
·
深度学习
·
bert
bert的架构解析
结构介绍:简介:设置场景(词汇表大小=5,维度=2,句子“我 [MASK] 自然”)。步骤1:嵌入 + 位置编码(具体数字)。
Jialu.
9 天前
人工智能
·
深度学习
·
bert
模型压缩实战:BERT 量化从 390MB 到 146MB 的实践
模型训练通常使用 FP32 浮点数。它精度高,但参数占用空间较大。量化可以使用更低位数的数据表示参数,从而减少模型体积,并在部分硬件上提升推理速度。
Kobebryant-Manba
9 天前
人工智能
·
学习
·
bert
学习Bert微调
dense就是全连接层理论上拿哪个都行,但人家大模型训练是对<cls>"class意思"这个学习的,要用人家训练好的东西微调,那最好就得一样了(用cls是因为我们在预训练bert的时候nsp就是用cls去进行预测的 这样下游任务与预训练尽量保持统一)
Jialu.
13 天前
人工智能
·
pytorch
·
分类
·
微软
·
nlp
·
bert
中文 BERT 多任务分类项目:从模型结构到训练细节
项目将评论分析拆成三个独立分类任务:投诉分流四分类、虚假评论二分类、广告骚扰二分类。每个任务使用自己的训练数据和分类头。
Jialu.
13 天前
深度学习
·
nlp
·
bert
从 102M 到 34M:BERT 到 BiLSTM 的完整知识蒸馏实现
BERT 语义能力强,但参数量约 102M,模型文件约 390MB。直接部署会带来较大的内存占用和推理成本。
傲笑风
14 天前
人工智能
·
python
·
自然语言处理
·
nlp
·
bert
·
openvino
【openvino】tinybert基于openvino服务化部署(四)
与tinybert-mediapipe的文件夹结构完整一样,只有部分文件需要更改:其实配置文件config.json基本不变,只是改了name和base_path而已,其它保持不变
Lee_jerome
19 天前
微调
·
bert
·
迁移学习
·
文本分类
·
预训练
·
小样本
·
冻结特征
python神经网络编程入门(四十四)——微调预训练 BERT 做下游任务
📍 路标:本篇位于《从零构建 Transformer》系列 第 15/16 章 · 实战篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16·本篇) ▸ 知识收官
Tbisnic
25 天前
算法
·
自然语言处理
·
大模型
·
bert
·
transformer
·
注意力机制
BGE-M3 算法详解:从模型架构到三种检索方式的数学原理
2024年1月30日,智源研究院(BAAI)发布了BGE家族的新成员——BGE-M3。BGE-M3是首个集多语言(Multi-Linguality)、多粒度(Multi-Granularity)、多功能(Multi-Functionality)三大技术特征于一体的语义向量模型-。
bulingg
1 个月前
人工智能
·
深度学习
·
bert
bert输入长度有限,如何处理超长文本?
在自然语言处理中,处理超长文本是一个常见挑战。模型通常有最大输入长度限制,对于超过限制(如1万token)的文本,核心思路分为模型架构改造和输入策略适配两大类。
bittersuite
1 个月前
人工智能
·
深度学习
·
bert
BERT,fine-tuning
BERT(预训练) NLP 迁移学习的思路是:用大规模预训练模型(如 Word2vec、语言模型)提供通用语言知识,再加任务特定层做微调。但传统方法有时序或方向上的局限,而 Transformer(尤其是其双向 Self-Attention)为更好的预训练模型(BERT 等)提供了架构基础。
leoZ231
1 个月前
开发语言
·
人工智能
·
视觉检测
·
bert
·
php
·
超分辨率重建
·
openvino
AI 辅助开发的五道坎
12 个问题、两天时间、无数次排查。回头看这些坑不是孤立的——它们共同指向五个系统性缺陷。理解了这五道坎,不只是 SD,任何 AI 辅助开发项目都能少走弯路。
一碗白开水一
1 个月前
人工智能
·
深度学习
·
机器学习
·
自然语言处理
·
分类
·
bert
入门实践工程九:基于 BERT 的中文情感分类微调~附:安装依赖库及工程源码
🔥 别再死磕枯燥理论了!AI 时代,拿实战作品说话才是硬道理!(原创不易哈,希望可以帮到还有些许学习劲儿的同学们) 🔥 【进阶版还在创作中,耗费精力中……】
科里 Coralyx
1 个月前
gpt-3
·
bert
·
transformer
Transformer、BERT、GPT-3:大模型时代的三块地基
【边界层·算法&论文】第1期Transformer、BERT、GPT-3:大模型时代的三块地基AI 这两年变化快到让人疲劳:新模型、新产品、新概念几乎按周刷新。越是在这种时候,回头看几篇打地基的论文反而更有价值,因为它们解释了为什么今天的繁荣能发生、行业为何会沿着某些路线走到现在。
半兽先生
2 个月前
人工智能
·
分类
·
bert
意图分类模型,使用ber分类和LLM分类有哪些优缺点?
导读:在构建企业级RAG(检索增强生成)应用时,"意图识别"往往是决定用户体验的第一道关卡。用户是想闲聊?想查文档?还是想执行某个工具调用?针对这个环节,业界主要有两种主流技术路线:传统的BERT分类模型和基于Prompt的LLM大模型分类。很多开发者在选择时容易纠结:是用轻量级的BERT,还是用理解力更强的LLM?本文将结合图片中的核心观点,从稳定性、上下文理解、扩展性及性能瓶颈四个维度进行深度对比,助你做出最合适的架构决策。
伍树明
2 个月前
人工智能
·
深度学习
·
bert
NER 序列标注横向评测:BERT (Linear/CRF) VS 大模型 LoRA 微调 + API 方案实测对比
如果说分类是"这段新闻讲的是什么",序列标注就是"这段话里哪些是人名、哪些是地名、哪些是机构名"。典型应用场景:
uncle_ll
2 个月前
llm
·
nlp
·
bert
·
huggingface
·
hf-mirror
·
hf
深入探索 Hugging Face核心组件及实践
随着大语言模型(LLM)技术的全面爆发,自然语言处理正式迈入工业化落地阶段。无论是企业垂直场景的智能问答、情感舆情分析,还是个人开发者的AI创意应用开发,几乎所有大模型落地项目都绕不开一个核心平台——Hugging Face。
Kobebryant-Manba
2 个月前
人工智能
·
深度学习
·
机器学习
·
bert
Hugging Face中transformers库
目录使用预训练好的bert来对你的文本做嵌入向量我们需要用一个向量来代表整句话的意思。通常有两种做法:
Kobebryant-Manba
2 个月前
人工智能
·
深度学习
·
bert
Bert预训练代码
目录预训练Bert用Bert表示文本:1.加载WikiText-2数据集作为小批量的预训练样本,用于遮蔽语言模型和下一句预测。批量大小是512,BERT输入序列的最大长度是64。注意,在原始BERT模型中,最大长度是512。
HySpark
2 个月前
人工智能
·
深度学习
·
bert
情感识别实践(三):模型怎么选?BERT只是起点,多模态才是终点
前两篇主要聊的是熙瑾会悟的数据集建设。从原始数据采集、数据清洗,到结合会议、访谈场景制定标注规范,基本把模型训练前的数据准备工作梳理了一遍。
Tbisnic
2 个月前
gpt
·
自然语言处理
·
大模型
·
nlp
·
bert
·
预训练模型
28.NLP 三大预训练模型 ELMo/BERT/GPT + HuggingFace Transformers
从词向量到双向上下文,从特征提取到微调,一篇文章理清现代 NLP 的基石如果你刚接触自然语言处理(NLP),一定会在 ELMo、BERT、GPT 这三个名字前感到困惑:它们都是预训练模型,为什么 BERT 在阅读理解上封神,GPT 成了写作利器,而 ELMo 却渐渐淡出大众视野?它们的训练方式、底层架构、适用场景到底差在哪里?