NLP之Bert介绍和简单示例

文章目录

  • [1. Bert 介绍](#1. Bert 介绍)
  • [2. 代码示例](#2. 代码示例)
    • [2.1 代码流程](#2.1 代码流程)

1. Bert 介绍






2. 代码示例

python 复制代码
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("bert-base-chinese")
input_ids = tokenizer.encode('欢迎来到Bert世界', return_tensors='tf')
print(input_ids)

输出内容:

python 复制代码
tf.Tensor([[ 101 3614 6816 3341 1168  100  686 4518  102]], shape=(1, 9), dtype=int32)

2.1 代码流程

代码片段涉及到了使用transformers库来加载一个预训练的BERT模型的分词器,并用它来对一段文本进行编码。以下是整体流程和目的的分步说明:

  1. 导入AutoTokenizer类:
    from transformers import AutoTokenizer这行代码导入了transformers库中的AutoTokenizer类。这个类可以自动检测并加载与给定模型相对应的分词器(tokenizer)。

  2. 加载分词器:
    tokenizer = AutoTokenizer.from_pretrained("bert-base-chinese")这行代码创建了一个分词器的实例。from_pretrained方法用于加载预先训练好的分词器,这里是"bert-base-chinese",专门为中文文本设计的BERT模型的分词器。

  3. 文本编码:
    input_ids = tokenizer.encode('欢迎来到Bert世界', return_tensors='tf')这行代码用分词器将提供的中文字符串'欢迎来到Bert世界'转换成BERT模型能够理解的输入格式,即一系列的数字ID。每个ID对应原始文本中的一个词或子词单位。return_tensors='tf'指定返回的格式为TensorFlow张量。

  4. 打印输出:
    print(input_ids)这行代码输出编码后的input_ids。这个输出是用于后续的模型预测或者微调过程的输入。

    python 复制代码
    tf.Tensor([[ 101 3614 6816 3341 1168  100  686 4518  102]], shape=(1, 9), dtype=int32)

目的:

这段代码的主要目的是为了准备数据,将自然语言文本转换为BERT模型可以接受的格式,这是使用BERT模型进行任务(如分类、问答等)前的标准步骤。

相关推荐
MetaEnchanter6 分钟前
水排序小游戏:打开就能玩,卡关不用先看广告
人工智能·ai·百万工具
LaughingZhu6 分钟前
Product Hunt 每日热榜 | 2026-09-15
人工智能·深度学习·神经网络·搜索引擎·百度
xsd202411187 分钟前
猪只行为实时AI监测:计算机视觉驱动的进食/休息/活动/社交/嗅探/走动六维行为识别与健康预警
人工智能
棣廷8 分钟前
初识深度学习——学习率调度与权重衰减
人工智能·深度学习
vibecoding778 分钟前
企业买国产模型怎么选(2026 年 9 月):先看备案,再算峰谷价、分档价与积分价,最后决定要不要多家并用
人工智能·大模型
AIGCmagic社区11 分钟前
腾讯混元 AuK 技术报告拆读:1.5B 统一语音生成与编辑,蒸馏后 4 步无 CFG 提速 4.5 倍
人工智能·算法·aigc·ai多模态
Allen_LVyingbo19 分钟前
医疗人工智能项目全生命周期管理系统:监管知识建模、工程实现与实证评估(下)
大数据·数据库·人工智能·python·自然语言处理·自动化
Forerror202621 分钟前
MAI Gateway(魔芋企业级AI网关)从零讲起:大模型网关解决什么问题?小白也能看懂
人工智能·maigateway·finapi·企业级ai网关·大模型财务管控·企业级大模型治理网关
志栋智能22 分钟前
超自动化巡检如何生成“有灵魂”的运维报告?
大数据·运维·人工智能·架构·自动化
千里码aicood22 分钟前
pyqt基于pytorch的人脸交换系统设计(opencv)
人工智能·pyqt