【学习草稿】bert文本分类

https://github.com/google-research/bert

https://github.com/CyberZHG/keras-bert

在 BERT 中,每个单词的嵌入向量由三部分组成:

Token 嵌入向量:该向量是 WordPiece 分词算法得到的子单词 ID 对应的嵌入向量。

Segment 嵌入向量:该向量用于表示每个单词所属的句子。对于一个包含两个句子的序列,使用0表示第一个句子,使用1表示第二个句子。对于一个只包含一个句子的序列,将所有的句子标记都设置为0。

Position 嵌入向量:该向量用于表示每个单词在序列中的位置。对于一个长度为L的序列,每个单词都会被分配一个表示其位置的向量,该向量的维度为d,其中d是嵌入向量的维度。

这三个向量会被按照一定的方式进行组合,得到一个最终的嵌入向量,用于表示当前单词在上下文中的语义信息。这个嵌入向量会作为输入序列的一部分,输入到模型中进行训练或推理。


return ["".join(x) for x in output]

return ["".join(x) for x in output]是一个列表推导式,用于将output列表中的子列表转换为字符串列表。

具体来说,output列表中的每个子列表表示一个单词,其中包含了该单词中的所有字符。例如,对于输入文本Hello, world!,_run_split_on_punc()函数会将其分割成一个包含5个子列表的列表[['H', 'e', 'l', 'l', 'o'], [','], [' '], ['w', 'o', 'r', 'l', 'd'], ['!']],其中每个子列表表示一个单词。

列表推导式["".join(x) for x in output]的作用是将每个子列表中的字符拼接成一个字符串,并将这些字符串组合成一个新的字符串列表。具体来说,"".join(x)将一个子列表中的所有字符拼接成一个字符串,而["".join(x) for x in output]则将output列表中的每个子列表都转换为一个字符串,并将这些字符串组合成一个新的列表。

例如,对于输入文本Hello, world!,_run_split_on_punc()函数会将其分割成一个包含5个子列表的列表[['H', 'e', 'l', 'l', 'o'], [','], [' '], ['w', 'o', 'r', 'l', 'd'], ['!']],而列表推导式["".join(x) for x in output]则会将这些子列表转换为一个新的字符串列表['Hello', ',', ' ', 'world', '!'],其中每个字符串表示一个单词。

打印格式问题,才会有空格。。


![在这里插入图片描述](https://img-blog.csdnimg.cn/56628d678330476fab698daf7d8c5703.png![在这里插入图片描述](https://file.jishuzhan.net/article/1715654994151084034/8892b00c510de9e7b0d8d1adce37567c.webp)

相关推荐
红叶落水18 分钟前
研电赛-基于GD32的纳型无人机AI追踪系统2
人工智能·无人机
sakabu19 分钟前
ESP32 外设驱动开发指南 (ESP-IDF框架)——GPIO篇:基础配置、外部中断与PWM(LEDC模块)应用
笔记·单片机·学习·esp32
代码哈士奇19 分钟前
VitePress学习笔记
javascript·笔记·学习
棱镜研途24 分钟前
科研快报 |无人机+AI:广东防控基孔热背后的技术革命
图像处理·人工智能·计算机视觉·ai·视觉检测·无人机·基孔肯雅热
斜月30 分钟前
Jupyter Notebook 与 Pandas 绘图实践
人工智能·python
小眼睛FPGA35 分钟前
【盘古100Pro+开发板实验例程】FPGA学习 | 基于紫光 FPGA 的键控 LED 流水灯
科技·学习·ai·fpga开发·fpga
天才少女爱迪生39 分钟前
pytorch的自定义 CUDA 扩展怎么学习
人工智能·pytorch·学习
37手游后端团队40 分钟前
AI生成回流文案在《凡人修仙传:人界篇》应用
人工智能·后端·云原生
OpenBayes41 分钟前
OpenBayes 教程上新丨仅激活 3B 参数可媲美 GPT-4o,Qwen3 深夜更新,一手实测来了!
人工智能·机器学习·gpt-4o·qwen3·在线教程·长文本理解能力·指令跟随
即兴小索奇42 分钟前
GPT-5预发布——GPT-5直面谷歌Gemini、DeepSeek...
人工智能·gpt·gpt5