Bert 将长段分成句子放在一个batch输入

bash 复制代码
from nltk.tokenize import RegexpTokenizer

sentence = """Thomas Jefferson began building Monticello at the age of 26."""
# 按照自己的规则进行分词,使用正则分词器
# \w 匹配字母、数字、下划线
# 匹配任何非空白字符
tokenizer = RegexpTokenizer(r'\w+|$[0-9.]+|\S+')
print(tokenizer.tokenize(sentence))

bert的任务 上下句和mask,mask掩码就是需要预测的部分,上下句预测现在基本不用了 mask基本都会加上,mask 可以控制掩住哪里

使用预训练模型时候要注意预训练的权重是在什么类型的数据集上训练的,方面情感分析 可以分为多少个方面类也比较重要

相关推荐
skywalk81632 分钟前
Windows下安装编译安装Whisper-CPP:一个语音实现框架集和高性能推理模型
人工智能·windows·whisper
Spliceㅤ3 分钟前
Product-classify-bert项目
人工智能·深度学习·bert
Old Uncle Tom3 分钟前
Claude Code 上下文压缩分析
人工智能·ai·agent
Apache IoTDB3 分钟前
【应用案例】电价“先知”!IoTDB 结合 AI 能力,实现电价精准预测
人工智能·iotdb
weixin_416660074 分钟前
2026 年 AI 对话转 Word 工具分析:Pandoc、Typora、aitoword 怎么选
人工智能·word
前端不太难7 分钟前
深度解析:OpenClaw 多智能体系统四大支柱
人工智能·状态模式·openclaw
newbe3652412 分钟前
Design.md:让 AI 一致性进行前端 UI 设计的解决方案
前端·人工智能·ui
摇滚侠13 分钟前
从 Vibe Coding 到 Spec Coding:研发范式演进与高质量交付
java·人工智能·ai编程
无限大.14 分钟前
数字生存05:在AI时代,如何保持学习能力,不断成长
人工智能·学习
EasyCVR15 分钟前
国标GB28181视频监控平台EasyCVR视频质量诊断赋能智慧城市精细化治理
人工智能·音视频·智慧城市