HUGGINGFACE NLP- MAIN NLP TASKS

1 Token classification

1.1 分类

1.1.1 实体命名识别 (NER): 找出句子中的实体(如人物、地点或组织)。这可以通过为每个实体或"无实体"指定一个类别的标签。

1.1.2 词性标注 (POS): 将句子中的每个单词标记为对应于特定的词性(如名词、动词、形容词等)。

1.1.3 分块(chunking): 找到属于同一实体的Token。这个任务(可结合POS或NER)可以任何将一块Token作为制定一个标签(通常是B -),另一个标签(通常I -)表示Token是否是同一块,和第三个标签(通常是O)表示Token不属于任何块。也就是标出句子中的短语块,例如名词短语(NP),动词短语(VP)等。

1.2 标签

1.2.1 不同tokenizer有不同分类标签

1.2.2 常见

O 表示这个词不对应任何实体。

B-PER/I-PER意味着这个词对应于人名实体的开头/内部。

B-ORG/I-ORG 的意思是这个词对应于组织名称实体的开头/内部。

B-LOC/I-LOC 指的是是这个词对应于地名实体的开头/内部。

B-MISC/I-MISC 表示该词对应于一个杂项实体的开头/内部。

1.3 处理数据

1.3.1 可以扩展我们的标签列表以匹配token

1.4 train

1.4.1 DataCollatorForTokenClassification. Like the DataCollatorWithPadding, it takes the tokenizer used to preprocess the inputs:

1.4.2 Metrics

To have the Trainer compute a metric every epoch,

1.5 reDefining the model

1.5.1

javascript 复制代码
id2label = {i: label for i, label in enumerate(label_names)}
label2id = {v: k for k, v in id2label.items()}


model = AutoModelForTokenClassification.from_pretrained(
    model_checkpoint,
    id2label=id2label,
    label2id=label2id,
)

1.6 Fine-tuning the model

1.6.1 TrainingArguments

1.6.2 A custom training loop

Preparing everything for training

2 微调掩码语言模型

2.1 在域内数据上微调预训练语言模型的过程通常称为 领域适应

2.2 选择用于掩码语言建模的预训练模型

相关推荐
阿杰学AI1 天前
AI核心知识86——大语言模型之 Superalignment(简洁且通俗易懂版)
人工智能·深度学习·ai·语言模型·超级对齐·superalignment·#ai安全
CV@CV1 天前
拆解自动驾驶核心架构——感知、决策、控制三层逻辑详解
人工智能·机器学习·自动驾驶
海心焱1 天前
从零开始构建 AI 插件生态:深挖 MCP 如何打破 LLM 与本地数据的连接壁垒
jvm·人工智能·oracle
阿杰学AI1 天前
AI核心知识85——大语言模型之 RLAIF(简洁且通俗易懂版)
人工智能·深度学习·ai·语言模型·aigc·rlaihf·基于ai反馈的强化学习
Coco恺撒1 天前
【脑机接口】难在哪里,【人工智能】如何破局(2.研发篇)
人工智能·深度学习·开源·人机交互·脑机接口
kebijuelun1 天前
ERNIE 5.0:统一自回归多模态与弹性训练
人工智能·算法·语言模型·transformer
Network_Engineer1 天前
从零手写LSTM:从门控原理到PyTorch源码级实现
人工智能·pytorch·lstm
芝士爱知识a1 天前
AlphaGBM 深度解析:下一代基于 AI 与蒙特卡洛的智能期权分析平台
数据结构·人工智能·python·股票·alphagbm·ai 驱动的智能期权分析·期权
weixin_6681 天前
GitHub 2026年AI项目热度分析报告-AI分析-分享
人工智能·github
vlln1 天前
【论文速读】达尔文哥德尔机 (Darwin Gödel Machine): 自进化智能体的开放式演化
人工智能·深度学习·ai agent