技术栈
transformers
2601_96207771
11 天前
python
·
nlp
·
transformers
·
spacy
·
新闻事件抽取
基于Python与NLP的新闻事件信息抽取实战:从NER到时空标准化
1. 这篇文章真正要解决的问题如果你身为一名开发者, 或许已惯于从技术博客、官方文档以及Issue那里获取信息。然而你可曾思索过, 怎样在海量的、并非结构化的新闻文本里, 自动把关键事件、实体以及关系提取出来, 且将其转变为结构化的数据, 用以供后续的分析、预警或者知识图谱构建呢? 这可不单单是新闻编辑室的需求, 更是舆情监控、风险感知、智能客服甚至AI Agent理解现实世界动态的核心能力。
All The Way North-
2 个月前
pytorch
·
bert
·
预训练模型
·
transformers
·
模型微调
·
mlm
·
完形填空
【完形填空实战】BERT中文MLM微调:数据构造→训练→评估,有完整可运行代码
完形填空(MLM)任务的真实值:藏在输入里的标签与文本分类任务(需要独立的 label 字段)不同,完形填空任务不需要额外的人工标注标签。它的真实值(Ground Truth)就是被挖掉的那个词原本的 ID。
All The Way North-
2 个月前
bert
·
huggingface
·
transformers
·
tokenizer
·
特征提取
·
pooler_output
·
last_hidden
【Transformers 实战——特征提取】从 Tokenizer 编码到 BERT 四类返回值详解与 NER 选型避坑
模型的加载及其细节,可以看这篇文章:一文吃透 Transformers 模型加载:from_pretrained 参数大全与推理全流程解析 分词器的加载及其细节,可以看这篇文章:一文吃透 HuggingFace Tokenizer:API 参数详解、encode 避坑、模型推理全流程实战
跳跳糖炒酸奶
8 个月前
人工智能
·
语言模型
·
自然语言处理
·
llm
·
transformers
·
gpt2
第十二章、GPT2:Language Models are Unsupervised Multitask Learners(理论部分)
阅读经典论文是想深入任何领域都必须经历的过程,接下来让我们看看openai的经典之作GPT2。下述内容包含很多个人观点可能存在有问题的地方,欢迎一起讨论。
fengbingchun
8 个月前
transformers
GitHub上Transformers项目将目标检测模型转换为onnx
在 https://huggingface.co/models 中有很多模型。一般会将此类模型转换为onnx,然后通过OpenCV DNN、ONNX Runtime等供项目调用。
学习是生活的调味剂
9 个月前
pytorch
·
学习
·
tensorflow
·
transformers
在大模型开发中,是否需要先完整学习 TensorFlow,再学 PyTorch?
在大模型开发中,是否需要先完整学习 TensorFlow,再学 PyTorch?其实都可以学,但关键在于顺序。更高效的做法是:先掌握 transformers 等高级库的基本使用,学会如何调整超参数。等模型调优有一定成果后,若希望更进一步,再去研究 TensorFlow、PyTorch 这类底层框架。
胡伯来了
9 个月前
人工智能
·
自然语言处理
·
transformer
·
transformers
24 Transformers - 训练自然语言处理模型
文本分类是一种常见的自然语言处理任务,它将标签或类别分配给文本。一些最大的公司将文本分类应用于各种实际应用中。最流行的文本分类形式之一是情感分析,它将标签(例如:积极、消极或中性)分配给一段文本。 在开始之前,请确保你已安装所有必要的库:
胡伯来了
9 个月前
人工智能
·
transformer
·
多模态
·
transformers
19. Transformers - 文本领域的任务类
在 Transformers 库中,可以对文本进行分类,包括文本分类(“sentiment-analysis” 或 “Text classification”)任务类、零样本文本分类(“zero-shot-classification”)任务类和命名实体识别(“ner”)任务类;可以实现文本生成,包括文本摘要(“summarization”)任务类、问答(“question-answering”)任务类、表格问答(“table-question-answering”)任务类、文本生成(“text-gene
胡伯来了
9 个月前
人工智能
·
计算机视觉
·
transformer
·
transformers
22 Transformers - 训练计算机视觉模型
图像分类意即为图像分配和标注一个”标签“或一个”分类“。与文本或音频分类不同,输入是构成图像的像素值。图像分类有很多的应用场景,例如检测自然灾害后的损伤、监测作物健康状况或帮助筛查医学图像中的疾病迹象等等。
胡伯来了
9 个月前
音视频
·
transformer
·
transformers
·
大数据模型
17 Transformers - 音频领域的任务类
在音频领域的任务中,包括实现音频分类的 AudioClassificationPipeline 任务类,能够自动识别语音的 AutomaticSpeechRecognitionPipeline 任务类, 能够经文本转化为语音即语音合成的 TextToAudioPipeline 任务类和在没有任何鉴见的样本、训练模型下也能够对给定的语音进行推理分类的 ZeroShotAudioClassificationPipeline 零样本音频分类任务类。
胡伯来了
9 个月前
人工智能
·
自然语言处理
·
nlp
·
transformer
·
transformers
13 Transformers - 使用Pipelien处理自然语言处理
NLP 任务是最常见的类型之一,因为文本是我们进行交流的自然方式。为了让文本变成模型识别的格式,需要对其进行分词。这意味着将一段文本分成单独的单词或子词(tokens),然后将这些tokens转换为数字。因此,可以将一段文本表示为一系列数字,一旦有了一系列的数字,就可以将其输入到模型中以解决各种 NLP 任务!
胡伯来了
9 个月前
人工智能
·
pytorch
·
深度学习
·
transformer
·
transformers
09 Transformers - 训练
现在,我们将看到如何在不使用Trainer类的情况下实现与上一节相同的结果。同样,我们假设您已经完成了第2节中的数据处理。这里有一个简短的总结,涵盖了你需要的一切:
胡伯来了
9 个月前
人工智能
·
计算机视觉
·
transformer
·
transformers
·
大数据模型
12 Transformers - 使用Pipeline处理计算机视觉
计算机视觉任务中最早成功之一是使用卷积神经网络(Convolutional Neural Networks,CNN)识别图像中的邮政编码。图像由像素组成,每个像素都有一个数值,使得将图像用像素值矩阵表示变得容易。每个像素值组合描述了图像的颜色。
胡伯来了
9 个月前
人工智能
·
pipeline
·
transformer
·
transformers
·
大数据模型
10 Transformers - 任务容器类 Pipeline
管道(pipelines) 是使用模型进行推理的一种强大易用的方法;是从 Transformers库中抽取出大多数复杂代码构造而成的,用于提供完成特定功能的任务类集合,包括命名实体识别、掩码语言建模、情感分析、特征提取和问答等。
胡伯来了
9 个月前
人工智能
·
深度学习
·
机器学习
·
transformer
·
transformers
08 Transformers - 微调
下面是我们如何在PyTorch中训练一个批处理的序列分类器:当然,只训练两个句子的模型不会产生很好的结果。为了得到更好的结果,你需要准备一个更大的数据集。
胡伯来了
9 个月前
人工智能
·
transformer
·
transformers
·
音频处理
·
大数据模型
11 Transformers - 使用Pipeline处理音频
音频和语音处理任务与其他模态略有不同,主要是因为音频作为输入是连续信号。与文本不同,原始音频波形不能像将句子分成单词那样整齐地分成离散的块。为了解决这个问题,原始音频信号通常以固定的间隔采样。如果在一个间隔内采样次数越多,采样率就越高,音频就越接近原始音频源。
腾飞开源
9 个月前
人工智能
·
huggingface
·
onnx
·
transformers
·
嵌入模型
·
spring ai
·
句子转换器
40_Spring AI 干货笔记之 Transformers (ONNX) 嵌入
TransformersEmbeddingModel 是一个 EmbeddingModel 实现,它使用选定的 句子转换器 在本地计算 句子嵌入。
fengbingchun
9 个月前
transformers
GitHub上Transformers项目中模型组织结构
在 https://huggingface.co/models 中有很多模型。Transformers库采用模块化和分层设计,将模型结构、配置、分词器(Tokenizer)和实用工具分离,使得模型调用、训练和扩展变得简单。核心代码位于src/transformers目录下。
Stara0511
10 个月前
计算机视觉
·
docker
·
ocr
·
transformers
·
vllm
·
deepseek
·
光学符号识别
DeepSeek-OCR私有化部署—从零构建OCR服务环境
光学字符识别(OCR)技术经历了从传统图像处理到深度学习的重要演进。早期OCR系统依赖于手工设计的特征提取器和规则引擎,在规整文档上表现良好,但在复杂场景下面临巨大挑战。随着深度学习技术的发展,特别是CNN和Transformer架构的兴起,OCR技术实现了质的飞跃。DeepSeek-OCR正是在这一技术背景下应运而生,代表了当前OCR领域的最先进水平。与传统OCR系统相比,DeepSeek-OCR摒弃了复杂的规则引擎,采用端到端的深度学习架构,在大规模多语言文本数据上训练,实现了更高的识别准确率和更强的
fengbingchun
10 个月前
transformers
GitHub上Transformers项目中推理函数pipeline的使用
Transformers是文本、计算机视觉、音频、视频和多模态模型(text, computer vision, audio, video, and multimodal model)领域最先进的机器学习模型的模型定义框架(model-definition framework),可用于推理和训练。源码:https://github.com/huggingface/transformers,最新发布版本v4.57.1,license为Apache-2.0。