PYTHON+AI LLM DAY FIFITY-TWO

今天简单聊聊自然语言处理(NLP):自然语言处理就是让计算机能够看懂(NLU)和生成(NLG)人类语言的过程.分别衍生出了基于NLU的Bert方向和NLG方向的GPT.在训练模型前需对文本进行预处理.(文本预处理就是文本给到模型前做的所有动作)因为数据决定了模型的上限,指导模型进行超参数选择,也能更好地评估模型.常见文本预处理包括:文本特征处理:增加特征,标准化,归一化,处理缺失值等,数据不均衡:重采样.文本处理基本方法:分词(常用jieba库,也可写入自定义词典),词性标注(POS),命名实体识别(ENR).文本张量表示方法:将一段文本进行张量表示的过程,目的是计算机能够识别,方便进行模型训练.词向量的表示方式:one-hot:一个n*n的单位矩阵.操作简单,便于理解.占用内存太多,容易维度爆炸.word2vec:将单词转化成词向量进行自然语言处理的技术,用深度学习网络来探索单词之间的语义关系,深度学习网络权重参数表示词向量.是无监督语料上构建的有监督任务.用到的两种训练方式:CBOW:简单来说就是根据两头的词预测中间的词,Skip-Gram就是根据中间的词预测两头的词.wordEmbedding:将词映射到指定维度的词向量空间,自定义的神经网络模型,权重和参数参与更新.

相关推荐
艾莉丝努力练剑1 分钟前
【AI大模型接入SDK】ChatSDK架构设计与实现
网络·c++·人工智能·学习·语言模型
Data-Miner1 分钟前
做表格数据分析的AI工具怎么选?先对一下这三个真实需求,再看哪些真能落地
人工智能·数据分析·excel
闭包不眠12 分钟前
网站支持HEIC上传要多大解码器?gzip后510KB
图像处理·人工智能·计算机视觉
Leo.yuan25 分钟前
从 DataX 到 Informatica,再到国产一体化平台:2026 年企业数据集成平台怎么选
人工智能
叠层归一研究院27 分钟前
区分预算与通道诱导:Ω–L叠层体系的观测赋值与定量验证
人工智能·算法
知几蜗牛36 分钟前
AI权限写进JSON就安全了吗?真正缺的是配置生效验证
人工智能
知几蜗牛38 分钟前
大模型会规划,为什么人形机器人还站不稳?关键是双层控制
人工智能
爱签AI电子合同41 分钟前
电子合同上手成本怎么测?易用性维度专项测评
服务器·人工智能·智能合约·企业微信
知几蜗牛43 分钟前
多发一点CSS,页面反而更快:GitHub大规模样式迁移的真正方法
人工智能
小酒星小杜1 小时前
画 AI 漫画,别只会写“日漫风”:10 种画风、适用故事和可复制提示词
人工智能·设计模式·程序员