【想法】NLP的基石-Word Embedding

这两天突然想到一个问题:什么NLP的基础?依照我目前的理解,我想应该是word embedding,即对文本的表示。这其中又包含两个概念,similaritycontext

让我们来思考一下人类的语言系统,我们是怎么理解一个词的意义的?在此之前,我们先回忆一下货币的出现。在货币出现之前,人们其实是以物易物的。比如我们知道"一颗珍珠"可以换"10块石头",这两种东西本身是没有价值的,他们彼此赋予了对方意义,这其实就是一种similarity。

回到语言上,比如对"好"这个字,我们如何理解其意义?如果让我解释,我一定会说,"好"就是表示"正面的","积极的","美的东西"。这其实就是代表,这些词之间具备相似性。所以说,词或字本身没有意义,是相似度将一些词关联起来,赋予了彼此意义。这就是为什么在NLP中,以similarity为基础来学习文本表征

同时,一个词在不同上下文中会有不同的意思(其实就是和不同词的相似度比较大)。比如"你这个人真好","好"与"善良的"相似度比较大,在"你这个字写的真好"中,"好"就与"漂亮的"相似度比较高。我们常说,语义受context影响,其实就是说,context影响similarity,在不同context中,词与词之间的similarity会改变

相关推荐
观远数据19 分钟前
A Blueberry 签约观远数据,观远BI以一站式现代化驱动服饰企业新增长
大数据·数据库·人工智能·数据分析
IT_陈寒24 分钟前
JavaScript性能飞跃:5个V8引擎优化技巧让你的代码提速300%
前端·人工智能·后端
工藤学编程27 分钟前
零基础学AI大模型之大模型的“幻觉”
人工智能
史锦彪30 分钟前
用 PyTorch 实现 MNIST 手写数字识别:从入门到实践
人工智能·pytorch·python
董建光d32 分钟前
PyTorch 实现 MNIST 手写数字识别完整流程(含数据处理、模型构建与训练可视化)
人工智能·pytorch·python
cxr82833 分钟前
AI智能体赋能金融研究领域之仿真:流动性风暴下的高维战略 —— QT驱动的系统性失位与方舟部署蓝图
人工智能·qt·金融·ai赋能
却道天凉_好个秋43 分钟前
OpenCV(十):NumPy中的ROI
人工智能·opencv·numpy
fsnine2 小时前
Python人脸检测
人工智能·计算机视觉
追光的蜗牛丿3 小时前
目标检测中的ROI Pooling
人工智能·目标检测·计算机视觉
flying_13143 小时前
自然语言处理分享系列-词语和短语的分布式表示及其组合性(一)
自然语言处理·nlp·word2vec·softmax·skip-gram·hierarchical·分层softmax