【想法】NLP的基石-Word Embedding

这两天突然想到一个问题:什么NLP的基础?依照我目前的理解,我想应该是word embedding,即对文本的表示。这其中又包含两个概念,similaritycontext

让我们来思考一下人类的语言系统,我们是怎么理解一个词的意义的?在此之前,我们先回忆一下货币的出现。在货币出现之前,人们其实是以物易物的。比如我们知道"一颗珍珠"可以换"10块石头",这两种东西本身是没有价值的,他们彼此赋予了对方意义,这其实就是一种similarity。

回到语言上,比如对"好"这个字,我们如何理解其意义?如果让我解释,我一定会说,"好"就是表示"正面的","积极的","美的东西"。这其实就是代表,这些词之间具备相似性。所以说,词或字本身没有意义,是相似度将一些词关联起来,赋予了彼此意义。这就是为什么在NLP中,以similarity为基础来学习文本表征

同时,一个词在不同上下文中会有不同的意思(其实就是和不同词的相似度比较大)。比如"你这个人真好","好"与"善良的"相似度比较大,在"你这个字写的真好"中,"好"就与"漂亮的"相似度比较高。我们常说,语义受context影响,其实就是说,context影响similarity,在不同context中,词与词之间的similarity会改变

相关推荐
凯禾瑞华养老实训室1 小时前
人才教育导向下:老年生活照护实训室助力提升学生老年照护服务能力
人工智能
湫兮之风2 小时前
Opencv: cv::LUT()深入解析图像块快速查表变换
人工智能·opencv·计算机视觉
Christo32 小时前
TFS-2018《On the convergence of the sparse possibilistic c-means algorithm》
人工智能·算法·机器学习·数据挖掘
qq_508823402 小时前
金融量化指标--2Alpha 阿尔法
大数据·人工智能
黑金IT3 小时前
`.cursorrules` 与 `.cursorcontext`:Cursor AI 编程助手时代下的“双轨配置”指南
人工智能
dlraba8024 小时前
基于 OpenCV 的信用卡数字识别:从原理到实现
人工智能·opencv·计算机视觉
IMER SIMPLE4 小时前
人工智能-python-深度学习-经典神经网络AlexNet
人工智能·python·深度学习
小憩-6 小时前
【机器学习】吴恩达机器学习笔记
人工智能·笔记·机器学习
却道天凉_好个秋6 小时前
深度学习(二):神经元与神经网络
人工智能·神经网络·计算机视觉·神经元
UQI-LIUWJ6 小时前
unsloth笔记:运行&微调 gemma
人工智能·笔记·深度学习