【想法】NLP的基石-Word Embedding

这两天突然想到一个问题:什么NLP的基础?依照我目前的理解,我想应该是word embedding,即对文本的表示。这其中又包含两个概念,similaritycontext

让我们来思考一下人类的语言系统,我们是怎么理解一个词的意义的?在此之前,我们先回忆一下货币的出现。在货币出现之前,人们其实是以物易物的。比如我们知道"一颗珍珠"可以换"10块石头",这两种东西本身是没有价值的,他们彼此赋予了对方意义,这其实就是一种similarity。

回到语言上,比如对"好"这个字,我们如何理解其意义?如果让我解释,我一定会说,"好"就是表示"正面的","积极的","美的东西"。这其实就是代表,这些词之间具备相似性。所以说,词或字本身没有意义,是相似度将一些词关联起来,赋予了彼此意义。这就是为什么在NLP中,以similarity为基础来学习文本表征

同时,一个词在不同上下文中会有不同的意思(其实就是和不同词的相似度比较大)。比如"你这个人真好","好"与"善良的"相似度比较大,在"你这个字写的真好"中,"好"就与"漂亮的"相似度比较高。我们常说,语义受context影响,其实就是说,context影响similarity,在不同context中,词与词之间的similarity会改变

相关推荐
漂流瓶jz2 小时前
【AI】大模型本地部署与量化:Ollama、transformers、llama.cpp实践
人工智能·llm·ai编程
飞哥数智坊3 小时前
AI时代,我们到底该学什么、用什么,为什么还没提效?
人工智能
飞哥数智坊4 小时前
GPT 做架构,国内模型写代码:这条 AI 开发路线能跑通吗?
人工智能·ai编程
AI_AGENT_DEV_AI4 小时前
AI 智能体的开发与上线
人工智能
VL——MOESR4 小时前
【具身智能】VLA论文阅读随笔
论文阅读·人工智能·机器学习·具身智能·vla
OCR_133716212754 小时前
从模板匹配到AI泛化识别:文本抽取如何重构护照阅读器落地生态
人工智能·重构
大唐荣华5 小时前
从OpenAI关停Sora看世界模型、AI视频与国内具身智能赛道路线分化
人工智能·openai·sora·内容生成
DevOps老兵5 小时前
AI Infra实战02:GPU监控实战,用DCGM+Prometheus+Grafana看清每一张卡
人工智能·grafana·prometheus·ai infra·gpu监控·dcgm
旧日之血_Hayter5 小时前
Antigravity 工作流的实践记录
人工智能
dozenyaoyida5 小时前
AI与大模型新闻日报 | 2026-09-01
人工智能·ai·大模型·新闻