【2】大语言模型基础认知

深度塌陷:何凯明 残差连接

监督学习:标注数据,学习特征判断标签

非监督学习:非标注数据(可能是残缺的数据,缺少中间一段问题、图片遮盖住了一部分等)

强化学习:对行为进行约束或者增强时,采用强化学习(正反馈和负反馈机制)

对比维度 监督学习 非监督学习
数据类型 带标签 (Labeled) 无标签 (Unlabeled)
学习目标 预测未知数据的标签/数值 发现数据的内在结构和模式
反馈机制 有直接反馈(预测对错可知) 无直接反馈(需人工评估)
典型任务 分类、回归 聚类、降维、关联规则
数据成本 高(需人工标注) 低(仅需收集数据)
应用场景 垃圾邮件过滤、语音识别 客户分群、推荐系统、数据压缩

神经网络:分层的信息处理,深度只代表不同的维度。例如:【1,2,3,4,5,6】层次:数量、等差序列、

统计量【min,max,avg...】、下一组数据可能是【7,8,9...】等。

对比维度 传统神经网络 (如 CNN/RNN) Transformer
核心优点 1. 局部特征提取强 :CNN 在图像等网格数据上表现卓越,能高效捕捉空间局部模式。 2. 序列建模有记忆 :RNN/LSTM 具备内在的时序记忆机制,适合短序列或流式数据处理。 3. 资源相对友好:参数量和计算复杂度通常低于同规模的 Transformer,推理部署门槛较低。 1. 全局依赖捕捉 :自注意力机制能直接建模任意两个位置的关系,彻底解决长距离依赖问题。 2. 高度并行化 :无需像 RNN 那样逐步处理,可一次性处理整个序列,训练效率极高。 3. 架构通用性强:同一套架构可无缝迁移至文本、图像、音频、视频等多模态任务,泛化能力极强。
核心缺点 1. 长距离依赖困难 :RNN 存在梯度消失/爆炸问题,难以有效捕捉长序列中的远距离关联。 2. 串行处理瓶颈 :RNN 必须按顺序逐步计算,无法充分利用 GPU 并行算力,训练速度慢。 3. 跨模态扩展难:CNN/RNN 通常针对特定数据类型设计,难以像 Transformer 一样实现统一的多模态架构。 1. 计算复杂度呈平方级 :自注意力机制的计算量和显存占用随序列长度平方级增长,超长文本处理成本极高。 2. 数据饥渴症严重 :缺乏 CNN/RNN 的归纳偏置,需要海量数据才能充分学习,小数据集上易过拟合。 3. 推理开销大:生成阶段需反复计算历史 token 的注意力,KV Cache 占用大量显存,推理延迟和成本较高。

来自月之暗面(Moonshot AI)的Kimi,来自字节跳动的豆包,来自字节跳动的火山,来自腾讯的元宝

国外的主流大模型:GLM、LLama、GPT、Claude、Gemini等

多模态大语言模型:多个场景融合

相关推荐
江边风声16 小时前
从薄板到厚板、从吸盘到夹板边——坤鹏伯爵的取放技术体系是怎样覆盖全制程的
人工智能·科技·自动化·制造·pcb工艺
商业模式源码开发16 小时前
小米新车未发布即遭 AI 谣言攻击:黑色 GEO 的运作原理与企业正规防御方案
大数据·人工智能·ai·geo
edtoplort16 小时前
A股最大IPO长鑫科技295亿:从年亏163亿到日赚3亿
大数据·人工智能·科技
道影子16 小时前
《道德经》031兵者不祥,胜以丧礼处之
人工智能·深度学习·算法
MGS浪疯16 小时前
我用 WorkBuddy 做了一个能记住前文的 AI 小说编辑器
人工智能·编辑器·腾讯云·腾讯云ai代码助手·workbuddy开发者分享季·codebuddy开发者分享季
IT_陈寒16 小时前
Python的线程池把我CPU跑满了,原来少传了个参数
前端·人工智能·后端
Microvision维视智造16 小时前
买视觉系统踩过的坑,都是选型时没问对的问题,真实案例手把手教你选择视觉合作伙伴!
人工智能·计算机视觉·视觉检测·机器视觉
BSD_CGQ16 小时前
FSR压力传感器的MCU采集方案与校准算法实现
人工智能·计算机视觉·目标跟踪·adc·压力传感器·fsr·深圳源头厂家
老猿AI洞察16 小时前
阿里Qwen-Image-3.0发布:4.5K token长输入+10px小字渲染,AI生图终于能从“好看“走向“好用“了
人工智能·阿里云
愚公搬代码16 小时前
测试测试测试测试测试测试
人工智能