Day25 - 大模型的三大架构

大模型

  • 大语言模型
  • Large Language Models(LLMs)
  • 参数量:B Billion 十亿
    • 类脑设计:参数看作脑细胞,脑细胞越多,越聪明
    • 数学视角:y=F(x),参数看作自变量,自变量越多,函数越复杂,越能映射复杂的关系
  • 训练平台:
    • 工程上:不可能脱离GPU,而且需要高性能GPU
  • 训练数据:
    • 预训练:18T语料
      • 18T表示18万亿,一本红楼梦约50万token,18T语料相当于3600万本红楼梦
  • 训练时长
    • 原来:3 ~ 6个月
    • 现在:1 ~ 2个月

质的变化

本质:天下大势,分久必合,合久必分

小模型时代:

  • 单一职责原则
    • 一个场景:
      • 单独一个模型
      • 单独一个数据集
      • 单独训练
      • 单独评估
      • 单独部署
      • 单独维护
  • 一个系统:
    • 挂了很多微服务
    • 挂了很多的小模型

大模型时代:AGI(Artificial General Intelligence)

  • 大一统
    • 一个系统:
      • 挂了一个大模型
        • 通过指令遵循,可以同时解决不同的问题
      • 多模态大模型

生成式人工智能 VS 判别式人工智能

Generative AI

创作性

如何进行人机协同是下一步的重点

具身机器人

大语言模型的架构

  • 架构一:Encoder - Decoder架构
    • 直接把 transformer 变厚即可
    • T5:Text to Text transfer Transformer
    • Google
    • 最正确、最正统、最没有歧义的路线,但死的最快。
      • 革命性的东西往往不按常理出牌,transformer的诞生代替了Seq2Seq,而Seq2Seq是全世界公认的生成式算法。
    • 首次提出:指令编码的基础理念
  • 架构二:Decoder - Only 架构
    • 把模型的复杂度降低
    • 除了GLM之外,这种架构是唯一的
      • LLaMA架构
        • LLaMA2
      • 千问系列
      • 豆包
      • 星火
      • kimi
  • 架构三:GLM(Prefix-Encoder-Only )架构
    • 融合 BERT 和 GPT 的优势,提出了一种混合结构
    • 理解上文:双向编码器的优势(BERT)
    • 生成下文:强大的自回归能力(GPT)
相关推荐
思通数科x4 分钟前
AI监控赋能健身馆与游泳馆全方位守护,提升安全效率
人工智能·安全·目标检测·机器学习·计算机视觉·自然语言处理·ocr
宸码24 分钟前
【机器学习】【无监督学习——聚类】从零开始掌握聚类分析:探索数据背后的隐藏模式与应用实例
人工智能·python·学习·算法·机器学习·数据挖掘·聚类
**之火25 分钟前
(六)机器学习 - 正态数据分布
人工智能·机器学习
铭瑾熙1 小时前
机器学习之强化学习
人工智能·机器学习
自信的小螺丝钉1 小时前
【AI知识】有监督学习之回归任务(附线性回归代码及可视化)
人工智能·回归·有监督学习
视觉语言导航1 小时前
西工大经典力作!AerialVLN:空中无人机视觉语言导航数据集
人工智能·具身智能
量子-Alex1 小时前
【反无人机目标检测与跟踪】DUT Anti-UAV数据集介绍
人工智能·目标检测·无人机
小熊bdg2 小时前
3D 生成重建032-Find3D去找到它身上的每一份碎片吧
人工智能·3d·aigc
volcanical2 小时前
Word2Vec
人工智能·自然语言处理·word2vec
〖是♂我〗2 小时前
OpenCV中的识别图片颜色并绘制轮廓
人工智能·opencv·计算机视觉