T5大模型

T5 完整全称

Text-to-Text Transfer Transformer

中文直译:文本到文本迁移Transformer模型

简短拆解含义

  1. Text-to-Text(文本转文本)
    所有NLP任务统一范式:不管翻译、摘要、问答、分类,输入一段文本、输出一段文本,靠任务前缀区分任务(比如summarize:translate English to Chinese:)。
  2. Transfer(迁移学习)
    先在海量C4语料预训练,再小数据微调适配下游业务。
  3. Transformer
    标准Encoder-Decoder双端架构(区别于BERT仅编码器、GPT仅解码器)。

补充关键细节

  • 2019年Google Research发布,论文标题:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
  • 没有token_type_ids输入参数(和BERT不一样);依靠前缀指令区分任务,位置编码用相对位置偏置而非绝对position_ids
  • 衍生变体:mT5(多语言)、Flan-T5(指令微调增强)、CodeT5(代码专用)
相关推荐
哈哈,柳暗花明2 小时前
人工智能专业术语详解(O)
人工智能·专业术语
不羁的木木2 小时前
HarmonyOS AI开发提效工具:DevEco Code & DevEco CLI - 初识与配置指南
人工智能·华为·harmonyos
Kagol2 小时前
Superpowers GSD gstack AgentSkills深度测评
前端·人工智能
一切皆是因缘际会2 小时前
存算一体芯片软件双模式:单字符驱动网络(普通CPU也能跑)
人工智能·物联网·ai·系统架构·架构设计·发布订阅·存算一体
字节逆旅2 小时前
Claude Code Router 接入过程的爬坑记录
人工智能·claude
江畔柳前堤2 小时前
github实战指南01-账号配置与 SSH 密钥
运维·人工智能·深度学习·ssh·github·pyqt·信号处理
workflower3 小时前
使用大语言模型处理用户需求
大数据·人工智能·设计模式·重构·动态规划
CodePlayer竟然被占用了4 小时前
没有生态的大模型不算前沿
人工智能