1. 判别式感知任务
- 分类(离散输出):图像识别、文本情感分析、语音指令识别。
- 回归(连续输出):除了天气预测,还有年龄估计、股票价格预测、深度估计(单目测距)。
- 排序/度量学习(输出相对顺序或相似度):人脸识别(比对两张脸的相似度)、图像检索、推荐系统的Embedding召回(本质是学习一个度量空间,而非简单的检索)。
2. 结构化感知任务(从"是什么"进阶到"在哪里")
- 目标检测:输出边界框(坐标回归 + 分类),如自动驾驶中的行人检测。
- 语义/实例/全景分割:输出像素级掩码(每个像素做分类),如医疗影像中的器官分割。
- 关键点/姿态估计:输出特定坐标点集,如人体骨骼关键点检测、人脸关键点对齐。
3. 生成式复原与创作任务
- 超分辨率/去噪/去模糊:低质量输入 → 高质量输出(Ill-posed inverse problem,病态逆问题)。
- 图像/视频/音频生成:文本生成图像(Stable Diffusion)、语音合成(TTS)、视频生成(Sora)。
- 风格迁移/域迁移:将输入映射到另一个域(如照片变油画、马变斑马、白天变黑夜)。
4. 序列与时间动态建模任务(天气预测深层本质)
天气预测不仅是回归,更是时序预测。这类任务包括:
- 自回归预测:用历史序列预测未来序列(如流量预测、股价)。
- 序列转换(Seq2Seq):输入序列 → 输出序列(如机器翻译、语音识别、文本摘要)。
- 事件预测/时序动作定位:在连续视频流中判断"何时"发生了"什么动作"。
5. 异常与分布外检测任务
- 离群点检测:在数据分布中查找显著偏离的点(如金融反欺诈)。
- 新颖性检测:判断样本是否属于训练集从未见过的类别(如工业质检中的未知缺陷)。
- 变化点检测:检测时间序列中统计特性的突变(如设备故障预警)。
6. 表示学习与降维任务(无监督/自监督核心)
- 嵌入(Embedding)学习:将高维稀疏数据映射为低维稠密向量(如Word2Vec、图嵌入)。
- 聚类:无标签地将数据按内在相似性分组(如用户画像分群)。
- 对比学习/掩码重建:MAE(掩码自编码器)或SimCLR,本质是学习具有高度语义不变性的特征空间,常作为预训练手段。
7. 决策与交互控制任务(强化学习与主动推理)
- 序列决策:根据当前状态(State)输出动作(Action),最大化长期回报,如围棋落子、机器人抓取、自动驾驶的横向/纵向控制。
- 模仿学习/逆强化学习:从专家轨迹中反推奖励函数或直接学习策略。
8. 结构预测与图学习任务(非欧空间数据)
- 节点/边/图分类:如分子性质预测(这个分子是否有毒)、社交网络好友推荐。
- 链接预测:预测两个节点之间是否存在潜在关系(知识图谱补全)。
- 组合优化求解:用GNN(图神经网络)预测旅行商问题(TSP)的最优路径节点排序。
一个更本质的视角(哲学归纳):
上述所有任务,本质上都是在学习一个映射函数 f:X→Yf: X \to Yf:X→Y ,任务的区别仅在于目标空间 YYY 的结构:
- YYY 是离散标量 → 分类
- YYY 是连续标量 → 回归
- YYY 是坐标/框/点集 → 检测/姿态
- YYY 是网格概率图 → 分割
- YYY 是与XXX同维度的张量 → 生成/复原
- YYY 是变长序列 → 翻译/摘要
- YYY 是动作概率分布 → 强化学习
- YYY 是相似度分数 → 检索/度量学习