技术栈
奖励机制
XLYcmy
2 小时前
llm
·
sft
·
强化学习
·
多模态
·
损失函数
·
visual r1
·
奖励机制
小红书 算法一面 三
# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
我是有底线的