关于文献【RL/SFT】

1、

【我的问题】RL教调度,SFT改机制是什么意思?

【deepseek】

【我的总结】经过RL的AI只是学会了什么时候调度,SFT让AI的内部推理逻辑变了

相关推荐
ofoxcoding9 小时前
Seedance 2.0 与 Wan 2026 视频生成 API 成本效率深度对比分析
网络·人工智能·ai·音视频
码农杂谈00079 小时前
组织管理视角深度解读:时尚集团GEA智能体案例——AI重构创意行业的组织资产与人力博弈
ai·gea·context资产
wuyuanshun9 小时前
LangGraph原理逻辑-LangGraph接入MCP(三)
人工智能·ai
hhzz9 小时前
CNN图像分类入门:基于TensorFlow+Keras的CIFAR-10数据集全流程实战
图像处理·计算机视觉·ai·cnn·大模型
Summer-Bright9 小时前
深度 | Kimi K3 48 小时设计芯片:EDA 行业真的会被 AI 颠覆吗?
人工智能·ai·自然语言处理·agi
熊猫钓鱼>_>1 天前
Redis 突发缓存穿透:一次完整的定位复盘
数据库·人工智能·redis·缓存·ai·agent·智能
MinggeQingchun1 天前
AI - AI 大模型全套关键术语
ai
三声三视1 天前
交互式用够了?用 Agent SDK 把 Claude 塞进 Python Web 服务
人工智能·python·ai·aigc·ai编程
奇牙coding1 天前
gpt-5.6-sol 接入指南:reasoning_effort 参数配置、推理链验证与常见报错排查
前端·css·gpt·ai