Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra语言模型正从“回答问题”迈向“完成任务”, 于RL后训练里, 模型不但生成文本, 还会调用搜索、代码执行等外部工具, 依据环境返回继续推理。如此交互令模型具备更强行动能力, 还使训练系统面临一种相对普通RLHF较不稳定的工作负载: 同一批请求能够产生长度相差数十倍的轨迹, 少量超长轨迹拖累整个进程;与此同时, 训练以及对GPU的需求会随着策略演化持续变化, 另起一句, 这使得培训体系面对的工作负载比普通RLHF更加不稳定, 同一批请求可能生成长度相差数十倍的轨迹, 少数极度的超长轨迹会拖慢所有进程, 同时