技术栈

异构推理

2601_96207803
2 小时前
资源管理·libra·agenticrl·异构推理·弹性资源切换
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra语言模型正从“回答问题”迈向“完成任务”, 于RL后训练里, 模型不但生成文本, 还会调用搜索、代码执行等外部工具, 依据环境返回继续推理。如此交互令模型具备更强行动能力, 还使训练系统面临一种相对普通RLHF较不稳定的工作负载: 同一批请求能够产生长度相差数十倍的轨迹, 少量超长轨迹拖累整个进程;与此同时, 训练以及对GPU的需求会随着策略演化持续变化, 另起一句, 这使得培训体系面对的工作负载比普通RLHF更加不稳定, 同一批请求可能生成长度相差数十倍的轨迹, 少数极度的超长轨迹会拖慢所有进程, 同时
我是有底线的