ms-swift 3.x和2.x中参数不一致的暗坑

虽然ms-swift 3.x发布也有一段时间 官方文档也对使用上参数的变动做了一些说明

ReleaseNote 3.0 --- swift 3.2.0.dev0 文档

但是这个说明基本上都是说 某些参数的命名 发生了变化

对于一些 参数命名没变但默认值/使用方式 的变化 暂时还没给出说明/统计文档

我这边基于工作中遇到的一些坑,整理了部分,希望大家在使用的时候留意。

注意,在这个文档里官方已给出的参数差异我在这不做赘述分析,只展示我个人发现的一些暗坑,时间关系没有做精准校对,如果发现写错or官方更新文档 还请评论区提醒我

一、MLLM中sft full时默认可训练参数的变化

在swift2.x版本中,对MLLM进行SFT full训练的时候,默认是全参数训练的,见

但是在3.x中很坑的一点是默认只训练LLM,冻结vision encoder和adapter。。。

所以在swift 3.x用full sft训练MLLM的时候,切记把freeze_vit和freeze_aligner参数设置为False

二、梯度累加gradient_accumulation_steps

这个参数影响了total_batch_size或者说模型训练花的steps

在2.x中,默认为一个公式计算方法,以8卡为例,这个数值默认为2,也就是说total_batch_size会翻倍

然而在3.x中,默认为1

所以就会导致如果非16卡训练,2.x中和3.x中即使对齐了batch_size,最终的训练step也会有出入。

三、推理的时候--model和--adapters的区别

官方总文档里应该是有写这俩参数的区分,但是因为踩过坑,我在这里再注明一下

当全参数(sft full)训练的时候,推理infer的时候用--model xxx/path

当lora训练的时候,推理用--adapters xxx/path

相关推荐
非专业程序员Ping16 小时前
从0到1自定义文字排版引擎:原理篇
ios·swift·assembly·font
Dfreedom.16 小时前
一文掌握Python四大核心数据结构:变量、结构体、类与枚举
开发语言·数据结构·python·变量·数据类型
一半烟火以谋生16 小时前
Python + Pytest + Allure 自动化测试报告教程
开发语言·python·pytest
虚行16 小时前
C#上位机工程师技能清单文档
开发语言·c#
2501_9159090617 小时前
“绑定 HTTPS” 的工程全流程 从证书配置到真机验证与故障排查
网络协议·http·ios·小程序·https·uni-app·iphone
小羊在睡觉17 小时前
golang定时器
开发语言·后端·golang
CoderCodingNo17 小时前
【GESP】C++四级真题 luogu-B4068 [GESP202412 四级] Recamán
开发语言·c++·算法
Larry_Yanan17 小时前
QML学习笔记(四十四)QML与C++交互:对QML对象设置objectName
开发语言·c++·笔记·qt·学习·ui·交互
百锦再18 小时前
对前后端分离与前后端不分离(通常指服务端渲染)的架构进行全方位的对比分析
java·开发语言·python·架构·eclipse·php·maven
2501_9159184118 小时前
iOS 混淆实战 多工具组合完成 IPA 混淆、加固与工程化落地(iOS混淆|IPA加固|无源码混淆|Ipa Guard|Swift Shield)
android·ios·小程序·https·uni-app·iphone·webview