SFT后训练32B-LLM的一些观察

用单一语种数据集SFT

用COIG-CQIA数据集,以及把COIG-CQIA数据集混合guanaco和belle之后的数据集一起SFT 32B-Base模型,或者基于32B-Chat模型SFT(1-3 epoch),

目的是想提升LLM在单一语种的效果,

然后在中文通用评测集CEVAL和CMMLU评测,

效果都不如32B-Chat模型。

用一个NLP数据集SFT

用一个NLP任务的数据集(30W data),SFT 32B-Base模型,或者基于32B-Chat模型SFT(1 epoch),

目的是想把预训练的知识用到这个NLP任务里,

把SFT之后的LLM作为标注这个NLP任务训练数据的标注LLM,

效果还不如通用的32B-Chat模型作为标注LLM。

相关推荐
auto_go几秒前
大模型实战指南(10)——多模态实战:让模型“看懂”图片和视频
大数据·人工智能·音视频
Sunlly1 分钟前
让 Agent 长期跑下去:OpenClaw 的可靠性架构
人工智能
逢生博客5 分钟前
MNIST 手写数字识别实战:CNN + Transformer 混合模型
人工智能·cnn·transformer·mnist·手写数字识别
澄旭6 分钟前
不同 AI Agent 共用同一套 Skills
人工智能
阿牛哥_GX8 分钟前
接入AI大模型:让机器人"智能"起来
人工智能
元启数宇20 分钟前
幕墙AI设计算法逻辑:元启数宇如何智能分格
人工智能·算法
故七月31 分钟前
以合规化技术体系筑牢GEO产业发展根基 万域智瞰引领AI流量服务高质量发展
大数据·人工智能
小七-七牛开发者35 分钟前
拆解 dsh 系列:从源码和版本变化看 DeepSeek Harness 的设计取舍
ai·大模型·claude·token·工作流·skill·claudecode·ai coding
开发小程序的之朴37 分钟前
从神经网络到文件加密:一次关于 SIREN、ARX 与密码安全性的实验探索
人工智能·深度学习·神经网络
哈基咩43 分钟前
Function Calling 与 Code Mode:AI Agent 工具调用的原理、对比与选型指南
网络·人工智能