前言
模型能力迭代与企业落地之间的张力正在加剧:更长的思维链、更深度的工具调用、更复杂的多模态理解不断涌现,而企业真正关心的是如何以可接受的成本,在自有环境中稳定、规模化地复现这些能力。知识蒸馏是破解这一张力的关键工程范式:它不是简单的模型压缩,而是以数据合成为核心的能力迁移机制。教师模型通过生成高质量数据、展示完整推理过程,把已习得的能力迁移给学生模型。
数据合成能力决定了蒸馏的天花板:它不仅需要规模化地产出样本,还要保证多样性、难度分布、质量一致性与可追溯性。2025 年,阿里云人工智能平台 PAI 开源了大模型蒸馏框架 EasyDistill (developer.aliyun.com/article/166... 并陆续发布了 DistilQwen 系列蒸馏模型。在服务内外部客户的过程中,我们注意到一个明确的变化:蒸馏落地的瓶颈,正从训练算法转移到训练数据的规模化生产。客户反复遇到三类问题:
-
有教师,没链路
能调用强大的教师模型 API,但缺乏把教师输出系统性转化为训练数据的工具链,生产依赖一次性脚本,流程难以复用。
-
场景碎片化
蒸馏需求已扩展到多模态理解、Agent 工具调用、自动 Prompt 工程等领域,每个场景单独搭流程,维护成本线性增长。
-
格式转换成本
数据要接入 LLaMA-Factory、ms-swift、transformers 等训练框架,通常需要额外写转换脚本;转换错误难察觉,且缺乏溯源信息。
为此,我们推出 EasyDistill2.0 (github.com/modelscope/... 相比第一代"蒸馏工具包"的定位,EasyDistill2.0 被重新设计为一座配置驱动的数据生产工厂:一份 YAML 配置即可串联数据合成、教师生成、质量评估、过滤改写与数据集导出,产出可直接投入 SFT 与 DPO 训练的数据集。
核心升级:从"怎么蒸"到"怎么规模化生产训练资产"
第一代 EasyDistill 回答的是"怎么蒸",提供基础蒸馏算法与训练脚本;第二代回答的是"怎么规模化地把教师模型的能力转化为训练资产"。具体变化体现在四个维度:
| 维度 | EasyDistill | EasyDistill2.0 |
|---|---|---|
| 定位 | 蒸馏工具包 | 配置驱动的数据生产工厂 |
| 流程组织 | 脚本驱动,易成为一次性工程 | YAML 流水线,可复现、可续跑、可审计 |
| 场景覆盖 | 以指令蒸馏为主 | 指令、CoT、多模态、Agent、AIGC 图/视频、PE 改写等多种场景 |
| 数据产出 | 需手动转换格式 | 输出训练就绪的数据集 + 溯源元数据 |
概括而言,EasyDistill 2 把六大蒸馏场景收敛到同一套工程范式。
框架设计:配置即流水线,数据即资产
三层架构
EasyDistill2.0 采用后端层、算子层、流水线层的三层架构:

- 后端层(Backends)
所有教师模型调用统一收敛到 ModelBackend 抽象,支持三类后端:任意 OpenAI 兼容端点(openai)、阿里云 PAI-Token 服务(pai_token)、PAI-EAS 自部署模型(pai_eas)。CLI 启动时会先做后端健康检查,凭据失效或端点配置错误在流水线执行前即被拦截,避免长任务中途失败造成 API 费用浪费。
- 算子层(Operators)
生成、评估、过滤、改写、平衡、偏好评分等能力全部实现为原子算子,包括指令扩充(instruction_expansion)、指令平衡(instruction_balance)、LLM-as-judge 评估、CoT 长短改写(cot_long2short / cot_short2long)、RV/CD 课程混合、偏好对构造等。每个算子同时以独立 job_type 透出,支持单步调试;某一步出错时,可从上一步落盘的 JSONL 直接续跑。
- 流水线层(Pipelines)
原子算子按场景组装为端到端流水线,每个阶段的中间结果固化为 JSONL 文件,并附带样本级元数据,整条链路可审计、可复现,任何一条训练样本都能回溯到具体的教师模型、调用记录与过滤路径。
统一 CLI 入口为:
css
easydistill --config <path_to_config.yaml>
一份配置描述完整数据流
以高级思维链蒸馏为例,一份 YAML 即可完整描述"生成 → 评分 → 混合 → 建库"四个阶段:
bash
job_type: advanced_cot_distill
backend:
type: pai_token
model_id: kimi-k2.6
generation:
system_prompt: "You are a helpful assistant. Think step by step and provide clear reasoning."
temperature: 0.7
max_tokens: 2048
pipeline:
- stage: cot_distill
output_path: outputs/cot_stage1_generated.jsonl
- stage: cot_rvcd_score
output_path: outputs/cot_stage2_scored.jsonl
- stage: cot_mix_by_rv_cd
config:
cd_bins: [0, 3, 6, 10]
rv_target: matched
output_path: outputs/cot_stage3_mixed.jsonl
- stage: build_sft
dataset:
input_path: examples/seed_cot_problems.jsonl
output_path: outputs/cot_sft_pai_token.jsonl
配置即说明了种子来源、处理阶段、每个阶段的产物位置与最终数据集路径。
训练就绪的数据格式
数据生产的最后一环往往消耗大量工程时间:格式不匹配、字段缺失、来源不明。EasyDistill 2 的所有 SFT 输出统一采用 OpenAI/ShareGPT messages 格式,且每条样本携带溯源元数据:
css
{
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "What is 2+2?"},
{"role": "assistant", "content": "4"}
],
"metadata": {
"source": "teacher_model",
"model": "qwen2.5-72b-instruct",
"request_id": "1",
"backend": "pai_token",
"usage": {"prompt_tokens": 31, "completion_tokens": 1, "total_tokens": 32}
}
}
metadata 中的 source、model、backend、usage 字段使每条训练样本可追溯到具体的教师模型与单次 API 调用,数据审计有据可查,token 成本可核算到样本粒度。该格式无需转换即可在 LLaMA-Factory 中按 sharegpt 注册使用,或直接传给 ms-swift。
六大蒸馏场景
EasyDistill 2 将六种常见蒸馏需求收敛到同一套流水线范式:
| 场景 | 流水线 | 说明 |
|---|---|---|
| 指令蒸馏 | instruct_distill、advanced/balanced/augmented_instruct_distill |
从种子指令到类别均衡、裁判筛选后的 SFT 数据 |
| 思维链蒸馏 | cot_distill、advanced_cot_distill |
RV/CD 双指标课程混合,使 CoT 数据难度与学生模型能力匹配 |
| 多模态蒸馏 | mm_instruct_distill、mm_cot_distill 及 advanced 版本 |
视觉语言指令与对应视觉 CoT 数据生产 |
| Agent 蒸馏 | agent_distill |
从 persona 种子全自动合成多轮 Agent 工具调用轨迹 |
| AIGC 文生图/视频蒸馏 | t2i_distill、t2v_distill |
从简短文本 prompt 到带图/视频的多模态 SFT 数据 |
| Prompt Enhancer(PE)改写蒸馏 | pe_rewrite_distill |
把教师模型 Prompt 增强能力蒸馏给学生模型 |
指令蒸馏:从种子指令到均衡数据集
基础流程 instruct_distill 为种子指令生成教师回复并直接构建 SFT 数据;在此之上提供三条进阶流水线:
-
advanced_instruct_distill指令扩充 → 教师生成 → LLM 裁判评估 → 质量过滤 → SFT 构建,低分样本被过滤。
-
balanced_instruct_distill针对 LLM 合成指令常见的类别漂移问题,在生成前按任务类别自动分类与重采样,把类别分布控制在目标区间内。
-
augmented_instruct_distill对已有种子做 LLM 精炼,为每条指令生成多条候选回复,评估后择优入库。
思维链蒸馏:RV/CD 双指标课程混合
思维链数据并非越长越好。对小模型而言,远超其能力范围的冗长推理链更接近噪声。advanced_cot_distill 流水线在生成 CoT 轨迹后,用 LLM 裁判标注两个指标:推理冗余度 (RV)度量推理链的详略程度,认知难度 (CD)度量理解该推理所需的能力水平。随后 cot_mix_by_rv_cd 按 CD 分箱做课程混合,rv_target: matched 使简单问题配简洁推理、困难问题配详细推理,让学生模型获得与其能力区间适配的训练信号。配套 cot_long2short / cot_short2long 改写算子可对推理链做定向压缩或扩展。基于这套方法训练的 DistilQwen-ThoughtY-32B 在 AIME2024 上取得 90.0 分。
多模态蒸馏:视觉语言数据生产
mm_instruct_distill 为 (图像, 指令) 样本对生成教师回复,mm_cot_distill 进一步生成视觉思维链。两者均输出可直接用于视觉语言模型训练的多模态 SFT 数据:图像以 image_url 内容项嵌入 messages,支持本地路径、HTTP URL 与 base64 三种形态。进阶流水线 advanced_mm_distill 与 advanced_mm_cot_distill 在此基础上增加裁判评估与质量过滤。
Agent 蒸馏:从 persona 种子到多轮工具调用轨迹
训练工具调用模型的最大障碍是数据:真实 Agent 轨迹散落在业务系统中,获取困难、标注成本高。agent_distill 流水线采取完全合成路线,起点只需一行 persona 描述:
json
{"id": "persona_001", "background": "An Afrikaans music fan who wants to organize local events."}
从这一行种子开始,六个阶段依次执行:
-
agent_task_synthesis从 persona 合成任务设定、可用工具集、预期工作流与约束条件。
-
agent_fuzzy_task把结构化任务改写为信息不完整的模糊用户请求,让学生模型学会在多轮交互中主动追问。
-
agent_tool_check对照模糊任务校验并修正工具定义。
-
agent_trajectory以 LangGraph ReAct 循环展开多轮轨迹,
SolveAgent、MockTool、MockUser三个角色协同工作,max_steps与max_tool_calls双重限额控制成本。 -
agent_rubricsLLM 裁判针对当前任务动态生成评分准则,横向比较多条轨迹并选出最优解。
-
末段二选一
build_sft导出多轮messagesSFT 数据,或build_preference_dataset配成 chosen/rejected 偏好对供 DPO 训练。
这条流水线与 AgenticQwen 系列模型的数据生产流程同源:开源数据集 AgenticQwen-Data(80K 条)采用的正是相同的任务结构与 rubric 质量标注。
AIGC 文生图/视频蒸馏:从简短 prompt 到多模态训练对
文生图与文生视频场景存在共同的输入落差:用户输入"一只在月球上喝咖啡的猫"这类简短描述,而扩散模型发挥最佳效果需要包含主体、材质、光影、构图、风格的稠密 prompt。EasyDistill 2 把这类输入批量转化为 (优化后 prompt, 生成图片/视频) 多模态训练样本。
文生图蒸馏
advanced_t2i_distill 流水线包含四个阶段:
-
prompt_optimizeLLM/VLM 将简短 prompt 扩写为生产级描述。
-
t2i_generate调用 Wanx、Qwen-Image 或 PAI-Diffusion 后端生成图片,
T2IBackend统一处理各家 API 协议差异。 -
t2i_evalVLM-as-judge 从图文一致性、美学质量、细节丰富度、无伪影四个维度打分。
-
quality_filter + build_t2i_sft``按分数阈值或 top-k 过滤后输出图像内嵌的多模态 SFT 数据。
文生视频蒸馏
advanced_t2v_distill 流水线(支持纯 T2V 与带首帧的 I2V 两种模式)遵循相同的"优化 → 生成 → 评估 → 建库"结构:
-
prompt_optimize将简短 prompt 扩写为包含镜头运动、时间节奏、主体动作与场景变化的视频级描述;I2V 模式下额外对首帧图像做内容理解,保证后续视频与首帧语义一致。
-
t2v_generate调用 Wanx 视频生成或 PAI-Diffusion 视频后端生成视频,
T2VBackend统一处理 EAS/PAI-Token 调用协议差异。 -
t2v_eval先通过 VBench 快速检查明显短板(如画面静止、穿模),再按固定帧率抽帧由 VLM-as-judge 评估,可选地通过 Omni 类视频理解模型做整体一致性检测。
-
quality_filter + build_t2v_sft``按分数阈值或 top-k 过滤后输出视频内嵌的多模态 SFT 数据。
把 VLM/VBench 作为质检环节纳入流水线,意味着每张图片、每段视频都经过评估并保留分数记录,质量标准可通过配置精确调节。
PE 改写蒸馏:把多轮 Prompt 增强能力蒸馏为一步改写
文生图/视频业务的线上链路中通常有一个 prompt 改写环节。多步 Agent 方案质量最好:先规划、再改写、最后反思,但三次串行 LLM 调用的延迟难以满足线上要求。pe_rewrite_distill 的思路是:离线阶段让教师 Agent 完整执行三步链,把最终结果蒸馏为学生模型的单次调用能力,同时获得多步方案的质量与单步调用的延迟。
关键设计包括:
-
场景路由
自动路由到 10 个场景之一,每个
(场景, 中/英)组合有独立改写提示词文件。 -
公共"铁律"机制
忠实性、信息密度、画面文字扩写、引号锁定、语言规则、自检、输出格式等跨场景硬约束统一维护。
-
九维合并裁判
每条
(原始, 改写)样本对只需一次裁判调用即完成全部九项评估,默认过滤门槛已内置。 -
按场景保护的二次筛选
keep_top_k/keep_top_ratio按七项均分排名做二次精选,默认逐场景执行且每个场景至少保留一条。 -
种子扩增
可选的
seed_anchored_expansion从少量种子 prompt 扩写出同场景大批新 prompt,扩增血缘完整记录。
开源模型与数据集
伴随 EasyDistill 系列框架,PAI 团队已在 HuggingFace(alibaba-pai)与 ModelScope(PAI)开源了完整的模型与数据集矩阵。
| alibaba-pai: huggingface.co/alibaba-pai PAI: modelscope.cn/organizatio... |
|---|
模型家族
| AgenticQwen | 定位 | 规模 | HuggingFace | ModelScope |
|---|---|---|---|---|
| AgenticQwen | Agent 工具调用(多轮 RL 训练) | 8B、30B-A3B(MoE) | Collection | 主页 |
| DistilQwen2 / DistilQwen2.5 | 指令遵循 | 0.5B--7B | ||
| DistilQwen2.5-R1 | DeepSeek-R1 蒸馏推理 | 7B、14B、32B | ||
| DistilQwen2.5-DS3-0324 | DeepSeek-V3-0324 蒸馏快思考 | 3B--32B | ||
| DistilQwen-ThoughtX | OmniThought RV/CD 课程混合 | 7B、32B | ||
| DistilQwen-ThoughtY | Qwen3 底座自适应思考 | 4B、8B、32B |
| Collection: huggingface.co/collections... 主页: modelscope.cn/organizatio... |
|---|
代表性结果
-
DistilQwen-ThoughtY-32B 1(ModelScope 2)在 AIME2024 上取得 90.0 分、MATH500 上取得 95.2 分;同尺寸 DeepSeek-R1-Distill-Qwen-32B 在 AIME2024 上为 74.7 分,RV/CD 课程混合的数据方法论在同等参数量下带来了 15 分以上的差距(看这里 3)。
-
DistilQwen2.5-7B-Instruct 4(ModelScope 5)在 AlpacaEval 2.0 (LC) 上取得 34.86 分,超过 Qwen2.5-7B-Instruct 的 31.43 分,蒸馏后的学生模型超过了同尺寸官方指令模型(看这里 6)。
-
AgenticQwen-30B-A3B 7(ModelScope 8)每次前向仅激活 3B 参数,在 BFCL-V4、TAU-2 等 Agent 基准上追平或超越 8B 稠密模型,工具调用能力与推理成本得以兼顾(看这里 9)。
数据集
| 数据集 | 规模 | 类型 | HuggingFace | ModelScope |
|---|---|---|---|---|
| AgenticQwen-Data | 80K | Agent 任务与多轮轨迹(含 rubric 标注) | HF 1 | MS2 |
| DistilQwen_100K | 100K | 指令遵循 | HF 3 | MS 4 |
| DistilQwen_1M | 1M | 指令遵循 | HF 5 | MS 6 |
| OmniThought | 2M | CoT 推理(带 RV/CD 标注) | HF 7 | MS 8 |
| OmniThought-0528 | 365K | CoT 推理(DeepSeek-R1-0528 教师) | HF 9 | MS 10 |
OmniThought 的 200 万条推理轨迹每条都带有 RV/CD 双标注,可直接用于复现课程混合训练,无需自行打标。
PAI 平台端到端实践:从种子指令到学生模型部署
上述框架能力在阿里云 PAI 平台上可以零额外开发地落地。以下以"指令蒸馏 + 学生模型 SFT 训练"为例,演示从环境准备到模型部署的完整路径。数据生产全程只需 CPU 实例,所有模型推理通过 PAI-Token API 完成,GPU 资源仅用于最后的训练步骤。
第一步:创建 DSW 实例并配置环境
1.1 创建 DSW CPU 实例
登录 PAI 控制台,选择目标地域与工作空间,进入 模型开发与训练 > 交互式建模(DSW) ,单击 新建实例。关键配置如下:
| PAI 控制台: pai.console.aliyun.com/ |
|---|
| 参数 | 推荐配置 | 说明 |
|---|---|---|
| 实例名称 | easydistill-data |
自定义名称,便于识别 |
| 资源类型 | 公共资源(按量付费) | 无需预购配额 |
| 资源规格 | CPU 实例,如 ecs.g6.xlarge(4 vCPU / 16 GiB) |
数据生产只需 CPU |
| 镜像配置 | 官方镜像,搜索 modelscope 选择最新版本 |
兼容性好,预装常用库 |
| 存储挂载 | 挂载 OSS(推荐)或 NAS | 持久化存储训练数据与产出 |
实例状态变为 运行中 即创建成功。
1.2 开通 PAI-Token 服务
PAI-Token 暴露 OpenAI 兼容的 Chat Completions 接口,覆盖 Qwen、DeepSeek、Kimi、GLM 等主流模型系列。在 PAI 控制台选择 快速开始 > Token 服务 ,单击 一键开通;开通后查看或创建 API Key。若 DSW 实例已配置 PAI 默认角色(RAM 角色),系统会自动获取 Token。
1.3 安装 EasyDistill2.0
进入 DSW 开发环境的 Terminal,执行:
bash
cd /mnt/data
git clone https://github.com/modelscope/easydistill.git
cd easydistill
pip install -e .
若 DSW 未配置默认角色,需手动设置:
javascript
export PAI_TOKEN_API_KEY=your_pai_token_key
export PAI_TOKEN_BASE_URL=https://cn-beijing.pai-token.aliyuncs.com/v1
CLI 启动时会先对后端做健康检查,避免长任务中途失败造成 API 费用浪费。
第二步:准备种子指令
EasyDistill2.0 接受 JSONL 格式种子文件,每行一条 JSON 对象,最少只需 instruction 字段:
json
{"id": "1", "instruction": "解释什么是知识蒸馏,用一段话说明。"}
{"id": "2", "instruction": "写一个 Python 函数,不使用切片操作反转字符串。"}
{"id": "3", "instruction": "监督微调和人类反馈强化学习的主要区别是什么?"}
保存为 /mnt/data/easydistill/examples/seed_my_task.jsonl。50--200 条覆盖典型任务类型与不同难度层次的种子是合理起步规模;种子质量优先于数量,因为扩展阶段会放大分布偏斜。
第三步:运行蒸馏流水线
3.1 配置文件
创建 /mnt/data/easydistill/configs/my_advanced_instruct.yaml:
bash
job_type: advanced_instruct_distill
backend:
type: pai_token
api_key: ${PAI_TOKEN_API_KEY}
base_url: ${PAI_TOKEN_BASE_URL}
model_id: qwen3.6-plus # 教师模型,更换只需改这一行
generation:
system_prompt: "You are a helpful assistant. Provide concise and accurate answers."
temperature: 0.7
max_tokens: 2048
eval:
metrics: [informativeness, helpfulness, generalization, correctness]
temperature: 0.0
max_workers: 4
pipeline:
- stage: instruction_expansion
config: {num_output_samples: 3, max_workers: 3}
output_path: outputs/my_stage1_expanded.jsonl
- stage: instruction_refinement
config: {max_workers: 3}
output_path: outputs/my_stage2_refined.jsonl
- stage: generate
config: {max_workers: 3}
output_path: outputs/my_stage3_generated.jsonl
- stage: instruct_eval
config: {max_workers: 4}
output_path: outputs/my_stage4_evaluated.jsonl
- stage: quality_filter
config:
min_scores: {informativeness: 6, helpfulness: 6, generalization: 4, correctness: true}
keep_top_ratio: 0.7
output_path: outputs/my_stage5_filtered.jsonl
- stage: build_sft
config: {}
dataset:
input_path: examples/seed_my_task.jsonl
output_path: outputs/my_sft_dataset.jsonl
skip_empty: true
min_length: 10
max_length: 8192
关键参数说明:
-
backend.model_id教师模型。
qwen3.6-plus在质量与成本间平衡;更强教师可换qwen3.7-max,极低成本可换qwen3.5-plus。 -
quality_filter.min_scoresinformativeness和helpfulness不低于 6 分(满分 10),correctness必须为true。 -
quality_filter.keep_top_ratio通过门槛的样本中只保留排名前 70%,做二次精选。
-
max_workers并发 API 调用数。PAI-Token 有并发限制,起步建议 3--4,遇到 429 错误时调低。
3.2 执行蒸馏
bash
cd /mnt/data/easydistill
easydistill --config configs/my_advanced_instruct.yaml
以 50 条种子为例,总 API 调用量约 500 次,约 15--30 分钟完成全部数据处理。
第四步:与 PAI-Model Gallery 模型库训练格式对齐
PAI-Model Gallery 模型库封装了 PAI-DLC(分布式训练)和 PAI-EAS(在线服务),底层使用 transformers 训练框架。
4.1 格式转换
EasyDistill2.0 内置工具函数,一行命令完成转换:
bash
python convert_to_alpaca.py outputs/my_sft_dataset.jsonl outputs/my_sft_alpaca.json
转换后的 JSON 文件格式如下:
swift
[
{
"instruction": "You are a helpful assistant.\n解释什么是知识蒸馏,用一段话说明。",
"output": "知识蒸馏是一种模型压缩技术..."
}
]
4.2 上传训练数据到 OSS
PAI 模型库训练数据需通过 OSS 上传。若未开通 OSS,访问 OSS 控制台 创建 Bucket(地域与 PAI 一致)。上传方式:
-
DSW 已挂载 OSS:直接复制到挂载路径。
-
未挂载:通过 OSS 控制台手动上传,或使用
ossutil:
swift
ossutil cp /mnt/data/easydistill/outputs/my_sft_alpaca.json oss://your-bucket/pai_data/
| OSS 控制台: oss.console.aliyun.com/ |
|---|
第五步:在 PAI-Model Gallery 模型库发起学生模型训练
5.1 选择基础模型
登录 PAI 控制台,选择 快速开始 > Model Gallery,搜索并选择学生模型(如 Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B 等)。
| PAI 控制台: pai.console.aliyun.com/ |
|---|
5.2 配置训练任务
在模型详情页单击 训练,关键参数如下:
| 参数类型 | 参数 | 推荐值 | 通过输入输出对微调模型参数 |
|---|---|---|---|
| 训练方式 | 训练方式 | SFT 监督微调 | 高效微调,节省显存;也支持全参/QLoRA |
| 训练方式 | 微调方法 | LoRA | 单击"选择 OSS 文件或目录"导航到文件 |
| 数据集 | 训练数据集 | OSS 中的 my_sft_alpaca.jsonl |
训练过程中评估泛化能力 |
| 数据集 | 验证数据集 | OSS 中的验证集(可选) | 存储模型与 TensorBoard 日志 |
| 输出 | 模型输出路径 | oss://your-bucket/output/ |
控制台已筛选满足显存要求的规格 |
| 资源 | 资源类型 | 公共资源(按量付费) | LoRA 典型学习率 |
| 超参数 | learning_rate |
0.0005 |
蒸馏数据通常 3--4 轮收敛 |
| 超参数 | num_train_epochs |
4 |
单卡批次大小 |
| 超参数 | per_device_train_batch_size |
8 |
含长回复时适当增大 |
| 超参数 | seq_length |
512 或 2048 |
7B 模型通常够用,复杂任务可增至 16--32 |
| 超参数 | lora_rank |
8(默认) |
通过输入输出对微调模型参数 |
配置完成后单击 训练 > 确定 ,任务变为 运行中 时开始微调。
5.3 查看训练过程
在训练任务详情页查看日志与指标曲线:
| 曲线趋势 | 判断 | 调整建议 |
|---|---|---|
| train_loss 和 eval_loss 均在下降 | 欠拟合 | 增加 num_train_epochs 或提高 lora_rank |
| train_loss 下降但 eval_loss 上升 | 过拟合 | 减少 num_train_epochs 或降低 lora_rank |
| train_loss 和 eval_loss 均趋于平稳 | 良好拟合 | 可进入部署阶段 |
5.4 部署微调后的模型
-
在训练任务详情页单击 部署(按钮不可点击时等待约 1 分钟让模型完成注册)。
-
选择与模型参数量匹配的实例规格(0.6B 模型约需 5GB 显存)。
-
保持默认参数,单击 部署 > 确定 。约 5 分钟后状态变为 运行中。
-
在服务详情页单击 查看调用信息,获取公网调用地址和 Token。
部署后支持 OpenAI 兼容接口调用:
python
from openai import OpenAI
client = OpenAI(
api_key="your_eas_token",
base_url="调用地址/v1",
)
resp = client.chat.completions.create(
model="Qwen3-0.6B",
messages=[{"role": "user", "content": "解释什么是知识蒸馏"}],
max_tokens=512,
temperature=0,
)
print(resp.choices[0].message.content)
结语
从 EasyDistill 到 EasyDistill2.0,变化的不只是功能数量。第一代回答"怎么蒸",第二代回答"怎么规模化地把教师模型的能力转化为训练资产":配置驱动的流水线让数据生产可复现,后端无关的模型接入让教师可替换,训练就绪的数据格式消除了接入训练框架的转换成本,六大蒸馏场景收敛到同一套工程范式之下。
在阿里云 PAI 平台上,这套范式的工程门槛被进一步降低到"一份 YAML 配置 + 一份种子文件":DSW CPU 实例做编排、PAI-Token 做教师推理、PAI-Model Gallery 做学生训练和部署,从种子到可部署的学生模型形成完整闭环。其有效性已由开源成果验证:DistilQwen 与 AgenticQwen 两个模型家族、累计超过 350 万条的开源数据集,均产自同一套数据生产方法论。后续我们将围绕更多蒸馏场景与更强的教师模型持续迭代框架与模型家族,帮助更多开发者与企业低成本地构建属于自己的小模型。
参考工作
PAI 团队模型蒸馏相关论文:
-
Yuanjie Lyu, Chengyu Wang, Lei Shen, Jun Huang, Tong Xu. Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards. ACL 2026
-
Yuanjie Lyu, Chengyu Wang, Haonan Zheng, Yuanhao Yue, Junbing Yan, Ming Wang, Jun Huang. AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use. ACL 2026
-
Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang. Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations. ACL 2026
-
Lei Shen, Chengyu Wang, Yuanjie Lyu, Yuanhao Yue, Jun Huang, Zhongmin Cai. Self-Evolutionary Reinforced Knowledge Distillation for Multi-Modal Tool-Use Agents. KDD 2026
-
Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu. Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs. ICML 2026
-
Chengyu Wang, Junbing Yan, Wenrui Cai, Yuanhao Yue, Jun Huang. EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models. EMNLP 2025
-
Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang. Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series. EMNLP 2025
-
Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang. Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment. EMNLP 2025
-
Chengyu Wang, Junbing Yan, Yuanhao Yue, Jun Huang. DistilQwen2.5: Industrial Practices of Training Distilled Open Lightweight Language Models. ACL 2025
-
Yuanhao Yue, Chengyu Wang, Jun Huang, Peng Wang. Building a Family of Data Augmentation Models for Low-cost LLM Fine-tuning on the Cloud. COLING 2025
-
Yuanhao Yue, Chengyu Wang, Jun Huang, Peng Wang. Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planning. EMNLP 2024
联系我们
欢迎大家加入钉钉群 117440002081 参与讨论。