字节跳动·大模型应用(商业化基模&Agent)入职 Landing 知识手册
岗位 :校园招聘 - 大模型应用(商业化基模 & Agent 方向)- 内容质量与数据服务平台
办公地点 :北京市朝阳区 时尚·万科中心 (朝阳北路 152 号院,东四环红领巾桥,5A 甲级写字楼)
业务归属 :抖音集团「内容质量与数据服务平台(CQC) 」× 字节商业化「巨量引擎 · 商业信任与安全 」------用大模型保障广告 / 生服 / 电商的商业内容安全与合规
序列 :运营序列(做算法的事、要业务的结果)
Leader 关注点 :懂 Agent、懂后训练、有创新能力;纯技术画像,产品向不 OK
团队形态 :模型中台,对内服务商业化三条业务线(广告投入最多)
基模方向 :商业化基座模型,对标豆包,30B / 80B 规模;旗舰落地产品为自研广告治理多模态大模型 Mamoda
Agent 方向 :智能客服、采集 Agent、研判、归因等运营提效子项目,做 auto-workflow / multi-agents / harness
当前主线 :「全链路治理 + 以 AI 治 AI」------规则 2.0 / Mamoda 多模态治理 / 后链路守护 / CCR 消费者抱怨指数
目录
- [第 0 章 岗位全景:先搞清楚你在哪、要对什么负责](#第 0 章 岗位全景:先搞清楚你在哪、要对什么负责)
- [第 1 章 业务域:商业化安全与信任(Landing 第一优先级)](#第 1 章 业务域:商业化安全与信任(Landing 第一优先级))
- [第 2 章 基模:预训练、多模态与评测](#第 2 章 基模:预训练、多模态与评测)
- [第 3 章 后训练:SFT 与 RL(Leader 第一关注点)](#第 3 章 后训练:SFT 与 RL(Leader 第一关注点))
- [第 4 章 Agent 工程:Harness / 上下文 / Multi-Agent(Leader 第一关注点)](#第 4 章 Agent 工程:Harness / 上下文 / Multi-Agent(Leader 第一关注点))
- [第 5 章 模型运营:数据飞轮与评测闭环(岗位本质)](#第 5 章 模型运营:数据飞轮与评测闭环(岗位本质))
- [第 6 章 工程工具箱:你每天会用到的东西](#第 6 章 工程工具箱:你每天会用到的东西)
- [第 7 章 Landing 30 / 60 / 90 天作战计划](#第 7 章 Landing 30 / 60 / 90 天作战计划)
- [第 8 章 术语表(中英对照 + 一句话解释)](#第 8 章 术语表(中英对照 + 一句话解释))
- [第 9 章 学习资源清单](#第 9 章 学习资源清单)
- [第 10 章 避坑与潜规则](#第 10 章 避坑与潜规则)
- [第 11 章 速查卡(Cheat Sheet)](#第 11 章 速查卡(Cheat Sheet))
第 0 章 岗位全景:先搞清楚你在哪、要对什么负责
他们在干什么(公开信息,2024--2026)------这是你工作的真实语境
- 核心理念:「全链路治理 + 以 AI 治 AI」。从"管你"到"帮你"、从"单向拦截"到"主动赋能"。
- 旗舰模型 Mamoda(重点记!) :巨量引擎商业信任与安全自研的广告治理多模态大模型 。
- 迭代节奏:2024.06 首发 → 2025.10 发布 2.0 → 2026.07 发布 2.5 → 2026 下半年第五次迭代。
- Mamoda 2.5 技术参数 :采用 DiT-MoE 架构 (MoE 混合专家 + DiT 扩散模型融合,业内首创),128 专家细粒度 、总参数约 25B、单次激活约 3B。
- 能力链路:风险识别 → 精准定位 → 素材自动修复(自动识别并修复素材中的常见违规点,广告主可一键调整)。
- 官方效果口径(会出现在你的 OKR/周报里) :
- 平台 90% 的广告素材可在 10 分钟内完成审核 ,整体效率较传统模式提升约 75%。
- 2025 Q3 前置拦截 84 万+ 涉 AI 违规素材。
- Mamoda 2.5 日均出具 1500 万条 精细化拒审诊断,每天帮助超百万条违规素材完成自动修复。
- 规则 2.0 体系 :把模糊、非结构化的规则,重构成结构化、机器可读的「机器语言」 ,结合 SFT 与 RL 提升 AI 审核精度------这就是"懂后训练"在业务里的直接落点。
- 后链路守护 :穿透履约"黑箱",不只盯广告素材本身,还盯投放后的履约与体验。
- CCR(消费者抱怨指数):巨量引擎首创指标,整合用户评论、举报、投诉等多维负反馈,用来度量"用户到底烦不烦"。
- 专项保障:为「一老一少」(老人与未成年人)设立专项保障通道。
- 治理标准 :坚持"精准识别、从严处理";明确禁止广告内容出现虚构人物设定 ,严禁冒用他人身份、姓名或职位。
这些信息对你的直接含义(把工作对上号)
- 你的"基模"不是空谈 30B/80B ,大概率是围绕 多模态(图文/视频/音频)审核与治理基座 ,对标 Mamoda 这条线。
- 你的"后训练"要落到规则 2.0 → 可被模型执行的机器语言,用 SFT/RL 把审核准召顶上去。
- 你的"Agent"要落到机审&人审提效:研判、归因、采集、客服等。
- 你的产出指标要能对上业务口径:审核效率(10 分钟覆盖 90%)、前置拦截量、拒审诊断量、自动修复量、CCR。
- 你的差异化叙事 :把"误报率 -40%""置信度门控""数据回流"直接挂到 Mamoda 的全链路治理 与 规则 2.0 上------这是你独有的迁移故事。
注:以上均为公开报道口径(巨量引擎商业安全开放日 2024/2025、《2025 巨量引擎商业信任与安全治理报告》、Mamoda 2.5 发布报道等),具体以入职后内部资料为准。对外沟通时注意信息边界,不要把公开报道当内部细节引用。
0.1 一句话定位
你是一个「懂业务的模型应用工程师」 :把通用大模型能力,通过后训练 + Agent 工程 ,变成商业化安全场景里对准召负责、对成本负责、可上线闭环的专属系统。
你既不是纯炼丹(训完就完),也不是纯后端(只调 API),而是模型运营:让「线上发现问题 → 归因 → 在数据/模型/流程补 → 上线 → 回流验证」这个飞轮持续转起来。
0.2 岗位的三层理解(面试/周会都用得上)
| 层次 | 说明 | 落地抓手 |
|---|---|---|
| 业务本质 | 治理诉求 vs 业务增长的平衡:漏放 = 监管/舆情风险,误伤 = 广告主收入损失 | 准召权衡、风险分级处置 |
| 技术栈本质 | 基模(多模态理解&生成)× 后训练(SFT/RL)× Agent 工程(auto-workflow/multi-agent/harness)× 工程系统 | 模型 + 数据 + 流程三位一体 |
| 运营闭环本质 | 数据飞轮转得快不快,决定模型懂不懂业务、守不守得住准召 | 回流速度 = 防守速度 |
0.3 你的产出如何被衡量(心里要有这根弦)
不要用「我训了个模型 / 跑了个实验」定义产出,而要用业务结果定义:
- **漏放率(漏审率)**↓:违规内容没被拦出去的占比。最贵的指标,直接对应监管/舆情。
- **误伤率(误杀率)**↓:正常素材被拦的占比。直接对应广告主收入与体验。
- 人审介入率↓:多少比例样本要转人工。直接对应人力成本。
- 单条审核成本 / P99 延迟↓:算力 + 人力成本。
- 申诉通过率 / 复审推翻率:衡量判定质量与规则合理性。
一句话合格线:每个迭代都能讲清楚「改了什么、上线后哪个业务指标变了、变了多少、口径是什么」。
0.4 团队结构与协作地图
内容质量与数据服务平台(模型中台)
├── 基模组(你所在) 商业化基座模型:语料、数据工程、评测、后训练迭代
├── Agent 组 客服/采集/研判/归因等 Agent,auto-workflow、harness
├── 业务方(产运) 广告 / 生活服务 / 电商 三条线的安全运营
├── 算法团队 共享算力,模型结构/训练支持
└── 人审团队 标注、复核、申诉处理------你的「模型老师」和「数据源」
协作原则 :业务方给你风险定义和优先级,人审给你最干净的标签,算法团队给你算力与底座支持。你要做的是把三方信号捏成一个闭环,而不是单打独斗。
第 1 章 业务域:商业化安全与信任(Landing 第一优先级)
技术你已经很强了,业务黑话和规则体系才是 landing 最大缺口。这一章是「第一周必须开口就能说」的内容。
1.1 内容安全在商业化中的角色:信任基础设施
- 安全不是成本中心,而是信任基础设施:没有信任,广告主不敢投放、用户不敢下单、商家不敢入驻。
- 商业化安全处在「模型能力」与「真金白银业务」的交界处------这是大模型最难证明「不只是 demo、是真价值」的战场,也是价值最容易被量化的地方。
1.2 三条业务线各自的风险侧重
| 业务线 | 典型场景 | 风险侧重 |
|---|---|---|
| 广告 | 巨量引擎投放素材(图文/视频/直播间) | 黑五类、虚假营销、夸大功效、资质造假、擦边低俗 |
| 生活服务 | 到店/团购/本地商家 | 虚假门店、刷单、虚假评价、资质(餐饮/医美)、价格欺诈 |
| 电商 | 商品、直播带货、小店 | 假冒伪劣、禁限售、虚假宣传、知识产权侵权、诱导交易 |
广告投入最多,你大概率先接触广告机审。 生服和电商的底层逻辑(识别风险 → 分层处置 → 人工兜底 → 回流迭代)是一致的,方法论可迁移。
1.3 违规类型全景(开口就能说的「黑话库」)
具体分类以平台规则为准,以下为行业常见口径,入职后尽快对齐内部规则文档/风险百科。
A. 黑五类(高危、强监管)
- 药品、医疗器械、保健食品、医疗美容、丰胸/减肥类产品
- 特点:涉及人身健康,无资质不得投放,夸大功效即违规;监管处罚最重。
B. 内容违规
- 虚假宣传 / 夸大功效:绝对化用语("最"、"第一"、"根治")、虚假承诺、伪造数据。
- 色情低俗 / 擦边:软色情、暗示性文案、低俗着装、擦边话术。
- 违法违规:赌博、诈骗、传销、毒品、枪支、管制物品。
- 敏感内容:政治敏感、宗教、民族、地域歧视、涉政谣言。
- 未成年人保护:未成年人形象、诱导未成年人消费、校园相关。
C. 商业违规
- 侵权假冒:商标、专利、著作权、盗图、冒牌。
- 金融风险:非法集资、荐股、虚拟货币、贷款诱导。
- 招商加盟 / 教育违规:虚假招商、违规培训广告。
- 诱导交易:站外引流、私域导流、诱导点击。
D. 边界问题(真正的能力瓶颈)
- 到底算不算违规?模棱两可、语义级擦边、图文结合歧义、指代与隐晦变体。
- 边界样本才是决定模型准召天花板的地方,也是最值得你花时间的。
1.4 机审 & 人审全链路(分层漏斗)------ 必画图
广告主/商家提交素材
│
┌───────▼─────────────────────────────────────────────┐
│ 第 0 层:资质与准入 营业执照、行业资质、类目权限 │ ← 不满足直接拒
├──────────────────────────────────────────────────────┤
│ 第 1 层:规则 & 知识库 │ ← 关键词/正则/黑名单/
│ 关键词、正则、黑名单账号、历史违规指纹、向量库 │ 违规素材指纹/向量库
│ 命中即秒杀;成本≈0,挡掉大量已知风险 │
├──────────────────────────────────────────────────────┤
│ 第 2 层:小模型初检 │ ← 高并发、低延迟、GPU 最省
│ 文本分类 + 图像抽帧检测 + embedding 召回 │
│ 只做两件事:高置信直接处置;拿不准往下送,绝不终判 │
├──────────────────────────────────────────────────────┤
│ 第 3 层:大模型精判 │ ← 处理长尾、语义级违规
│ 图文结合理解、口语化擦边、指代、隐晦变体 │
│ 输出:结构化结论 + 置信度 + 依据(命中哪条规则/证据) │
├──────────────────────────────────────────────────────┤
│ 第 4 层:人审兜底 + 处置分流 │ ← 低置信/高客单/有争议/
│ 低置信、高价值广告主、有争议、新规新类型 → 人审工单 │ 新出现违规类型
│ 处置:拒投 / 限流 / 修改建议 / 允许申诉 │
└──────────────────────────────────────────────────────┘
│
▼
闭环回流:人审结果 + 广告主申诉 + 用户举报 + 事后追罚
│
▼
打标 → 清洗校准 → 进训练集 → 重训小模型 / 微调大模型 / 更新规则
核心原则(背下来,张口就说):
能不用模型就不用模型,能用小模型就不用大模型,大模型只留给长尾,最后人审兜底,再把结果回流成数据,让数据飞轮转起来。
1.5 准召权衡:把「业务代价」编码进技术决策
审核场景的核心公式不是「准确率」,而是代价矩阵:
| 实际违规 | 实际合规 | |
|---|---|---|
| 判定违规 | ✅ TP(正确拦截) | ❌ FP(误伤 → 损失广告收入) |
| 判定合规 | ❌ FN(漏放 → 监管/舆情风险) | ✅ TN(正确放行) |
- 在广告安全里,FN 的代价 > FP 的代价(漏一条是监管/舆情风险;误伤顶多是损失一条广告收入)。
- 所以冷启动策略:偏保守、高召回 ------低置信送人审、高置信自动处置;上线后用人审结果和反馈回流,逐步收紧阈值到业务能接受的误伤率。
- 高价值广告主/关键类目要单独定阈值:它们的误伤代价更高,宁可多转人审。
置信度怎么算(不是只信模型自带概率):
- 模型信号 :几个类别之间摇摆、不敢下结论 → 分值打低;可以用温度缩放 / 序列概率 / 多采样一致性做校准。
- 规则信号:字段是否齐全、内容与类别特征是否匹配、有无明显矛盾。
- 两路合成 → 阈值在验证集上按「误报率-召回率曲线」定,上线后随回流动态重算(防分布漂移)。
1.6 对抗是常态,不是 bug
- 规则时代:广告主绕审靠变形字、错别字,规则一加就能堵。
- 模型时代:违规升级为「语义级擦边」,广告主用 AIGC 批量生成隐蔽变体试探边界。
- 所以审核是军备竞赛:谁的数据回流快、谁持续更新评测集,谁就守得住。
三件事变重要了:数据回流速度、边界样本与评测、人审定位升级(从执行者 → 模型的老师)。
对抗应对三板斧:
- 周期性红队测试:主动生成变体测自己的模型,找漏洞。
- 模型优先于规则:规则易绕,模型负责语义级理解。
- 事后追罚闭环:被举报/追罚的变体立即回流重训。
1.7 规则与处置流程(人审日常黑话)
素材提交 → 机审 → 命中高危/低置信 → 人审初审 → 判定
├─ 通过 → 投放 → 巡检/举报/申诉 → 复审
├─ 拒投(附理由)
└─ 给修改建议 → 广告主改后重提
处罚分级:警告 / 拒投 / 限流 / 扣分 / 封禁账号 / 扣除保证金
申诉链路:广告主申诉 → 复审 → 维持原判 or 推翻(推翻样本 = 最硬的回流数据)
关键认知 :被申诉推翻的判定 = 最干净、最贵的训练数据(它说明模型/规则错了,且有人审背书)。这是你 30 天里要重点挖的金矿。
1.8 业务关键指标字典
| 指标 | 英文/口径 | 含义 | 你该怎么用 |
|---|---|---|---|
| 漏放率 | FNR / Miss Rate | 实际违规被判合规的比例 | 最贵,优先压 |
| 误伤率 | FPR / False Positive | 实际合规被判违规 | 直接影响收入 |
| 召回率 | Recall | 违规里被拦到多少 | 冷启动优先保证 |
| 精确率 | Precision | 拦下的里有多少真违规 | 上线后逐步收紧 |
| 人审介入率 | HITL Rate | 转人工比例 | 决定人力成本 |
| 申诉通过率 | Appeal Pass Rate | 广告主申诉成功比例 | 高说明误伤严重 |
| 端到端召回/误报 | E2E Recall/FPR | 整条链路的指标 | 链路 > 单点 |
| 单条成本 | Cost per Item | 算力+人力/条 | ROI 核心 |
| P99 延迟 | P99 Latency | 99 分位响应时间 | 实时场景红线 |
牢记 :单任务 99% 准确率,链路一累计就衰减。端到端评估永远大于单任务评估。
1.9 真实业务黑话(巨量引擎商业安全专属)------开口就用
以下是与本团队强相关的关键词,几乎一定会出现在你的周会、OKR、汇报和数据看板里。
| 黑话 | 含义 | 你该怎么接 |
|---|---|---|
| Mamoda | 团队自研的广告治理多模态大模型,2024.06 首发,2026 已到 2.5/第五次迭代 | 这就是你要服务的"基模",主动了解它的能力和短板 |
| DiT-MoE | Mamoda 2.5 的模型架构:MoE 混合专家 + DiT 扩散模型融合 | 能被问到就讲:稀疏激活(25B 总参/3B 激活)+ 扩散用于生成/修复 |
| 全链路治理 | 从风险识别 → 精准定位 → 素材自动修复 的端到端治理 | 你的 Agent 和评测都要按"链路"而非"单点"设计 |
| 以 AI 治 AI | 用大模型对抗 AI 生成的违规内容(AIGC 违规) | 理解 AIGC 既是治理对象、也是红队/合成数据工具 |
| 规则 2.0 | 把模糊规则重构成结构化、机器可读的"机器语言" | 这是"懂后训练"的入口:规则 → 可执行的训练/推理信号 |
| 后链路守护 | 不只审素材,还穿透履约"黑箱"盯投放后的体验/履约 | 审核从"审素材"延伸到"审生意",指标更偏业务结果 |
| CCR(消费者抱怨指数) | 整合评论、举报、投诉等多维负反馈的首创指标 | 这是"准召之外"的用户侧指标,做归因时会用到 |
| 前置拦截 | 在素材/内容触达用户之前就拦住 | 对应"漏放代价 > 误伤代价",高召回策略的落点 |
| 拒审诊断 / 精细诊断 | 给广告主出具"为什么被拒、怎么改"的结构化说明 | 对应"主动赋能",是你做可解释输出和修改建议的业务场景 |
| 素材自动修复 | 识别并自动修复素材常见违规点,广告主一键调整 | 是"从拦截到赋能"的关键能力,也是 Agent 化的天然场景 |
| 专项保障通道 | 针对"一老一少"等特定人群的治理通道 | 体现治理的社会责任维度,涉及未成年人保护等规则 |
| 商业信任与安全 | 团队名(Trust & Safety 的商业化版本) | 对外沟通用这个词,比"审核"更专业 |
加分表达 :面试/周会里把你说过的东西挂到这些真实名词上。例如------
"我的置信度门控 + 人工兜底 本质上就是前置拦截 与后链路回流 的一种实现;我理解的规则 2.0,就是把模糊规则变成模型能学的结构化信号,这正好是我做过后训练数据工程的地方。"
1.10 真实操作场景:你每天会碰的系统、流程与"脏活"
前面是"知道",这一节是"怎么干"。这是从「懂概念」到「能上手」的桥。
① 你每天的工作循环(口语版)
早上先看昨天数据(漏放 / 误伤 / 拒审量 / 人审介入率 / CCR)
→ 挑出 bad case 和「申诉被推翻」的样本
→ 归因:到底是数据、模型、规则还是流程的问题?
→ 决定动作:补数据 / 改规则或 prompt / 调阈值 / 提一次训练
→ 离线评测 + 小流量灰度
→ 看业务指标有没有真的变好
→ 回流进训练集、更新评测集、写周报
→ 第二天重复
② 你会频繁接触的平台与名词(公开产品名)
| 名称 | 是什么 | 你会怎么用 |
|---|---|---|
| 巨量广告(投放平台) | 广告主投放素材、看审核结果 | 理解素材从哪来、拒审结果怎么呈现给广告主 |
| 巨量千川 | 电商 / 直播带货投放 | 电商侧的违规与治理 |
| 巨量星图 | 达人商单撮合(品牌 × 达人) | 内容合作场景的合规 |
| 审核结果 / 拒审原因 | 平台给广告主的反馈 | 你的诊断输出最终会出现在这里 |
| 申诉链路 | 广告主申诉 → 复审 | 被推翻的样本 = 最硬的回流数据 |
| 规则库 / 规则 2.0 | 结构化、机器可读的审核规则 | 你训练/推理时规则的来源 |
| 数据看板 | 指标监控 | 你要能看懂、并能自己拉数 |
③ 真实工作里的"脏活"清单(别嫌弃,这是信任的起点)
- 拉数、清洗标注、对齐标签、跑报表、盯回流队列、复核评测集、人工抽检。
- 人审 / 标注体系三个必懂概念:
- 标注规范:什么算违规、边界怎么判(这是规则落地的最后一公里)。
- 质检 QA:抽检纠错,发现标注错误 → 回流修正。
- 标注一致性:多人标注一致率(如 Cohen's Kappa),一致率低说明规则本身模糊,得先修规则。
④ 入职后必须确认的"操作层"信息(外部查不到,问 mentor)
- 数据在哪:数仓入口、常用表名与字段、权限怎么申请。
- 评测在哪:专测集路径、回归怎么跑、有没有 CI 化。
- 模型在哪:Mamoda 的调用/微调方式、能力边界、延迟与成本。
- 资源在哪:推理/训练算力入口、实验管理平台、排队情况。
- 流量在哪:灰度 / 影子 / AB 平台怎么用。
- 指标在哪:看板位置、每个指标的口径定义。
第 2 章 基模:预训练、多模态与评测
2.1 预训练 vs 后训练:一句话分工
预训练给模型「知识」,后训练给模型「行为和性格」。
预训练 = 从海量语料学「文字接龙」和世界知识;后训练 = 把知识格式化成指令跟随、安全对齐、任务能力。
为什么后训练是这个岗位的主战场(三个经济学事实):
- 杠杆率最高:同样 GPU 小时,投在后训练上的能力回报远高于继续预训练。
- 差异化最强:基座趋同,各家平台的「审核风格」「安全底线」几乎全来自后训练配方。
- 离钱最近:商业化要的不是通用基座,是「懂业务、守规矩、对准召负责」的专属引擎------这正是后训练的产出。
2.2 商业化基座:30B / 80B 对标豆包,旗舰落地是 Mamoda
⚠️ 一个必须入职后问清楚的点 :面试情报里的「商业化基座模型 30B / 80B 对标豆包」与公开信息里的「Mamoda 2.5(约 25B)」未必是同一条线 ------前者可能是通用商业化基座,后者是广告治理专用模型;也可能 Mamoda 是基座之上的一层。别对外混着说 ,入职第一周务必向 mentor 确认:基座模型与 Mamoda 是什么关系?我到底服务哪一个?
- 现状:通用场景用豆包,但商业化安全场景表现不佳(通用模型不懂审核规矩)。
- 目标:用商业化语料训练/后训练自己的基座,规模 30B / 80B,配合后训练专精安全信任。
- 旗舰落地(记牢) :Mamoda ------团队自研的广告治理多模态大模型 。
- 2024.06 首发 → 2025.10 2.0 → 2026.07 2.5 → 2026 下半年第五次迭代。
- Mamoda 2.5 = DiT-MoE 架构 :MoE(混合专家)+ DiT(扩散)融合;128 专家细粒度、总参 ~25B、单次激活 ~3B。
- 能力:风险识别 → 精准定位 → 素材自动修复;90% 素材 10 分钟内审完,效率 +75%;日均 1500 万条拒审诊断。
- 对你的意义:你未来做的"基模优化/评测/后训练",很可能就是给 Mamoda 这条线补能力、提准召、降成本。入职第一周就去把它当前的能力边界问清楚。
- 差距量化 :用同一套商业化专测集 ,通用模型和自研模型各跑一遍,按类别拆开对比准召/误报率,落到同一评测口径------差距量化不能靠感觉。
2.3 多模态理解 & 生成基座(本岗位技术关键词)
| 方向 | 关键任务 | 审核场景落点 |
|---|---|---|
| 多模态理解 | 图文/视频/音频联合理解、OCR、目标检测、跨模态对齐 | 图文结合违规、视频抽帧、直播实时 |
| 生成基座 | 图像/视频/文本生成、AIGC 检测 | 识别 AIGC 违规、生成对抗样本、合成边界样本 |
大模型 vs 传统模型(YOLO/BERT)怎么选:
| 维度 | 传统模型 | 大模型/VLM |
|---|---|---|
| 泛化性 | 换域要重训 | 长尾/新场景免重训 |
| 少样本 | 需大量标注 | Few-shot 可顶 |
| 多模态 | 难 | 原生支持 |
| 成本/延迟 | 低 | 高(需分层/缓存/量化压) |
选型原则(ROI 最优):数据少 → LoRA + 小模型起步;能用规则 → 不上模型;实时场景 → 小模型初检 + 大模型精判;开放长尾 → 上大模型(MoE 推理成本可接受)。
2.4 模型结构速通(能画能讲即可)
- Transformer :Self-Attention,n 个 token 有 n² 对关系 → 上下文越长注意力越被摊薄(Context Rot 的架构根因)。
- MoE(混合专家):稀疏激活,总参数大、激活参数小 → 推理成本可控。是 30B/80B 基座的常见结构。
- 位置编码 / 长度外推:RoPE、位置插值,决定长上下文能力(有精度衰减)。
- KV Cache:推理加速核心,前缀缓存(Prefix Caching)直接省钱。
- 量化:PTQ(AWQ/GPTQ)、QAT;W4A16 等,审核场景常用。
- 并行:TP(张量并行)、PP(流水线并行)、DP(数据并行)、EP(专家并行,MoE 用)。
2.5 评测体系:三层设计(入职必用)
第一层:通用能力评测 公开 benchmark(理解/推理/多模态) → 底线,别掉队
第二层:业务专测集 商业化安全专测集(你的主战场) → 准召、边界、对抗
· 从线上真实样本采样 + 人工标注
· 覆盖违规类别全景:正/负/边界样本
· 边界样本才是真正瓶颈
第三层:链路级评测 端到端召回率、端到端误报率、人审介入率、单条成本、P99
评测集防泄漏三板斧:
- 时间切分隔离:训练用旧样本,评测用新样本。
- 对抗生成样本:防模型死记。
- 定期更新 + 人审抽检:对抗是动态的,静态评测集测不出真实表现。
迭代闭环 :线上 bad case 回流 → 归因(数据/模型/阈值/流程)→ 分类补强 → 同一套 benchmark 全量回归(防止某类好了另一类崩)。
第 3 章 后训练:SFT 与 RL(Leader 第一关注点)
3.1 后训练全景图
稠密信号
▲
SFT │ 在线策略蒸馏 (OPD)
(离线模仿) │ (在线模仿,2025-2026 新贵)
│
离线 ◄────┼────────────────────► 在线
│
DPO/KTO │ RLHF / RLVR / GRPO / PPO
(离线偏好) │ (在线试错,信号稀疏)
│
稀疏信号
记忆口诀:SFT 建基线 → DPO 调安全偏好 → GRPO/RLVR 做可验证任务 → PPO+RM 留给高精度关键路径。
3.2 SFT(监督微调):三个关键认知
- SFT 是「激活和格式化」预训练已有能力,不是注入新知识。 跳过 SFT 直接 RLHF 效果很差(InstructGPT 核心发现)。
- 少量高质:LIMA 证明 ~1000 条精选数据可接近 SOTA。审核场景 = 精选「什么是违规/合规」的典型 case,把审核行为模式格式化出来。
- SFT 决定 RL 的起跑线:RL 只能雕刻策略分布内已有的行为,不能凭空创造。
审核 SFT 的产出格式示例(结构化、可解释):
json
{
"input": "<素材描述/图像+文本>",
"output": {
"label": "违规",
"category": "医疗保健-夸大功效",
"confidence": 0.86,
"evidence": ["文案含'根治'绝对化用语", "未提供医疗器械资质"],
"suggestion": "建议修改『根治』为『辅助改善』"
}
}
3.3 RL 算法家族(选型表 ------ 必背)
| 算法 | 核心机制 | 代价 | 适用场景 | 代表 |
|---|---|---|---|---|
| SFT | 离线模仿 | 低 | 一切任务的起点 | --- |
| DPO | 直接用偏好对优化,无奖励模型 | 便宜、稳 | 安全/偏好约束("这类就是不能放") | 各类对齐 |
| KTO | 只需好/坏单标签,不需成对 | 便宜 | 偏好数据难配对的场景 | --- |
| GRPO | 去 Critic,组内相对优势 | 省显存 | 可验证奖励任务(规则/类目/代码) | DeepSeek-Math/R1 |
| GSPO | GRPO 改进,序列级重要性采样 | 训练更稳 | 替代 GRPO,对 MoE 友好 | Qwen(2025) |
| PPO | Critic + 独立奖励模型 | 贵、精度高 | 奖励可精细建模的高价值路径 | 各家用 |
选型本质两点:奖励信号可不可验证、预算允不允许上 Critic。
GRPO 的「组内相对优势」:对同一问题采一组答案(group),用组内 reward 均值作基线,优势 = 自身 reward − 组均值。去掉 Critic → 省显存、少一个模型;代价是 reward 稀疏时波动大。
各家的取舍(体现深度):
- DeepSeek-V3.2 没放弃 GRPO,而是 Scaling GRPO:无偏 KL、off-policy 掩码、路由一致性等工程改进。
- Qwen 用 GSPO 修 GRPO 的「序列级奖励 vs token 级重要性采样不对齐」导致的不稳定。
- Kimi 走分任务 RL + 模型合并,减少任务冲突。
3.4 审核场景的奖励函数设计(直接可用的模板)
审核的分寸在于:拦对和放对都是奖励,不能只奖励拦截。
python
def reward(sample, pred, label, task_type):
# 主判奖励:用代价权重编码业务偏好(漏放代价 > 误伤代价)
if pred.label == label.label:
r_main = +1.0
elif label.label == "违规" and pred.label == "合规": # 漏放
r_main = -2.0
elif label.label == "合规" and pred.label == "违规": # 误伤
r_main = -1.0
# 置信度校准奖励:鼓励"拿不准就说不确定"→ 与人审兜底衔接
r_calib = +0.2 if (pred.confidence < 0.5 and pred.says_unsure) else 0.0
# 格式与可解释奖励:必须有结构化字段 + 依据,便于人审复核与申诉追溯
r_fmt = +0.2 if (pred.structured and pred.evidence) else -0.2
return r_main + r_calib + r_fmt
设计要点与坑:
- 防 reward hacking:模型可能为拿格式分乱报格式而不真正判对 → 格式分权重不能过高,且要抽检。
- reward 缩放要稳 ;GRPO 组内基线在稀疏 reward 下会抖 → 先 SFT 建基线再上 RL。
- 奖励来源优先级:人审结果 > 规则判据 > 端到端指标(漏放率/误伤率)合成。
- 审核最幸福的地方:对错有人审标签和规则兜底,是天然稠密、可验证的奖励信号 → 最适合可验证 RL。
3.5 后训练数据工程(护城河)
认知 :2025 年以来各家技术报告里,后训练数据管线的篇幅都远超算法本身。数据工程是真正的护城河,配方 > 算法。
三步走:
① 数据分层
安全红线数据:高质少量,人审确认违规 + 规则标注 + 专家构造 → 用于 SFT 建底线
业务偏好数据:海量 noisy,线上全量采样 → 用于 RL/DPO 对齐"该放/该拦"
② 清洗提质
去重 / 去污染(防评测集泄漏)/ 格式规范 / 标签校准(修人审错标)
难例挖掘(模型判错 + 人审纠正 = 最有价值)
类别均衡 / 长尾过采样或合成扩充
合成数据(强模型生成边界 case、变体、对抗样本)
③ SFT → RL 分步
先 SFT 高质量小样本建基线 → 再 DPO/GRPO/PPO 调偏好
标签可信度排序 :人审确认 > 规则标注 > 模型自标 > 合成。
正负样本极不平衡(合规 >95%)处理:
- 采样策略:违规全留,正常按比例采,重配比。
- 类别均衡:长尾违规过采样/合成。
- 难例优先:人审介入率高的单独成集、提权重。
- 业务加权:高价值广告主/类目的样本更高权重(把业务代价编码进数据配比)。
合成数据的边界:
- ✅ 能用:扩边界样本、生成对抗样本(红队/评测集)。
- ❌ 不能用:不能拿合成数据做「准召真相」(无真人确认)。
- ⚠️ 防 Model Collapse:合成只做「扩边界」不做「立基准」,控占比、定期用真实数据对冲。
规则时效性 :给数据打规则版本号 + 生效时间窗。规则新增 → 补新样本;规则修改 → 旧样本复核降权;规则删除 → 标记/清除失效正例。
审核模型的迭代速度,本质是「规则变更 → 数据回流」的速度。
回流策略(不是全部回流):
- 高价值必回流:人审推翻模型的样本、申诉被支持的样本(误伤证据)。
- 中价值采样回流:人审与模型一致的常规样本。
- 低价值过滤:重复、无争议简单样本。
- 节奏控制:与模型迭代周期对齐,用最近一段时间的回流数据,保持新鲜度。
3.6 Agentic RL(2025-2026 热点)
- 定义:把 RL 扩展到工具使用 / 长任务执行,奖励 = 过程奖励 + 结果奖励。
- 审核场景的可落地路径:先在可验证子任务上做(规则命中、类目判定、格式合规),奖励客观、可自动判定。
- 当前长程任务成功率仍不高(空间大);前沿突破口:过程奖励隐式化、自我博弈式环境生成、带置信度校准的模型裁判。
3.7 训练工程(够用即可)
- 微调范式:全参 SFT / LoRA / QLoRA(4-bit NF4 + LoRA,省显存)。
- LoRA 原理:冻结原权重,注入低秩增量 ΔW = B·A,只训 B/A;即插即拔,多任务挂不同 adapter。
- 框架:HF Transformers + PEFT + TRL(SFT/DPO/GRPO 都有实现)、DeepSpeed/Megatron(大规模)、vLLM(推理/rollout)。
- 显存:梯度检查点、ZeRO 分片、FlashAttention、混合精度。
- 坑:数据泄漏(训练/评测不隔离)、标签错标、reward 尺度、KL 系数、学习率过大导致 SFT 灾难性遗忘。
第 4 章 Agent 工程:Harness / 上下文 / Multi-Agent(Leader 第一关注点)
4.1 Agent 的准确定义
Agent = LLM 在循环中自主使用工具 (Anthropic 简化定义)。
核心循环:
LLM 输出下一步 → 执行工具 → 结果追加进上下文 → 重复,直到判定 done。
python
context = [initial_event]
while True:
step = llm.determine_next_step(context) # 工具调用 or 终止
context.append(step)
if step.intent == "done":
return step.answer
context.append(execute(step)) # 环境反馈(ground truth)
- Workflow = LLM 和工具经预定义代码路径编排(确定性强)。
- Agent = LLM 动态决定自己的流程和工具使用(灵活性高)。
4.2 何时用 Agent?(不要过度设计)
先找最简单的解法,只在证据表明更复杂能提升结果时才加复杂度。
| 场景 | 推荐 |
|---|---|
| 单次 LLM 调用 + 检索 + few-shot 就够 | 别上 Agent |
| 任务可清晰分解成固定子步骤 | Prompt Chaining / Workflow |
| 输入有明显类别、可分类 | Routing |
| 子任务可并行 | Parallelization |
| 子任务数量不可预测、需动态分解 | Orchestrator-Workers |
| 有明确评估标准、可迭代改进 | Evaluator-Optimizer |
| 开放式、步骤数不可预测、路径无法硬编码 | Agent |
审核场景落点 :确定性流程(资质校验、规则命中、格式检查)用 Workflow ;长尾语义判断用 Agent ;整体是「确定性外壳 + Agent 内核」。
4.3 Anthropic 六大组合模式(画图能讲)
- Prompt Chaining(提示链):分解为固定步骤,中间可加程序化检查(gate)。用延迟换准确率。
- Routing(路由):分类输入 → 分发到专用子任务/prompt/模型。简单请求走小模型。
- Parallelization(并行):Sectioning(拆独立子任务并行)/ Voting(多次采样投票)。
- Orchestrator-Workers(编排者-工作者):中央 LLM 动态拆解、委派、汇总。子任务不预先定义。
- Evaluator-Optimizer(评估者-优化者):一个 LLM 生成,另一个评估反馈,循环迭代。
- Agents(自主智能体):环境反馈循环,可在检查点暂停等人工,设有停止条件(最大轮数)。
三大原则 :保持简单、过程透明、精心设计 ACI(Agent-Computer Interface,即工具)。
4.4 Harness 解剖(JD 关键词,必懂)
Harness = Agent 的运行外壳:把「一个裸模型」变成「能稳定干活的 Agent」的所有工程封装。
Harness
├── 系统提示词 身份、目标、约束、输出格式、few-shot
├── 工具协议 Tool 定义/Schema/注册/参数注入/返回规范(MCP/Function Calling)
├── 上下文管理 组装、裁剪、压缩(compaction)、记忆(notes)、跨会话 Memory
├── 循环控制 步数上限、终止判定、重试、超时、错误恢复、预算控制
├── 状态与持久化 可恢复、可审计、可回放(checkpoint)
├── 安全护栏 权限、HITL、内容过滤、工具沙箱
└── 可观测性 轨迹追踪、Token/成本、延迟、行为审计
好 Harness 的标准:简单、透明、可观测、可恢复、便宜。
4.5 Tool Calling / MCP / Tool Schema 设计
Tool 三件套(解耦 Runtime 与业务):
- Tool Registry:启动扫描登记元数据(id/schema/endpoint),支持动态注册。
- Schema Management:JSON Schema 定义、版本、参数校验。
- Parameter Injection:按 Schema 自动填参,统一返回结构。
json
{
"name": "check_ad_qualification",
"description": "校验广告主行业资质,返回是否具备投放权限。适用于医疗/金融等强资质类目。",
"parameters": {
"type": "object",
"properties": {
"advertiser_id": {"type": "string", "description": "广告主 ID"},
"category": {"type": "string", "enum": ["medical","finance","education","other"]}
},
"required": ["advertiser_id", "category"]
}
}
工具设计最佳实践(Anthropic):
- 把工具当给初级工程师写的 docstring:示例、边界、格式要求、与其他工具的区别。
- 参数名要有描述性、无歧义;Poka-yoke(让错误用法难以发生,如强制绝对路径)。
- 不要工具膨胀:功能重叠、定义模糊会让模型选错。人类工程师说不清该用哪个,模型更不行。
- 返回结果要 token 高效。
- MCP(Model Context Protocol) :工具/上下文标准化接入协议,动态发现与调用。A2A:Agent 间通信与任务分派协议。
4.6 Context Engineering(2025 核心概念,必懂)
上下文工程 = 在 LLM 有限的注意力预算里,持续筛选「最小高信号 token 集合」。
三个底层事实:
- Context Rot:token 越多,模型准确召回能力越低(注意力被摊薄,n² 关系)。
- 注意力预算有限:每个 token 都在消耗预算(marginal returns 递减)。
- 上下文是有限资源:要当成稀缺资源管理。
上手指南:
- System Prompt :说清楚,但别硬编码脆弱逻辑(right altitude);分区组织(
<背景>、<指令>、# 工具指引、# 输出格式)。 - Tools:最小可用集合,自包含、抗错、清晰。
- Examples:多样化、典型,不要堆边界 case 长清单。
- 消息历史:informative yet tight。
长任务三技法:
| 技法 | 做什么 | 适用 |
|---|---|---|
| Compaction(压缩) | 接近窗口上限时摘要历史,用摘要重启新窗口;保留架构决策/未解 bug/关键细节,丢弃冗余工具输出 | 需要大量来回的任务 |
| Structured Note-taking(结构化笔记/Agentic Memory) | Agent 定期把进展写到窗口外的记忆文件(NOTES.md / to-do) | 有清晰里程碑的迭代开发 |
| Sub-agent(子智能体) | 子 Agent 用干净窗口深挖,只回传浓缩摘要(1-2k token),主 Agent 负责协调 | 可并行探索的复杂研究 |
Just-in-time 检索 :不预先塞所有数据,而是让 Agent 用轻量标识符(文件路径、查询、链接)运行时按需加载(Claude Code 的 glob/grep 思路)。混合策略:一部分预取(如 CLAUDE.md 直接入上下文),一部分按需探索。
上下文压缩五层(实操清单):
- 截断超出预算的后半部分。
- 删除单个冗余/循环的工具调用结果。
- 合并连续的同类工具调用。
- 生成会话摘要 → 替换原始历史。
- 全量摘要 + 写入 JSONL 存储(跨会话)。
4.7 Multi-Agent(领导关注,别踩坑)
单 Agent + 多 Tool vs Multi-Agent:
- 单 Agent:任务内聚、状态共享简单 → 用它。
- Multi-Agent(Supervisor/Router):子任务边界清晰、需独立上下文/记忆/权限、不同能力用不同模型/提示词 → 才拆。
什么时候拆(收益 > 成本):
- 上下文污染严重(工具描述互相干扰)
- 权限/数据敏感度需要隔离
- 需要独立的长上下文/RAG 或不同模型
Multi-Agent 的坑(必背):
- 上下文污染:工具一股脑塞给一个 Agent → 描述干扰、上下文膨胀。→ 按角色分散注册工具。
- 成本爆炸:每个 Agent 是完整循环,token 是单 Agent 的 3-10 倍。
- 调试困难:错误跨 Agent 传播,定位难。→ Agent 级可观测性(Agent Tree)。
- 任务冲突:子 Agent 对同一事实给矛盾结论。→ 结果聚合层统一 Schema、冲突处理。
原则:能用单 Agent 就不上多 Agent。拆之前先算账。
4.8 Auto-workflow:确定性外壳 + Agent 内核
- Workflow 式(Dify/n8n/扣子):节点固定、输入输出可校验,适合流程稳定、要审计、低成本、可控的业务。缺点:覆盖不了长尾变体。
- Agent 式:自由规划 + 工具调用,适合长尾、多变、难枚举。缺点:不确定、贵、难调、有幻觉风险。
- 主流趋势:外壳用 workflow/规则/校验兜底,内核用 LLM 决策处理长尾。
- DAG 编排 vs 线性 Pipeline :DAG 支持并行、条件分支、节点复用(Sub-Workflow/Nested Workflow);难点是拓扑排序、循环依赖检测、节点级错误隔离与状态回传。
- 线性 Pipeline 是 DAG 的简化版;Agent 循环是有环图,比 DAG 更进一层。
4.9 HITL(Human-in-the-Loop)
- 低置信 / 高风险 / 有争议样本转人工。
- 实现方式:Agent 在检查点暂停(
launch/pause/resumeAPI),把状态持久化,人工审批后继续。 - 审核场景 HITL 就是「人审兜底」:人审结果回流成最干净的训练/奖励信号------人审是模型的老师。
4.10 Agent 可观测性与评估(评估前提)
可观测性看什么:
- 会话级 Agent Tree:每轮思考、工具调用、文件变更、行为审计。
- Context Health:Token 消费曲线(非线性增长?)、上下文占用率、压缩事件频率、响应延迟与操作密集度。
- 退化判断:连续多轮 Token 斜率异常 / 接近窗口上限 / 压缩频发 → 主动预警。(阈值用历史基线 + 滑动窗口自适应)
Agent 评估四层指标:
| 层级 | 指标 |
|---|---|
| 任务级 | 任务完成率、端到端成功率、Pass@k |
| 模块级 | 意图识别准确率、工具调用成功率(选对/参数对)、RAG 检索命中率 |
| 成本级 | Token 消耗、回合数、P99 延迟、单次成本 |
| 质量/业务级 | 误报率/漏报率、人工介入率、用户满意度 |
评估方法三层:规则判断(能跑测试就跑,如 coding agent 跑单测)→ LLM-as-Judge(轨迹+预期打分)→ 线上真实反馈回流。
4.11 12-Factor Agents 速记(生产级 Agent 原则)
- 自然语言 → 工具调用。
- Own your prompts(自己掌控提示词,别被框架黑盒化)。
- Own your context window(自己掌控上下文窗口)。
- Tools 就是结构化输出。
- 统一执行状态与业务状态。
- 用简单 API 做 launch/pause/resume。
- 用工具调用联系人类(HITL)。
- Own your control flow(自己掌控控制流)。
- 把错误压缩进上下文窗口。
- 小而专注的 Agent。
- 从任何地方触发,到用户所在之处。
- 把 Agent 做成无状态 reducer。
4.12 Agent 成本优化三层
- 上下文层:丢弃早期轮次、工具结果摘要化、滚动/分层摘要、系统约束外置到持久规则文件、上下文外置到向量库按需注入。
- Token 层:KV Cache / 前缀缓存复用、精简工具描述与 Schema、few-shot 精简、系统提示词瘦身。
- 架构层:意图路由(简单请求小模型挡掉)、任务拆解避免重复上下文、按需注册工具(别全塞)。
第 5 章 模型运营:数据飞轮与评测闭环(岗位本质)
5.1 模型运营飞轮(背下来)
线上发现问题(bad case/申诉/举报)
↓
归因(数据 / 模型 / 阈值 / 流程)
↓
在对应环节补(补数据 / 改模型 / 调阈值 / 改流程)
↓
离线评测 + 小流量灰度上线
↓
业务指标验证
↓
回流成新数据 ──────────┐
↑ │
└────────────────────┘
谁能把这个闭环转得快,谁的模型就最新、最懂业务、最守得住准召。
5.2 迭代验证三件套(缺一不可)
- 离线评测:同一套专测集,新旧模型对比准召/误报率(防明显回退)。
- 线上回归 :影子模式 / 小流量灰度------先跑影子对比行为分布,再灰度 5%-10%。
- 业务指标 :漏放率、误伤率、人审介入率、申诉通过率,按类别拆开看。
⚠️ 离线指标提升 ≠ 线上提升 (评测集与线上分布有偏差)。最终标准是业务指标。
5.3 排障方法论:指标定位 → 分层归因 → 针对性修
- 先看端到端指标:问题是「完成不了」还是「完成得贵」?
- 逐层归因 :
- Agent 场景:意图解析层 → 工具调用层 → RAG/知识层 → 上下文/记忆层。
- 审核链路:规则层 → 小模型层 → 大模型层 → 人审流程层。
- 针对性修 :每次只改一处,跑同一套回归,用结果验证而不是拍脑袋。
最大坑 :一上来就调 prompt / 换模型。瓶颈往往在数据或流程。先归因、再动手。
5.4 事故处理:先止血 → 再追因 → 再防复发
- 止血:加临时规则/阈值挡住,评估同类样本全部捞回复核,控制影响面。
- 追因:数据 / 模型 / 阈值 / 流程,分别对应补数据、换策略、调阈值、改流程。
- 防复发:样本回流进训练集、评测集补这类 case、建立回归监控。
5.5 优先级决策:数据找瓶颈 → 业务代价排序 → ROI 决定做多深
- 拉出全链路指标,看哪个环节失分最大。
- 按业务代价排序:先堵大窟窿(漏放 > 误伤),高价值客户优先。
- 算 ROI:优先「改动小、见效快、能验证」的(数据侧、评测侧通常先做)。
- 用数据验证,每次只改一处。
5.6 一个真实 bad case 的归因 walkthrough(照着练)
场景:周一早上发现「医美类广告误伤率比上周涨了 3 个百分点」,同时广告主申诉量上升。
第 1 步:先定量,别慌着改
- 拉上周 vs 上上周:按二级类目拆误伤率,确认是全类目普涨 还是只有医美涨。
- 结论示例:只有"医美-皮肤管理"子类涨,其他类目平稳 → 问题局部化。
第 2 步:看形态,定位在哪一层
- 抽 50 条误伤样本,人工快速过一遍,分三类:
- 规则层误杀(关键词/正则太严)
- 模型误判(语义理解错、边界判错)
- 流程问题(该走人审的没走、阈值漂移)
- 结论示例:60% 是模型把"护肤"相关正常文案误判成"医疗功效"。
第 3 步:归因到具体原因
- 发现上周规则 2.0 更新了「医疗功效」定义,新增了"修复、治疗"等词 → 模型被新规则带偏,把生活美容也扫进去了。
- 这是典型的规则变更 → 数据/模型未同步问题。
第 4 步:最小动作 + 验证(每次只改一处)
- 方案 A(快):在规则层加"生活美容"白名单/排除词,人审兜底。
- 方案 B(稳):补一批"生活美容 vs 医疗美容"的边界样本进 SFT,重跑专测集。
- 先做 A 止血(当天灰度验证),再做 B 根治(一周一个迭代)。
第 5 步:防复发
- 把这类 case 加进评测集(防止下次同类回归)。
- 建立"规则变更 → 影响面评估"的检查项:规则改了什么、会影响哪些类目、要不要同步补数据。
这个 walkthrough 的价值 :它演示了本岗位最核心的思维方式------先归因、再动手;按规则/模型/流程分层;每次只改一处;用业务指标验证;把教训沉淀进评测集。把这套讲清楚,比堆任何算法名词都值钱。
第 6 章 工程工具箱:你每天会用到的东西
6.1 SQL(硬功底,别掉链子)
- 高频:分组聚合、窗口函数(
ROW_NUMBER/RANK/LAG/LEAD)、JOIN、CASE WHEN、CTE(WITH)。 - 审核场景典型:按类别统计漏放/误伤、按天看误报率趋势、TopK 违规类型、滑动窗口计数(限流分析)。
- 性能:建索引、避免函数索引失效、大表用
EXPLAIN看type/key/Extra。
sql
-- 按违规类别统计 precision / recall
WITH stat AS (
SELECT category,
SUM(CASE WHEN pred='违规' AND label='违规' THEN 1 ELSE 0 END) AS tp,
SUM(CASE WHEN pred='违规' AND label='合规' THEN 1 ELSE 0 END) AS fp,
SUM(CASE WHEN pred='合规' AND label='违规' THEN 1 ELSE 0 END) AS fn
FROM audit_samples GROUP BY category
)
SELECT category,
tp*1.0/NULLIF(tp+fp,0) AS precision,
tp*1.0/NULLIF(tp+fn,0) AS recall
FROM stat;
6.2 Python(工程熟练度)
pandas/polars处理标注数据;jsonlines流式读大文件(生成器省内存)。asyncio/aiohttp并发调用 LLM API;concurrent.futures做并发控制。- 重试与超时:
tenacity或自写 retry 装饰器;注意幂等。 - 上下文快照要用深拷贝 (
copy.deepcopy),否则回放错乱。
6.3 数据处理与存储
- 大规模数据:Spark / Hive(数仓); 小规模 pandas。
- 日志/流水查询:ES 适合全文检索,MySQL 适合结构化。
- 分表/索引:一天几百万条审核结果 → 按时间分区、归档冷数据。
6.4 检索与向量
- Embedding + 向量库(Faiss/Milvus/PGVector)。
- Hybrid Search:稠密向量 + 稀疏关键词(BM25),兼顾语义与精确匹配(设备编号、规则条款)。
- Rerank:交叉编码器在粗排结果上精排。
6.5 推理与部署
- vLLM / TensorRT-LLM / SGLang:高吞吐推理、PagedAttention、前缀缓存。
- 量化:AWQ/GPTQ/FP8。
- ONNX:跨框架转换;边缘部署(如 Hailo)需处理算子兼容(你已有经验)。
- 缓存:相同/相似素材直接命中缓存。
6.6 训练与实验
- Transformers + PEFT + TRL (SFT/DPO/GRPO);DeepSpeed / Megatron 大规模。
- 实验管理:清晰记录 config、数据版本、指标;可复现是底线。
- 评测脚本:把 benchmark 跑成自动回归(CI 化)。
第 7 章 Landing 30 / 60 / 90 天作战计划
Week 1(入职首周):搞清楚地图
- 拿到并通读:团队 OKR、业务规则文档、风险百科、现有评测集说明、数据管线文档。
- 重点搞懂两件事 :Mamoda 当前版本/能力边界/短板,规则 2.0 是怎么被模型消费的(这是你后续所有工作的底座)。
- 认识关键人:mentor、基模组同学、Agent 组同学、业务方对接人、人审团队负责人。
- 摸清现状:现在线上模型是什么、指标基线是多少(前置拦截量/拒审诊断量/CCR 等)、数据从哪来、评测怎么做、卡点在哪。
- 建立术语对齐:把本手册第 1、8 章过一遍,听不懂的黑话当场问。
- 环境准备:代码仓库、数据权限、算力入口、内部平台(实验/评测/监控)。
第 1 个月:摸清楚 + 拿一个小结果
- 主线 :把线上 bad case 和模型误判拉出来做一轮归因分析------瓶颈在数据、模型还是流程?
- 交付物:一份归因报告(问题分布 + 根因 + 建议优先级)。
- 小改进 :挑一个最有把握的环节做小改动(大概率在数据侧 :标签校准/难例回流,或评测侧:补边界样本)。周期短、风险低,能立刻检验你的判断。
- 验收:改动前后同一套回归,业务指标变化可讲清口径。
第 2 个月:跑通一个闭环
- 把一个环节做成可复用的闭环:归因模板 + 回流策略 + 回归看板。
- 参与/主导一次后训练迭代(数据配方 → SFT/RL → 评测 → 灰度)。
- 参与/主导一个 Agent 子项目(研判/归因/采集/客服)的优化。
第 3 个月:沉淀 + 扩影响
- 沉淀方法论:形成可复用的「评估体系 + 数据工程 SOP + 排障手册」。
- 抽象业务范式:把某一类治理问题的解法标准化,推广到其他业务线。
- 主动输出:团队早自习/技术直播分享你的实验认知(团队文化鼓励分享)。
前 90 天的三个心法
- 先归因,再动手------别急着调参换模型。
- 每个迭代都能讲清「改了什么、哪个数变了、变了多少、口径是什么」。
- 脏活(接数据、清洗、跑报表)是建立业务感知最快的方式,认真做,它是信任的起点。
入职第一周「必问清单」(照着问,别怕显得新)
分四组问完,你就掌握了 80% 的上手信息。建议入职第一天就把这份清单发给 mentor。
A. 业务与指标(最重要的 5 个)
- 我们团队当前最核心的 3 个 OKR 是什么?
- 线上漏放率 / 误伤率 / 人审介入率 / CCR 的基线是多少?各自口径怎么定义?
- 广告、生服、电商三条线,我主要负责哪条?服务哪个具体产品/场景?
- 现在最痛的 bad case 类型是什么?(先打这个)
- 规则最近一次重大变更是什么?规则 2.0 目前覆盖了哪些范围?
B. 模型与 Mamoda
- 基座模型(30B/80B)和 Mamoda 是什么关系?我服务哪一个?
- Mamoda 现在的版本、支持哪些模态、延迟和成本大概多少?
- Mamoda 的调用/微调方式?能力边界在哪?它现在最不擅长的场景是什么?
- 后训练链路:SFT 的数据从哪来?RL 有没有在线上/实验里用?用到什么程度?
- 模型评测集在哪、多久更新一次、怎么防泄漏?
C. 数据与系统
- 数据在哪个数仓/表?权限怎么申请?常用表名和字段?
- 人审/标注团队在哪?标签怎么回流到我这儿?
- 评测回归怎么跑?有 CI 或自动化脚本吗?
- 灰度 / 影子 / AB 平台怎么用?
- 数据看板在哪?指标怎么自己拉?
- 推理和训练资源怎么申请?排队情况如何?
D. 协作与节奏
- 我的 mentor 是谁?周会/双周会节奏如何?
- 和业务方、人审团队、算法团队分别怎么对接?谁是关键接口人?
- 一个需求从提出到上线的标准流程是什么?(有没有评审/卡点)
- 团队对新人前 30 天的期望是什么?怎样算"上手了"?
第 8 章 术语表(中英对照 + 一句话解释)
| 术语 | 一句话解释 |
|---|---|
| CQC | 内容质量与数据服务平台(你的部门),负责内容安全与质量、数据与算力基础支持 |
| 巨量引擎 | 字节商业化平台;「商业信任与安全」是其中做广告/商业内容治理的团队 |
| Mamoda | 团队自研的广告治理多模态大模型(2026 已到 2.5),你的基模工作大概率围绕它 |
| DiT-MoE | Mamoda 2.5 架构:MoE 混合专家 + DiT 扩散融合;128 专家、25B 总参、3B 激活 |
| 规则 2.0 | 把模糊规则重构成结构化"机器语言",结合 SFT/RL 提审精度 |
| 全链路治理 | 风险识别 → 精准定位 → 素材自动修复 的端到端治理 |
| 以 AI 治 AI | 用大模型对抗 AIGC 违规内容 |
| 后链路 | 广告投放后的履约/体验守护,穿透履约"黑箱" |
| CCR(消费者抱怨指数) | 整合评论/举报/投诉等负反馈的首创指标 |
| 机审 / 人审 | 机器自动审核 / 人工审核;两者是飞轮关系,不是替代关系 |
| 准召 / Precision / Recall | 精确率(拦下的有多少真违规)/ 召回率(违规里拦到多少) |
| 误伤 / 误报 / FP | 把合规判成违规;损失广告收入 |
| 漏放 / 漏报 / FN | 把违规判成合规;监管舆情风险 |
| 黑五类 | 药品/医疗器械/保健食品/医美/减肥等强监管品类 |
| HITL | Human-in-the-Loop,人工介入,低置信/高风险转人工 |
| Harness | Agent 运行外壳:提示词、工具协议、上下文管理、循环控制 |
| Context Engineering | 上下文工程:管理有限注意力预算里的高信号 token |
| Context Rot | 上下文越长,模型召回能力越低 |
| Compaction | 接近窗口上限时摘要历史,用摘要重启新窗口 |
| Agentic Memory | Agent 把进展写到窗口外的记忆文件,按需拉回 |
| MCP | Model Context Protocol,工具/上下文标准化接入协议 |
| A2A | Agent-to-Agent,Agent 间通信与任务分派协议 |
| Tool Schema / Registry / 参数注入 | 工具定义 / 注册中心 / 按 Schema 自动填参 |
| Auto-workflow | 自动化工作流;确定性外壳 + Agent 内核 |
| Multi-Agent / Supervisor / Router | 多 Agent 协作;总控按意图路由到子 Agent |
| RAG / Hybrid Search / Rerank | 检索增强生成 / 稠密+稀疏混合检索 / 交叉编码器精排 |
| SFT / RLHF / RLVR | 监督微调 / 人类反馈强化学习 / 可验证奖励 RL |
| DPO / KTO / PPO / GRPO / GSPO | 各类对齐算法(见第 3 章表) |
| Agentic RL | 把 RL 扩展到工具使用/长任务,过程奖励 + 结果奖励 |
| LoRA / QLoRA | 低秩适配微调 / 4-bit 量化基座 + LoRA |
| MoE | 混合专家,稀疏激活,总参大、激活小 |
| KV Cache / Prefix Caching | 推理键值缓存 / 前缀缓存复用 |
| 量化 AWQ/GPTQ/FP8 | 权重/激活低精度压缩,省显存提吞吐 |
| TP / PP / DP / EP | 张量/流水线/数据/专家并行 |
| Model Collapse | 模型学自己生成的数据导致退化、多样性丧失 |
| Reward Hacking | 模型钻奖励函数空子拿分而非真正做对 |
| LLM-as-Judge | 用模型给模型打分(评估方法之一) |
| Shadow Mode / 灰度 | 影子模式(不生效只观察)/ 小流量放量 |
| Bad Case | 模型判错的样本 |
| Data Flywheel / 数据飞轮 | 回流数据持续提升模型的闭环 |
| STW | Stop The World,GC 暂停应用线程 |
| AIGC | AI 生成内容(审核的新对象,也是新工具) |
第 9 章 学习资源清单
后训练 / RL
- InstructGPT(RLHF 范式)、LIMA(少样本 SFT)、DeepSeek-R1/V3(GRPO、RL 工程化)、Qwen 技术报告(GSPO)、Kimi K2/K3(分任务 RL + 合并)。
- 关键词检索:
SFT、RLHF、DPO、GRPO、RLVR、Agentic RL、reward model。
Agent 工程
- Anthropic《Building Effective Agents》:workflow vs agent、六大模式、ACI/工具设计。
- Anthropic《Effective Context Engineering for AI Agents》:context rot、compaction、note-taking、sub-agent、just-in-time。
- 12-Factor Agents(github.com/humanlayer/12-factor-agents):生产级 Agent 12 条原则。
- LangGraph / MCP / A2A 官方文档;Claude Code 的 Harness / Skills / Hooks 设计。
- 关键词检索:
agent harness、context engineering、multi-agent supervisor、agent evaluation。
内容安全 / 审核
- OpenAI《Using GPT-4 for content moderation》:策略→黄金集→模型标注→差异分析→蒸馏小模型 的迭代流程。
- Llama Guard 等安全分类器论文。
- 平台规则文档(内部):入职后第一优先级,比任何外部资料都重要。
基础
- Transformer(Attention Is All You Need)、MoE 综述、量化综述、vLLM/PagedAttention。
- 关键词检索:
MoE、quantization、KV cache、speculative decoding。
建议的学习节奏(读 → 做 → 用)
- 读:论文/技术报告原文(配方细节只在报告里)。
- 做:小规模复现(QLoRA、GRPO 跑通一遍)。
- 用:在项目里落地(数据工程、评测闭环),印象才深。
第 10 章 避坑与潜规则
技术侧
- ❌ 一上来就调 prompt / 换模型:先归因,瓶颈常在数据/流程。
- ❌ 只看离线指标:离线提升 ≠ 线上提升,最终看业务指标。
- ❌ 一次改多处:分不清是谁的功劳,每次只改一处 + 同一套回归。
- ❌ 训练/评测数据泄漏:时间切分隔离,否则效果被严重高估。
- ❌ 忽略标签质量 :训练集混入误伤样本,模型就学会误伤广告主。标签可信 > 数据量。
- ❌ 过度设计 Agent:能用单 Agent/Workflow 就别上 Multi-Agent/Agent。
- ❌ 上下文无限膨胀:用 compaction/note-taking/just-in-time。
业务/协作侧
- ✅ 只谈技术方案、指标、机制------JD 明确「纯技术画像,产品向不 OK」。不和稀泥、不空谈产品体验。
- ✅ 数字永远讲口径:被质疑时讲清样本定义、对比基准,别闪烁其词。
- ✅ 被挑战时稳住:Leader 要的是真实性和逻辑,不是完美数字。不会就承认 + 给思路。
- ✅ 主动抛钩子:每个项目准备「可深挖的技术点」,掌握节奏。
- ✅ 快速行动 + 坦诚清晰:字节文化。有问题直接摆数据、摆证据。
- ✅ 不要抱怨运营序列:理解成「做算法的事、要业务的结果」,主动对齐。
- ✅ 输出即影响力:团队每周 2 场直播、每日早自习,鼓励分享------把你的实验认知写出来、讲出来。
心态
- 前 90 天不会马上接触核心训模,可能先接数据、清洗样本、跑报表------把它当「第一个该拿下的山头」。
- 没训过 30B/80B 不可怕,方法论可迁移;诚实说规模上是新人,落到数据配方和后训练。
- 深度本身就能带来成长,不需要靠频繁跳转换取成长。
第 11 章 速查卡(Cheat Sheet)
一句话记住岗位
后训练让模型「懂规矩」,Agent 让系统「会干活」,数据飞轮让两者「越用越强」,准召和成本是最终裁判。
团队真实主线(巨量引擎商业安全)
CQC 造能力 × 巨量引擎商业信任与安全 用能力
Mamoda(多模态治理大模型)· 规则 2.0(机器可读规则)· 后链路守护 · CCR 消费者抱怨指数
核心理念:全链路治理 + 以 AI 治 AI;从"单向拦截"到"主动赋能"
业务硬指标(能被引用)
90% 素材 10 分钟内审完 · 效率 +75% · Q3 前置拦截 84 万+ · 日均 1500 万条拒审诊断 · 日修复超百万条
机审漏斗
资质准入 → 规则/知识库 → 小模型初检 → 大模型精判 → 人审兜底 → 闭环回流
准召口诀
漏放代价 > 误伤代价 → 冷启动高召回 → 高置信自动处置 → 低置信转人审 → 回流收紧阈值
后训练口诀
SFT 建基线 → DPO 调安全偏好 → GRPO/RLVR 做可验证 → PPO+RM 关键路径
Agent 口诀
LLM + tools in a loop;Workflow 确定外壳 + Agent 长尾内核;能用单 Agent 就不上多 Agent
上下文三技法
Compaction(压缩)· Note-taking(笔记)· Sub-agent(子智能体)
排障三步
指标定位 → 分层归因 → 每次只改一处
事故三步
先止血 → 再追因 → 再防复发
每日循环(真实工作节奏)
看数 → 挑 bad case/申诉推翻样本 → 归因(数据/模型/规则/流程) → 最小动作 → 离线+灰度 → 看业务指标 → 回流+写周报
入职第一天
把「必问清单 20 问」发给 mentor,先搞懂:我的 OKR、我服务哪条线、Mamoda 和基座的关系、数据在哪、评测怎么跑
迭代验证三件套
离线评测 + 影子/灰度 + 业务指标(按类别拆)
四个必须能秒答的业务指标
漏放率 · 误伤率 · 人审介入率 · 单条成本
评测三层
通用能力 → 业务专测集(含边界/对抗)→ 链路级
置信度两路信号
模型把握(类间摇摆) + 规则校验(字段/特征/矛盾)→ 合成 → 阈值按 PR 曲线定
数字挑战应对模板
「口径是同一时段、同一规则下,X 样本数 / 总样本数的对比。如果您想复核,我可以讲清楚样本定义和计算方式。」
最后一句 :这份手册已经把「业务场景 + 技术主轴 + 操作流程 + 必问清单」四层都补齐了。业务黑话一周吃透,第 3、4 章的后训练与 Agent 两大主轴做深,再用「入职第一周必问清单」把内部系统/数据/评测/口径对齐------你就能比任何人都快地 landing。
先归因,再动手;拿数据说话;把闭环转快。冲。