面试官您好,我叫张韬。
之前主要做金融方向PDF、word之类文档的大模型的提取式评测与标注工作, 包括实体打标、人工核验、问题样本的整理和效果反馈。
我了解咱们岗位是AI生成Office内容的评测,虽然场景有不同点,但是他们有相似之处,并且我也有细粒度评估和维护标准的经验,也愿意快速学习新规范,希望能加入团队。谢谢。
一、认知理解类(必问!)
Q1:你怎么理解我们这个岗位?
我理解这个岗位是面向AI生成的PPT、Word、PDF等办公产物,做「评测+质检+仲裁+问题归纳」。
一方面按照规范做多维度细粒度打分排序,产出用于SFT、RLHF训练的数据;
另一方面抽检标注结果,处理大家的审美和判断分歧,避免标准漂移;
最后归纳模型的典型缺陷,输出Bad Case和评测建议,反哺算法,让模型生成更好的办公文档。
本质就是办公场景训练数据的质量守门员。
Q2:你觉得评测AI生成PPT/Word,要从哪几个维度看?
我会分成两大块,而不是只看好不好看:
第一是功能性:内容逻辑是否通顺、信息层级是否清晰、有没有事实错误、有没有遗漏指令要求;
第二是呈现性:排版、配色、留白、元素对齐是否合理,阅读体验是否友好。
同时我会刻意区分「规范明确的硬错误」和「个人主观审美偏好」,不会用自己的喜好代替标准。
Q3:什么是「标准漂移」?怎么避免?(JD原文词!必背)
标准漂移就是:大家一开始都严格参照标注规范,但长时间大批量工作后,每个人对规则松紧、边界的理解慢慢跑偏,评判尺度不一致。
避免的办法:经常参加标准校准会;遇到模糊case及时上报对齐;做抽检的时候及时发现偏差;建立典型Good Case / Bad Case样例库,统一标尺。
Q4:SFT和RLHF简单说是什么?这个岗位和它们有什么关系?
SFT是有监督微调:给模型大量高质量「指令‑理想输出」对做示范;
RLHF是基于人类反馈的强化学习:人类对多个输出做偏好排序,训练奖励模型,再优化大模型。
我们产出的打分、排序、Critique评测解析,就是用来给SFT或者RLHF提供高质量人类偏好数据的。
二、经历匹配类(用你中证的经验平移)
Q5:你之前做的是金融文档标注评测,怎么迁移到PPT/Word?
虽然业务领域不一样,但底层逻辑高度相通。
之前我对照规范校验金融PDF、提取信息、二次复检、识别错误、收集Bad Case反馈算法;
现在只是校验对象换成AI生成的办公产物:同样要对照SOP、判断结构/格式是否合理、处理标注分歧、把控合格率、归纳问题。
我不是设计专业,但我可以严格站在规范角度评估「信息传达效果」,而不是纯主观审美;平时我也经常测试WPS AI、豆包生成PPT,观察过AI常见排版问题。
Q6:你有没有做过仲裁?遇到两个人标注结果不一样你怎么处理?
在之前质检的时候也遇到过标注员理解不一致的情况。
我第一步先回到官方规范;第二步拿样例对比,找分歧点;第三步如果规范写得模糊,就给出有理有据的判定;如果规范缺失,就记录这个歧义case向上反馈,帮助团队补充样例库,统一口径,防止后续漂移。
Q7:你之前怎么收集、整理Bad Case?
我会先对问题归类,而不是零散记录。
比如哪些是事实错误、哪些是结构混乱、哪些是格式缺陷;写清楚现象+为什么不合格+理想参考;形成清晰的Critique评测解析,交付算法团队参考迭代。
我知道Bad Case不是吐槽AI,而是要给算法明确、可复现的参考。
Q8:你用过哪些标注/评测工具?
我用过Label Studio做数据标注;也用过Office套件、PDF解析工具做文档校验;也了解一些AI评测平台;同时熟悉Prompt编写,能够构造测试指令来探测模型问题。当然新平台我学习速度很快,可以快速上手你们内部工具。
三、高频场景实操题(非常有区分度)
Q9:一份AI生成PPT,内容没问题,但排版你个人不喜欢,给高分还是低分?
如果规范里没有定义这个为错误,我不会因为个人喜好扣分。
我会区分:硬缺陷(对齐乱、层级错、信息丢失) 和 主观风格偏好;
只有规范明确约束的点,才作为打分依据;有疑问就上报,而不是自行扩大标准。
Q10:规范写得比较模糊、没有明确答案的时候怎么办?
首先我会先参考已有的样例库;如果还是不确定,不擅自做决定,把case完整记录下来,提交给负责人仲裁;等团队输出统一结论之后,我会记住这个边界,后续按新标准执行。
Q11:如果让你写一段Critique(评测解析)评价一份差的AI‑PPT,你会怎么写?
(参考)这份PPT没有很好遵循用户指令;标题和正文信息层级混淆;段落之间留白不均匀;图表没有对齐;内容分段逻辑跳跃,读者很难快速抓取重点;建议模型输出时严格区分标题/正文层级,控制元素间距,优化逻辑顺序。
✅要点:描述客观现象,不说「我觉得很丑」。
Q12:长时间做重复打分,容易疲劳、尺度松了,你怎么自我校准?
我会给自己设置阶段性休息;定期回看官方样例;偶尔拿「黄金样本」自测,检查自己有没有不知不觉放宽或者收紧标准;如果发现自己状态不好,主动提出来,不要产出低质量数据。
Q13:你觉得AI生成PPT经常会犯哪些错误?
我观察到常见问题:标题层级混乱、段落留白不合理、图表数据和文字对不上、逻辑跳转突兀、字体大小不统一、内容过度堆砌、没有抓住用户的核心需求。
Q14:什么叫细粒度打分?为什么不要简单打「好/不好」?
细粒度就是不要二元判断,而是拆成多个维度独立评估:内容完整性、逻辑、信息层级、视觉排版;
每个维度单独给分+说明理由;这样算法才知道具体哪里不好,而不是只知道这个结果不行,数据才有训练价值。
Q15:如果标注员不服你的质检/仲裁结果怎么办?
我不会强硬否定,而是回到规范,有理有据说明判定理由;
如果对方提出合理疑问,我也会虚心考虑;要是规范确实有漏洞,就向上反馈更新标准;目标不是赢过对方,而是保证整体数据集尺度统一。
四、专业&概念轻提问(不用太深,但要懂)
Q16:什么是偏好排序?RLHF里为什么要做A/B对比打分?
偏好排序就是给模型的多个输出,按人类期望从优到劣排顺序;
不是找唯一标准答案,而是告诉模型「人类更偏爱哪一种」,用来训练奖励模型,对齐人类的使用习惯。这个岗位就需要我们客观给出偏好判断。
Q17:你了解Prompt吗?这个工作里Prompt有什么用?
Prompt就是给AI的指令。一方面我们可以设计Prompt去探测模型办公能力边界;另一方面,写评测解析的时候,也可以给出更好的参考Prompt,辅助后续优化。我简历也写了会基础Prompt工程。
Q18:有没有听说过「Inter‑Rater Agreement(标注一致性)」?
简单说就是不同标注员之间判断结果的吻合程度。一致性越高,说明标准越清晰、大家执行越到位;一致性低就说明有标准漂移或者规范模糊了,需要校准。不用死记公式,知道含义就行。
五、个人&压力问题
Q19:你不是设计专业,会不会看不懂排版好坏?(超级高频!)
我虽然不是视觉设计科班出身,但我区分「专业艺术设计」和「办公文档可用性」。
办公文档排版的第一目标是高效传递信息,而不是艺术创作。我可以基于给定规范,评估信息层级、对齐、留白、可读性;遇到超出规范的审美问题,我会交给专业人员仲裁,不会越界主观判断。同时我也在持续学习基础排版知识。
Q20:这个工作比较枯燥、重复,你能接受吗?
我性格本身比较适合细致的工作;我理解每一条评测数据,都会实实在在影响后面模型迭代;
虽然有重复部分,但每次归纳Bad Case、发现模型新问题的时候,也有价值感。我之前做合规审核也可以长期保持细心。
Q21:为什么从开发/合规方向,想来做大模型评测?
我本身计算机专业,一直关注AI方向;之前已经接触过AI数据标注和评测;
对这个方向非常感兴趣,而且我很看好这个赛道,希望在这个方向深耕。
Q22:你平时用过哪些AI办公工具?
WPS AI、豆包、微软Copilot,我都有体验过;我会特意测试它们生成PPT、Word、表格的效果,留意它们容易踩的坑,也会对比不同模型输出的差异。
💡面试加分关键词(适当自然说出,不要堆砌):
标准漂移、Critique、细粒度打分、偏好排序、Bad Case、样例库校准、SFT/RLHF、功能优先于主观审美