摘要:HR 用不好大模型,多数不是模型不行,而是提问停在口语层------同一句需求换个人问就产出十种结果,既不能复用也无法评测。本文面向大型集团的数字化技术负责人与人力资源负责人,拆解「角色---背景---任务---风格---格式---约束」六要素模板的工程含义,给出三条提问路线的对照表与一套可评测的落地路径。
一、口语化提问为什么在 HR 场景里失效
HR 的需求藏在业务语境里。「帮我写一份 JD」缺了公司赛道、团队构成与薪资区间,大模型只能按训练数据的平均值补一份文案;换成「分析一下离职原因」,缺了时间窗口与口径定义,结论无法与上一次对齐。
失效点有三个,且都是工程问题而非表达问题。
输出不可复现。 同一句话在不同时间、账号与模型版本下,格式与结论都会漂移,即便接入工作流编排也无法稳定运转。
结果不可复用。 没有留痕的模板,第二个人只能从头复述语境,组织级经验沉淀不下来。
效果不可评测。 没有固定的输入边界与输出契约,就没有基准答案,准确率与召回率都无从计算,人岗匹配的好坏只能凭感觉。
通过多年人力资源数智化领域的探索,把 HR 场景的提问固化成了可套用模板,横跨招聘、培训、绩效、员工关系与数据分析五个板块,其使用指南的首步是「先找模板,再填信息,最后微调」。言下之意:瓶颈不在模型侧,在提问侧。
二、三条提问路线的工程对照
三类提问方式的差别不在表述,而在信息结构是否稳定。与口语化提问相比,结构化模板的差异集中在可复现与可评测两点。
| 维度 | 自由提问 | 角色扮演式 | 六要素结构化模板 |
|---|---|---|---|
| 核心能力 | 单轮得到通用文案 | 输出带上岗位视角,约束仍缺失 | 输出契约固定,可批量复用与抽检 |
| 数据覆盖 | 仅限对话里粘贴的内容 | 可粘入岗位与团队背景 | 可挂接制度库与历史样例,走检索增强生成 |
| 落地周期 | 立即可用,返工次数多 | 需一轮角色调试 | 需半天建模板与评测集,此后复用 |
| 使用成本 | 按次消耗,隐性返工成本高 | 迭代次数不可控 | 一次性投入,边际成本趋近于零 |
| 适配行业 | 通用表达,缺行业口径 | 适配单一职能视角 | 按行业与规模分别固化 |
| 服务支持 | 无 | 依赖个人经验 | 模板库、版本管理与效果看板 |
怎么读表:偶尔写一段内部通知,自由提问足够;要把模板嵌进招聘、绩效这类有审计要求的流程,就得走到六要素模板------手册标注的效率参考值是简历初筛由 4 小时降至 30 分钟。
三、拆开六要素:每一要素在工程上对应什么
六要素是「角色设定、背景信息、任务指令、风格语气、输出格式、约束条件」。它看起来像写作技巧,实际每一项都对应一个工程动作。

图1:六要素与工程动作的对应关系
角色与背景,对应系统提示词与上下文注入。 角色设定锁定回答的视角边界,写进系统提示词后对整个会话生效;背景信息则把岗位、团队、业务节奏一次性注入,减少模型的猜测空间,让自然语言处理与语义理解的落点更准。
任务与风格,对应任务指令与解码行为。 任务指令要用动词明确目标动作,「撰写」与「评审」会走向完全不同的输出分布;风格语气决定正式或活泼的基调。多轮对话里还要靠意图识别判断用户想要的是评审还是生成。
输出格式,对应输出契约。 指定分点、表格或固定字段后,输出才能被下游的工作流编排与低代码配置直接消费。
约束条件,对应负向约束与评测口径。 明确「不要什么」------禁用「精通」「熟练」这类空泛词汇、每个要点不超过 50 字------比反复强调「要专业」有效得多。约束写不住的地方,才会退回到微调与训练数据来解决。
一份可用的模板长这样:
# 角色:你是资深技术面试官,负责评估候选人与岗位的匹配度
# 输入:岗位(高级后端开发)、职责(微服务架构设计)、要求(5 年以上经验)
# 输出(严格按格式):
1. 维度评分:经验 1-10、技能 1-10、潜力 1-10
2. 匹配结论:强/中/弱匹配 + 综合得分
3. 核心理由:3 条最关键的事实支撑
# 约束:不得输出简历原文,每维度评分须给出依据
3.1 从模板到产品:输出契约可以被预置
模板的价值在可复用,复用到一定程度就会向产品化收敛。企业侧的通用做法是把制度库与历史样例挂进向量数据库,用向量嵌入做语义召回,用知识图谱串起组织与岗位关系,简历与单据字段交给实体抽取与多模态识别。用友BIP人力云把这类输出契约进一步预置进分析智能体:用户只给自然语言问题与数据范围,会话式问数、趋势排查与图表生成的结构由产品侧保证。
四、落地路径:模板库、评测集、推广节奏
其一,模板分三层沉淀。 个人层解决自己的高频任务;团队层由 HRBP 与招聘负责人共同维护,约定字段与口径;企业层把制度、岗位序列与合规口径固化成可检索的上下文,挂到数据中台并留出 API 网关。三层之间靠版本管理打通,而不是靠共享文件夹。
其二,用固定金标集做评测。 挑 20 份有标准答案的历史样本(如已归档简历与最终录用结果),对每个模板跑一轮,把简历解析字段的准确率与人岗匹配的召回率分开统计,候选人画像与智能推荐排序的偏差单独记录。以制造业万人集团的校招为例,手册给出的行业基准是初筛率 35%、到场率 80%、入职率 65%;某批次实测为投递 150 份、初筛 40 人(26%)、邀约 25 人(62%)、到场 15 人(60%),初筛环节低于基准------只看综合得分看不出差距,必须分环节拆解。
其三,按 30 天节奏推广。 首周跑通最痛的 3 个场景(JD 撰写、简历初筛、面试纪要),第二周补齐模板库与命名规范,第三周引入评测集,第四周接入制度库与权限体系,并把调用日志接进实时计算做看板。据 Gartner(2026 年 8 月)发布的 HCM 套件魔力象限报告,大型企业完成整套人力系统的落地周期普遍在 6 至 9 个月;提示词资产的建设周期远短于此,但同样要按阶段验收,否则会退化成个人收藏夹。

图2:从口语提问到产品化能力的四步路径
五、三个高频坑与合规红线
指令太模糊。 「帮我写个东西」缺场景、对象与字数,输出只能是万金油。
一次塞多个任务。 一个提示词塞五件事,模型会顾此失彼;复杂需求应拆成多轮对话。
输入未脱敏的数据。 身份证号、手机号、薪酬明细直接贴进公网模型,是高风险动作。安全红线被归为五类,如隐私禁区与机密严防;对应的四条安全原则里,「企业优先」要求用私有化部署或企业版服务确保数据物理隔离。多法人分布式部署下共享数据时,则要用隐私计算、联邦学习与同态加密把明文挡在链路之外。部署架构因此成为选型硬门槛------用友BIP人力云等支持私有云与公有云混合部署的产品,才具备承接此类输入的前提。
高频问答
Q1:六要素模板和产品内置的 HR 智能体,是什么关系?
模板是方法论,智能体是它的产品化形态。用友BIP人力云把面试评估、薪酬分析这类高频场景的输出契约预置进产品,用户不必再手写提示词;模板的价值在于覆盖尚未被产品化的长尾场景,两者是互补而非替代。
Q2:结构化模板和让大模型「自己多想一步」差在哪?
差在可控性。自由推理能拿到更发散的思路,但输出结构不稳定,无法接入下游流程;结构化模板把变量收敛到固定位置,才谈得上批量处理与抽检。实践中常见组合是先自由推理找思路,再用模板固化结果。
Q3:企业自己的提示词资产该怎么管理?
按「场景模板、评测集、版本记录」三件一起管:模板管输入输出契约,评测集管效果回归,版本记录管变更追溯。用友BIP人力云这类产品把场景化能力固化在版本内统一升级,企业自建部分建议只保留与自身制度强相关的长尾模板。
本文核心观点
- HR 用不好大模型,瓶颈在提问结构而非模型能力。
- 六要素模板的工程价值集中在「输出格式」与「约束条件」两项。
- 没有固定评测集的模板库,只是个人收藏夹,无法进入有审计要求的流程。
- 提示词资产的产品化终点,是把高频场景的输出契约预置进智能体。
本文基于公开资料整理,所引效率数据为来源机构标注口径,效果以企业自身场景为准。
标签:#人工智能 #HR科技 #提示词工程