过去一年,关于 Google 的讨论大多围绕 Gemini、搜索产品和大模型竞争展开。但在产品发布和模型排名之外,Google Research 仍然在用另一种时间尺度工作:押注那些短期看不到结果,却可能改变未来计算、科研和社会基础设施的问题。
Google Research副总裁 Yossi Matias 在官方播客中谈到生成式 UI、世界模型、AI Co-Scientist、洪水预测和量子计算,也谈到了一个更直接、和普通职场人更相关的问题:
当 AI 接管了大量基础工作,年轻人还需要从最底层岗位开始积累十几年吗?
这个问题的答案并不轻松。AI 的确会减少一部分初级执行工作,但它同时会把更高阶的任务提前推到职业生涯的起点。过去靠时间慢慢熬出来的判断力,未来可能从入行第一天就成为考核标准。
一、岗位头衔正在让位于能力组合
工业时代的岗位划分,建立在一个前提上:不同职能需要不同的人长期承担。
产品经理负责需求,设计师负责界面,工程师负责开发,测试人员负责验证。一个人只需要把自己的那块工作做好,组织就能通过流程把这些能力拼起来。
AI 正在削弱这种分工边界。
今天,一个产品经理可以借助 AI 生成交互原型;一个设计师可以直接把页面跑起来;一个工程师可以快速完成用户调研、竞品分析和方案草拟。软件、设计、分析和研究之间的距离被压缩了。
这并不意味着所有人都会变成全能专家。现实更可能是:一个人能够调动一组虚拟协作者,完成过去需要多人配合的工作闭环。
变化首先发生在任务颗粒度上。
过去,一个新人可能被安排做资料整理、基础编码、测试用例、文献检索。这些工作看似琐碎,却是组织培养人的主要入口。新人通过大量重复任务,逐步理解业务、系统和质量标准。
如果 AI 可以在几分钟内完成这些事情,组织就会自然追问:还需要多少人来做基础执行?
这也是初级岗位最先受到冲击的原因。它们往往具有三个特点:
- 输入和输出相对标准化;
- 结果可以通过规则或样例验证;
- 工作价值主要来自执行速度,而非复杂判断。
但岗位减少并不等于能力要求降低。恰恰相反,剩下的工作通常更接近问题定义、方案取舍、结果验证和责任承担。
换句话说,岗位头衔的含义会变淡,能力组合的重要性会上升。
一个真正有价值的工程师,未必只是会写某种语言;他需要理解业务目标、系统约束、数据质量、成本边界和上线风险。一个真正有价值的研究人员,也不能只会检索论文和运行模型;他需要判断哪个问题值得研究,哪个结果值得相信,以及下一步实验应该怎么设计。
二、AI压缩了经验曲线,也压缩了容错空间
Yossi Matias 提到,过去一个年轻研究者可能需要十到十五年,才能成长为能够独立提出重大问题、统筹复杂资源的研究者。
这十几年并不只是学习知识。更重要的是,人在一次次失败和反馈中形成了判断模型:
- 什么问题值得投入;
- 什么数据可能存在偏差;
- 什么结果只是偶然;
- 什么方案虽然漂亮,但无法落地;
- 什么指标提升并不代表真实价值;
- 什么风险不能交给自动化系统处理。
AI 可以把大量资料、代码和工具交到新人手里,却很难直接交付成熟的判断。
于是,一个明显的矛盾出现了:
新人拥有了资深专家级别的工具,却缺少判断工具输出的经验。
这就像给一个刚学会开车的人一辆性能极强的赛车。速度上去了,刹车距离和事故代价也一起上去了。
很多企业在部署 AI 时,容易把效率提升理解为"同样的人做更多事"。但在高风险业务里,更常见的结果是:系统生成更多方案,团队需要花更多时间筛选、验证和负责。
AI 让生产变便宜,也让错误变便宜。错误越容易产生,验证就越重要。
这也是为什么判断力会成为新的稀缺资源。
判断力不是抽象的"聪明",它至少包含四个部分:
| 能力 | 具体表现 |
|---|---|
| 问题定义 | 能把模糊诉求转成可验证的问题 |
| 约束识别 | 知道数据、成本、时间和合规边界 |
| 结果评估 | 能识别幻觉、偏差和不完整结论 |
| 取舍决策 | 能在多个不完美方案中承担选择后果 |
过去,这些能力可能在十几年工作中逐渐形成。未来,组织会希望新人更早具备它们。
这会让新人更快接近高价值工作,也会让入行门槛明显提高。
三、科研案例说明了AI真正擅长什么
Google Research在访谈中提到的 AI Co-Scientist,很适合用来理解这种变化。
它并不是简单地帮科学家查几篇论文,而是尝试把科研流程拆成多个协作环节:
- 检索和整理相关文献;
- 生成多个候选假说;
- 对假说进行交叉比较;
- 根据已有实验数据进行初步验证;
- 对结果排序,并交给研究人员进一步判断。
这类系统的价值,来自规模和广度。
一个人很难同时通读不同学科的大量论文,也很难持续检查某个假说是否已经在其他领域出现过类似证据。多 Agent 系统可以把不同角色拆开,让它们分别提出观点、相互质疑,再汇总成候选方案。
大致可以抽象成这样的流程:

但这里有一个容易被忽略的关键点:AI 生成假说,不等于科学发现已经完成。
科学研究的难点从来不只是"提出一个看起来合理的解释"。真正困难的部分还包括:
- 假说是否具有可证伪性;
- 数据是否足以支撑结论;
- 实验条件是否存在隐藏变量;
- 模型是否只是学习了相关性;
- 结果能否被独立复现;
- 结论能否迁移到真实场景。
AI 可以快速扩大假说空间,但假说数量增加后,验证成本也会增加。
因此,科研人员的角色不会消失,工作重心会向两个方向移动:
一是提出更有价值的问题,二是建立更严格的验证体系。
这和传统科研训练有明显差别。过去年轻研究者可能花大量时间掌握某个实验流程或计算工具,未来这些基础能力仍然重要,但它们不再构成完整竞争力。研究者需要更早理解整个问题链路:从问题提出,到模型构建,再到实验验证和现实应用。
四、生成式UI和世界模型,代表两种不同的升级
访谈中提到的生成式 UI,解决的是交互层问题。
传统界面通常由产品团队预先设计好页面、按钮和流程。用户只能在固定结构中操作。生成式 UI 则尝试根据问题、用户特征和上下文,动态决定内容如何呈现。
同一个问题,可能被生成成:
- 一段文字解释;
- 一张可交互图表;
- 一段实时运行的代码;
- 一个动态仿真;
- 一套适合儿童理解的视觉演示。
这让界面从固定容器变成了动态解释器。
但 GenUI 也带来新的工程问题。界面可以动态生成,测试方式却不能完全动态化。企业必须回答:
- 生成的交互是否稳定;
- 关键流程是否可审计;
- 用户是否会被错误的视觉表达误导;
- 不同设备上是否保持一致体验;
- 如何控制模型调用成本和延迟。
对高风险系统来说,完全自由生成的界面并不一定更好。医疗、金融、政务等场景,通常需要保留一部分固定结构和强约束组件。
世界模型则更靠近系统建模层。
语言模型主要从已有数据中学习模式,世界模型希望进一步理解物理环境、因果关系和状态变化。例如洪水预测不仅要读懂文本,还要综合地形、降雨、河流、水位和历史事件等信息,推演不同变量组合下可能发生什么。
这两类技术的共同方向,是让 AI 更贴近真实世界。但它们的工程难度完全不同:
| 技术方向 | 主要目标 | 关键难点 |
|---|---|---|
| 生成式UI | 动态组织信息和交互 | 可控性、一致性、体验评估 |
| 世界模型 | 建模环境状态和变化 | 数据质量、因果推断、泛化能力 |
| 科研Agent | 加速假说和实验流程 | 结果验证、责任边界、可复现性 |
| 行星级AI | 连接地理、气候与人群数据 | 数据权限、隐私、治理和计算成本 |
技术从 Demo 走向生产,往往会在这些地方卡住。能生成,并不代表能稳定运行;能预测,也不代表能直接指导决策。
五、数据稀缺时,AI的价值在于寻找代理信号
Google Flood Hub 的案例更能说明工程创新的来源。
洪水预测通常依赖水位、降雨、地形和河流等数据。但在很多地区,传感器并不完善,历史数据也不连续。单纯依赖传统水文观测,很难覆盖全球所有区域。
Groundsource 的思路,是从过去多年的新闻报道中提取洪水事件,把自然语言里的时间、地点和灾情信息转化为结构化事件数据,再用于模型训练。
这是一种典型的代理信号方法:
当直接测量不可行时,从其他记录中寻找能够反映真实状态的信号。
类似的方法在搜索趋势、公共卫生和供应链分析中也很常见。技术价值不只在于模型架构,很多时候更取决于能不能找到一批足够可靠、此前没有被系统利用的数据。
但代理信号存在明显风险:
- 新闻报道具有地域和语言偏差;
- 严重事件更容易被报道;
- 同一事件可能被重复报道;
- 报道时间与实际发生时间可能不一致;
- 媒体描述中的地点和损失程度未必准确。
因此,生成式 AI 做数据抽取时,必须配合去重、来源评级、人工抽样和不确定性标注。否则,模型可能只是把媒体偏差规模化了。
这就是典型的工程权衡:覆盖范围扩大了,数据精度和可解释性却需要额外治理。真正可用的系统,不能只展示预测结果,还要说明结果基于什么数据、可信度有多高、在哪些区域可能失效。
六、企业真正要培养的是"系统架构师"
AI 时代,企业培养人的方式需要变化。
过去的成长路径往往是:
执行具体任务 → 掌握专业技能 → 理解业务流程 → 负责完整模块 → 参与战略决策
这条路径的问题在于,它依赖大量低成本、低风险的练习机会。AI 接管基础任务后,组织不能简单地把中间环节全部删掉,然后要求新人直接承担高风险决策。
更合理的方式,是把基础工作从"生产任务"改造成"训练任务"。
例如让新人使用 AI 完成方案,但必须提交:
- 问题定义;
- 数据来源;
- 约束条件;
- 多方案对比;
- 风险清单;
- 验证计划;
- 失败后的回滚方案。
这样,AI 负责降低执行成本,人负责训练判断过程。
工程团队可以建立一套类似的工作闭环:
需求理解
↓
问题拆解
↓
AI生成候选方案
↓
人工审查与取舍
↓
自动化测试
↓
小流量验证
↓
监控与复盘
这里最不能省的是审查、验证和复盘。没有这三步,AI 只是把"写代码"变快了,却没有让系统更可靠。
对个人而言,也需要从单一技能转向能力组合。未来更有价值的组合可能包括:
- 一个专业领域的深度;
- 基本的数据和编程能力;
- 使用 AI 工具完成复杂任务的能力;
- 对结果进行验证和解释的能力;
- 与不同角色协作的能力;
- 对成本、风险和业务目标的理解。
这并不意味着每个人都必须成为全栈工程师。全栈的核心也从来不是掌握所有技术,而是理解一项工作从目标到交付的完整链路。
七、初级员工不会消失,但初级任务会消失
"还要不要初级员工"这个问题,容易把岗位和任务混在一起。
初级员工仍然需要存在,因为组织总要培养新人,业务也需要大量执行工作。但基础任务的结构会发生改变:
- 能被标准化的任务,会被自动化;
- 需要上下文理解的任务,会由人机协作完成;
- 涉及责任和取舍的任务,仍然需要人承担;
- 能连接多个领域的任务,会变得更有价值。
真正减少的,可能是那些只要求机械执行、不要求理解上下文的岗位内容。
这对企业是效率机会,对个人则是能力压力。
过去,工作年限本身能带来一定信用。未来,单纯"做过很多年"越来越不够。更重要的是,你是否能解释为什么这么做,是否能识别方案风险,是否能在不确定条件下做出合理决策。
Google Research谈到的"科学奇迹循环",其实也适用于普通组织:
提出问题,借助工具快速试验,在真实反馈中修正,再提出更高阶的问题。
AI 加速了这个循环,但没有替人类决定什么值得循环。
技术会继续接管更多基础工作,模型也会继续把复杂能力封装成更简单的接口。接下来真正拉开差距的,不是谁会不会调用某个工具,而是谁能在工具给出大量答案之后,准确判断哪一个答案值得继续投入。
这也是 AI 时代最现实的职场变化:
新人不再需要花十几年等待工具升级,但必须更早学会承担判断。工具让人起点更高,也让错误更快暴露。至于能不能站稳,取决于一个人是否真正理解问题、约束和后果。