27届大模型面试准备(二十三):数据工程与合成数据——配方、去重、质量过滤与数据飞轮上一篇《推理时扩展与强化学习新范式》讲的是如何在推理阶段榨取更多能力,这一篇回到源头:模型能力的上限,其实早在数据准备阶段就被决定了。这是本系列第二十三篇。过去两年有个越来越明确的共识——在架构趋同、算力可买的今天,数据是唯一还没有被商品化的差异来源。Llama 3 相比 Llama 2 的主要提升来自 15T token 的数据规模与更严的过滤,而不是架构改动;DeepSeek、Qwen 的技术报告里,数据配方的篇幅普遍超过模型结构。可惜的是,绝大多数候选人对数据的理解停留在"清洗一下、去个重",一问"