27届大模型面试准备(二十):评测体系全攻略——Benchmark、数据污染、LLM-as-Judge 与 Arena 对战上一篇《模型量化全攻略》结尾留了个问题:量化之后"到底掉了多少点",靠什么来回答?答案就是评测体系。这一篇是本系列第二十篇,也是把前面所有技术串起来的一篇——无论是 RAG、长上下文、后训练还是量化,最终都要面对同一个拷问:"你怎么证明它变好了?"评测看起来是最"没技术含量"的环节,实际上是大厂面试里区分度最高的题目之一,因为它直接暴露一个人有没有真正把模型送上过线。本文按"评测的三层结构 → 静态 Benchmark 与它的崩塌 → 数据污染 → LLM-as-Judge → Arena 与 Elo →