9/10 和 900/1000 都是 90%:机器人成功率计算器必须阻止的误判

摘要:9/10 与 900/1000 的点估计都是 90%,但 95% Wilson 区间宽度约相差十倍。本文把分母、独立与配对设计、精度与功效、数值失败和 URL 分享边界写成一份 fail-closed 的成功率计算器合同。
关键词:机器人评测、成功率置信区间、Wilson interval、配对实验、浏览器本地计算
开篇:同一个 90%,证据宽度可以相差十倍

9/10 和 900/1000 都显示 90%。但按 95% Wilson 区间复算,前者约为 59.58%---98.21%,区间宽 38.63 个百分点;后者约为 87.98%---91.71%,宽 3.72 个百分点。只显示"90%",会把两个完全不同的证据状态压成同一句话。
这就是计算器最容易犯的第一类错误。第二类是把同任务、同初态的配对运行当成两组独立样本;第三类是把"估计一个成功率到多精确"和"检测两个策略差多少"混为一个样本量问题;第四类是数值求解失败后仍生成自然语言结论。
一个普通 binomial calculator 输入成功次数和总次数,输出两个端点。机器人评测工具还必须解释样本量是否足够、比较设计是否配对、任务是否异质、2 个百分点差异是否具有统计和工程意义,并在输入、设计或数值合同不成立时停止,而不是继续给出看似确定的结论。
这类工具适合 AscendLab 的浏览器本地计算定位,但本文只给出可实现、可测试的产品合同,不声称页面已经上线。
核心结论

- 首屏先保留
k/n,再显示点估计和区间;不能让 9/10 与 900/1000 只剩同一个 90%。MVP 默认 Wilson,并提供 Clopper--Pearson 对照。 - MVP 只计算单比例与双独立比例;检测到相同场景/种子时必须提示"配对分析在 V2",不得退化为独立比较。V2 再加入配对四格表与 McNemar。
- 结果页首先展示自然语言判断,再展示区间、差异和公式。
- 样本量警告要基于目标精度或最小关心差异,而不是固定阈值。
- 所有核心计算可在浏览器完成;URL hash 可做无服务器分享,服务端仅用于生成可撤销短链、跨设备持久化或云端批量报告。
这五条不是功能清单,而是一条输出契约:工具只有在输入有效、实验设计匹配、数值计算成功、结论没有越过证据边界时,才允许生成自然语言判断。
一、目标用户与核心任务
| 用户 | 任务 | 现有痛点 |
|---|---|---|
| 机器人研究者 | 给成功率加区间 | 论文表格只留百分比 |
| 评测工程师 | 规划 rollout 数 | 不清楚精度与功效差异 |
| 产品经理 | 解释 A/B 策略差异 | 把 90% 与 92% 直接排序 |
| 内容作者 | 生成可引用计算 | 手工公式易错、缺假设说明 |
| 学生 | 理解二项区间 | 只得到公式,不理解结论 |
用户第一任务不是"算 Beta 分位数",而是回答:当前数据足以支持什么判断?
二、MVP 输入

单策略模式
- 成功次数
k; - 总 rollout
n; - 置信水平:90%、95%、99%;
- 方法:Wilson、Clopper--Pearson、Agresti--Coull(可后置);
- 可选目标半宽,例如 2pp、5pp;
- 可选基准成功率。
双策略模式(MVP:仅独立设计)
独立设计:
k_A, n_A, k_B, n_B;- 差异方向
B-A; - 置信水平;
- 最小关心差异 MDE;
- 检验类型和备择方向。

配对设计输入推迟到 V2:
- A 成功/B 成功;
- A 成功/B 失败;
- A 失败/B 成功;
- A 失败/B 失败。
MVP 必须询问两组是否来自相同任务/种子;用户回答"是"时停止独立比较,只展示配对数据需求和 V2 边界。后续批量模式可接受 CSV:task_id, seed, policy, success, score, horizon, tag...,但不应塞入首版。
三、结果信息架构
首屏结果建议:
text
观测成功率:90.0%(63/70)
95% Wilson 区间:80.77%---95.07%
判断:样本仍不足以把真实成功率定位在 ±5 个百分点内。
下一层展示:
- Clopper--Pearson 对照;
- 区间宽度与上下不对称;
- 达到目标精度的估计样本量;
- 与基准的差异区间;
- 方法说明;
- 复制 Markdown/JSON;
- 可访问性友好的文本解释。
双策略示例:
text
A:90/100 = 90%
B:92/100 = 92%
差异 B-A:+2.0pp
95% 独立近似差异区间:-5.93pp---+9.93pp
判断:证据不足以确认 B 更强;结果也不证明两者等价。
四、算法合同
Wilson
使用双精度浮点即可。输入需验证整数和 0 ≤ k ≤ n。对极大 n 可保持数值稳定,不需要特殊函数。
Clopper--Pearson
需要 inverse regularized beta。浏览器有三种实现:
- 引入成熟统计库;
- 用 log-gamma 和数值求根实现 Beta CDF 反演;
- 在构建阶段验证自有实现,对照 SciPy/R。
首版不应手写未经验证的特殊函数。选择体积可控、许可证清晰的库,并用固定向量测试。
两策略比较
MVP 独立模式输出 Newcombe/Wilson 差异区间;若暂用未合并正态近似,必须在结果旁明确标注近似方法。判断同时使用两个基准:
- 统计方向以差异区间是否跨
0判断;跨 0 时不得宣称某策略更强。 - 工程意义以预先输入的 MDE 判断;只有整个区间都高于
+MDE(或低于-MDE)时,才支持达到对应方向的最小工程差异。区间虽排除 0 但仍与±MDE重叠时,只能称"有统计方向,工程意义未确定"。
V2 配对模式再输出 paired Newcombe 区间、McNemar exact/mid-p 与 discordant pair 计数。不要把 p 值放在点估计和差异区间前面。
样本量
提供两个独立工具,并将算法、取整和失败语义写入合同:
- 精度规划 :用户选择按预期比例
p_expected规划,或按未知比例的最坏方差p=0.5规划。对每个整数n,按已声明规则得到k(默认round(p_expected × n),并在结果中披露),计算指定区间,要求非对称两侧误差max(p_hat-lower, upper-p_hat) ≤ targetHalfWidth;不能只用总宽度除以二。搜索返回满足条件的最小整数n。 - 差异检测 :MVP 使用明确标注的"两独立比例、Cohen's h 正态功效近似",输入
p_A、p_B或 MDE、双/单侧α、power 和分配比r=n_B/n_A。先求连续样本量,再分别向上取整为整数n_A、n_B,重新计算近似功效并递增搜索,直到达到目标。 - 两个工具都必须显示方法名、输入比例假设、
k的取整规则、置信度/α、power、分配比和搜索上限。结果同时输出每组总量,以及相对于用户已完成 rollout 的新增量;不得把两者混写。 - 默认搜索上限应是显式产品常量,例如
MAX_PLANNED_N_PER_GROUP = 10_000_000。到达上限仍无解时返回结构化search_limit_exceeded,提示用户调整精度、MDE 或上限,禁止返回最后一个n冒充答案。
UI 必须明确两者不是同一计算。
五、前端数据模型

ts
export type SingleProportionInput = {
successes: number;
trials: number;
confidence: 0.9 | 0.95 | 0.99;
method: 'wilson' | 'clopper-pearson';
targetHalfWidth?: number;
};
export type IntervalResult = {
estimate: number;
lower: number;
upper: number;
width: number;
method: string;
warnings: string[];
assumptions: string[];
};
所有结果应可序列化到 URL hash,方便在浏览器端分享而无需后端;hash 不随普通 HTTP 请求发送给服务器,但仍会出现在用户复制的 URL、浏览器历史和接收者设备上,因此不得承诺"秘密存储"。短 hash 链接只是携带压缩参数的长 URL,不等于服务端短链。
真正的短链需要服务端保存 slug -> versioned payload 映射,并明确过期、删除、访问日志和隐私策略;跨设备持久化同理。不要把用户输入发到分析平台,即使只有整数,也应遵守工具站"浏览器本地处理"的一致承诺。
数值输入还必须分别满足 JavaScript Number.isSafeInteger(k) 与 Number.isSafeInteger(n),且 n ≤ MAX_INPUT_N;建议首版显式限制 MAX_INPUT_N = 10_000_000,与性能测试和特殊函数误差预算保持一致。不要只依赖 HTML max,解析后需再次校验。任何 Beta 反函数不收敛、结果为 NaN/Infinity、边界越界、不满足 0 ≤ lower ≤ estimate ≤ upper ≤ 1 或功效搜索失败,都返回结构化数值错误并停止生成自然语言结论,禁止裁剪到 [0,1] 后伪装成功。
六、警告规则

硬编码"n<30 不可靠"过于粗糙。更有效的警告:
| 条件 | 文案 |
|---|---|
n < 20 |
样本很少,区间高度离散;不要据此排名 |
| 区间宽度 > 20pp | 真实成功率仍有很大兼容范围 |
| 用户比较 2 个策略但未说明配对 | 相同任务/种子通常应使用配对数据 |
| 目标差异小于当前差异区间半宽 | 当前评测没有足够分辨率 |
| 聚合多个任务 | episode 可能因任务聚类而非独立 |
| 100% 或 0% 成功 | 点估计不代表真实概率为 1 或 0 |
| 多模型多切片 | 未校正多重比较可能增加假阳性 |
七、验证测试

至少建立以下 golden cases:
| 输入 | 预期 |
|---|---|
| 0/10 | 下界 0;上界按方法计算 |
| 10/10 | 上界 1;下界非 1 |
| 63/70 CP 95% | 0.804754---0.958840 |
| 63/70 Wilson 95% | 0.8077---0.9507(允许舍入差) |
| 90/100 CP 95% | 0.8238---0.9510 |
| 92/100 CP 95% | 0.8484---0.9648 |
| 非整数/负数/k>n | 阻止计算并给字段错误 |
超过 safe integer 或 MAX_INPUT_N |
阻止计算并说明产品上限 |
| Beta 反演不收敛/NaN/Infinity | 返回数值失败,不展示区间结论 |
精度搜索超过 MAX_PLANNED_N_PER_GROUP |
返回 search_limit_exceeded |
| 差异 CI 跨 0 | 不支持方向性胜出结论 |
| 差异 CI 排除 0 但跨 MDE | 有统计方向,工程意义未确定 |
还要测试:预期比例与 p=0.5 最坏比例规划、k 取整边界、非对称区间两侧误差、每组总量/新增量、URL hash 还原、服务端短链不可用时的降级、百分比格式、键盘输入、屏幕阅读器、移动端长数字、复制 Markdown、不同语言小数点以及离线工作。
八、MVP 与后续版本
MVP
- 单比例 Wilson/CP;
- 双独立比例差异;
- 相同场景/种子检测与"配对分析需 V2"阻断提示;
- 自然语言解释;
- 目标精度规划;
- 独立两比例 Cohen's h 功效规划;
- Markdown/JSON 导出;
- URL hash 分享与全部本地计算。
V2
- 配对四格表与 McNemar;
- 配对比例差区间与配对功效规划;
- 可选服务端短链与跨设备持久化;
- CSV 批量任务;
- 宏/微平均;
- 分层 bootstrap;
- 生成论文表格和可嵌入图表。
V3
- 轨迹质量与部分得分;
- Horizon 曲线;
- Benchmark 报告模板;
- 本地 WASM bootstrap;
- 可复现实验 manifest。
风险与限制
计算器无法判断成功判定器是否正确、episode 是否独立、任务是否代表真实部署或是否存在训练数据污染。输出必须显示假设,而不是给"统计认证"。样本量建议是近似规划,尤其在层级、配对和自适应采样下需要更专门模型。
结论

最有价值的机器人成功率计算器不是公式包装,而是一道结论门:保留分母、显示区间、区分估计精度与差异功效、阻断错误的独立比较、暴露任务聚类假设,并在数值失败时拒绝生成判断。9/10 与 900/1000 不能只得到同一个 90%;同样,两组来自相同任务/种子的运行也不能因为输入方便就退化成独立比较。
这套合同可以纯浏览器实现,但"本地计算"不等于"输入不会留下任何痕迹"。URL fragment 不会作为 URL query 发送给服务器,复制链接、浏览器历史、接收方设备和页面内脚本仍可能接触其中的参数;因此分享、分析与短链必须分别说明边界。
参考资料
- Interval Estimation for a Binomial Proportion,Brown、Cai、DasGupta,Statistical Science,2001;比较覆盖率与区间长度,并指出常见 Wald 区间的持续性问题。
- Two-sided Confidence Intervals for the Single Proportion,Newcombe,Statistics in Medicine,1998。
- Interval Estimation for the Difference Between Independent Proportions,Newcombe,Statistics in Medicine,1998。
- Improved Confidence Intervals for the Difference Between Binomial Proportions Based on Paired Data,Newcombe,Statistics in Medicine,1998。
- The Use of Confidence or Fiducial Limits Illustrated in the Case of the Binomial,Clopper、Pearson,Biometrika,1934。
- Probable Inference, the Law of Succession, and Statistical Inference,Wilson,JASA,1927。
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies,arXiv 当前版本;NVIDIA Research 项目页,访问日期:2026-09-03。
- WHATWG URL Standard,URL fragment 定义与处理边界,访问日期:2026-09-03。