9/10 和 900/1000 都是 90%:机器人成功率计算器必须阻止的误判

9/10 和 900/1000 都是 90%:机器人成功率计算器必须阻止的误判

摘要:9/10 与 900/1000 的点估计都是 90%,但 95% Wilson 区间宽度约相差十倍。本文把分母、独立与配对设计、精度与功效、数值失败和 URL 分享边界写成一份 fail-closed 的成功率计算器合同。

关键词:机器人评测、成功率置信区间、Wilson interval、配对实验、浏览器本地计算

开篇:同一个 90%,证据宽度可以相差十倍

9/10 和 900/1000 都显示 90%。但按 95% Wilson 区间复算,前者约为 59.58%---98.21%,区间宽 38.63 个百分点;后者约为 87.98%---91.71%,宽 3.72 个百分点。只显示"90%",会把两个完全不同的证据状态压成同一句话。

这就是计算器最容易犯的第一类错误。第二类是把同任务、同初态的配对运行当成两组独立样本;第三类是把"估计一个成功率到多精确"和"检测两个策略差多少"混为一个样本量问题;第四类是数值求解失败后仍生成自然语言结论。

一个普通 binomial calculator 输入成功次数和总次数,输出两个端点。机器人评测工具还必须解释样本量是否足够、比较设计是否配对、任务是否异质、2 个百分点差异是否具有统计和工程意义,并在输入、设计或数值合同不成立时停止,而不是继续给出看似确定的结论。

这类工具适合 AscendLab 的浏览器本地计算定位,但本文只给出可实现、可测试的产品合同,不声称页面已经上线。

核心结论

  1. 首屏先保留 k/n,再显示点估计和区间;不能让 9/10 与 900/1000 只剩同一个 90%。MVP 默认 Wilson,并提供 Clopper--Pearson 对照。
  2. MVP 只计算单比例与双独立比例;检测到相同场景/种子时必须提示"配对分析在 V2",不得退化为独立比较。V2 再加入配对四格表与 McNemar。
  3. 结果页首先展示自然语言判断,再展示区间、差异和公式。
  4. 样本量警告要基于目标精度或最小关心差异,而不是固定阈值。
  5. 所有核心计算可在浏览器完成;URL hash 可做无服务器分享,服务端仅用于生成可撤销短链、跨设备持久化或云端批量报告。

这五条不是功能清单,而是一条输出契约:工具只有在输入有效、实验设计匹配、数值计算成功、结论没有越过证据边界时,才允许生成自然语言判断。

一、目标用户与核心任务

用户 任务 现有痛点
机器人研究者 给成功率加区间 论文表格只留百分比
评测工程师 规划 rollout 数 不清楚精度与功效差异
产品经理 解释 A/B 策略差异 把 90% 与 92% 直接排序
内容作者 生成可引用计算 手工公式易错、缺假设说明
学生 理解二项区间 只得到公式,不理解结论

用户第一任务不是"算 Beta 分位数",而是回答:当前数据足以支持什么判断?

二、MVP 输入

单策略模式

  • 成功次数 k
  • 总 rollout n
  • 置信水平:90%、95%、99%;
  • 方法:Wilson、Clopper--Pearson、Agresti--Coull(可后置);
  • 可选目标半宽,例如 2pp、5pp;
  • 可选基准成功率。

双策略模式(MVP:仅独立设计)

独立设计:

  • k_A, n_A, k_B, n_B
  • 差异方向 B-A
  • 置信水平;
  • 最小关心差异 MDE;
  • 检验类型和备择方向。

配对设计输入推迟到 V2:

  • A 成功/B 成功;
  • A 成功/B 失败;
  • A 失败/B 成功;
  • A 失败/B 失败。

MVP 必须询问两组是否来自相同任务/种子;用户回答"是"时停止独立比较,只展示配对数据需求和 V2 边界。后续批量模式可接受 CSV:task_id, seed, policy, success, score, horizon, tag...,但不应塞入首版。

三、结果信息架构

首屏结果建议:

text 复制代码
观测成功率:90.0%(63/70)
95% Wilson 区间:80.77%---95.07%
判断:样本仍不足以把真实成功率定位在 ±5 个百分点内。

下一层展示:

  • Clopper--Pearson 对照;
  • 区间宽度与上下不对称;
  • 达到目标精度的估计样本量;
  • 与基准的差异区间;
  • 方法说明;
  • 复制 Markdown/JSON;
  • 可访问性友好的文本解释。

双策略示例:

text 复制代码
A:90/100 = 90%
B:92/100 = 92%
差异 B-A:+2.0pp
95% 独立近似差异区间:-5.93pp---+9.93pp
判断:证据不足以确认 B 更强;结果也不证明两者等价。

四、算法合同

Wilson

使用双精度浮点即可。输入需验证整数和 0 ≤ k ≤ n。对极大 n 可保持数值稳定,不需要特殊函数。

Clopper--Pearson

需要 inverse regularized beta。浏览器有三种实现:

  1. 引入成熟统计库;
  2. 用 log-gamma 和数值求根实现 Beta CDF 反演;
  3. 在构建阶段验证自有实现,对照 SciPy/R。

首版不应手写未经验证的特殊函数。选择体积可控、许可证清晰的库,并用固定向量测试。

两策略比较

MVP 独立模式输出 Newcombe/Wilson 差异区间;若暂用未合并正态近似,必须在结果旁明确标注近似方法。判断同时使用两个基准:

  • 统计方向以差异区间是否跨 0 判断;跨 0 时不得宣称某策略更强。
  • 工程意义以预先输入的 MDE 判断;只有整个区间都高于 +MDE(或低于 -MDE)时,才支持达到对应方向的最小工程差异。区间虽排除 0 但仍与 ±MDE 重叠时,只能称"有统计方向,工程意义未确定"。

V2 配对模式再输出 paired Newcombe 区间、McNemar exact/mid-p 与 discordant pair 计数。不要把 p 值放在点估计和差异区间前面。

样本量

提供两个独立工具,并将算法、取整和失败语义写入合同:

  • 精度规划 :用户选择按预期比例 p_expected 规划,或按未知比例的最坏方差 p=0.5 规划。对每个整数 n,按已声明规则得到 k(默认 round(p_expected × n),并在结果中披露),计算指定区间,要求非对称两侧误差 max(p_hat-lower, upper-p_hat) ≤ targetHalfWidth;不能只用总宽度除以二。搜索返回满足条件的最小整数 n
  • 差异检测 :MVP 使用明确标注的"两独立比例、Cohen's h 正态功效近似",输入 p_Ap_B 或 MDE、双/单侧 α、power 和分配比 r=n_B/n_A。先求连续样本量,再分别向上取整为整数 n_An_B,重新计算近似功效并递增搜索,直到达到目标。
  • 两个工具都必须显示方法名、输入比例假设、k 的取整规则、置信度/α、power、分配比和搜索上限。结果同时输出每组总量,以及相对于用户已完成 rollout 的新增量;不得把两者混写。
  • 默认搜索上限应是显式产品常量,例如 MAX_PLANNED_N_PER_GROUP = 10_000_000。到达上限仍无解时返回结构化 search_limit_exceeded,提示用户调整精度、MDE 或上限,禁止返回最后一个 n 冒充答案。

UI 必须明确两者不是同一计算。

五、前端数据模型

ts 复制代码
export type SingleProportionInput = {
  successes: number;
  trials: number;
  confidence: 0.9 | 0.95 | 0.99;
  method: 'wilson' | 'clopper-pearson';
  targetHalfWidth?: number;
};

export type IntervalResult = {
  estimate: number;
  lower: number;
  upper: number;
  width: number;
  method: string;
  warnings: string[];
  assumptions: string[];
};

所有结果应可序列化到 URL hash,方便在浏览器端分享而无需后端;hash 不随普通 HTTP 请求发送给服务器,但仍会出现在用户复制的 URL、浏览器历史和接收者设备上,因此不得承诺"秘密存储"。短 hash 链接只是携带压缩参数的长 URL,不等于服务端短链。

真正的短链需要服务端保存 slug -> versioned payload 映射,并明确过期、删除、访问日志和隐私策略;跨设备持久化同理。不要把用户输入发到分析平台,即使只有整数,也应遵守工具站"浏览器本地处理"的一致承诺。

数值输入还必须分别满足 JavaScript Number.isSafeInteger(k)Number.isSafeInteger(n),且 n ≤ MAX_INPUT_N;建议首版显式限制 MAX_INPUT_N = 10_000_000,与性能测试和特殊函数误差预算保持一致。不要只依赖 HTML max,解析后需再次校验。任何 Beta 反函数不收敛、结果为 NaN/Infinity、边界越界、不满足 0 ≤ lower ≤ estimate ≤ upper ≤ 1 或功效搜索失败,都返回结构化数值错误并停止生成自然语言结论,禁止裁剪到 [0,1] 后伪装成功。

六、警告规则

硬编码"n<30 不可靠"过于粗糙。更有效的警告:

条件 文案
n < 20 样本很少,区间高度离散;不要据此排名
区间宽度 > 20pp 真实成功率仍有很大兼容范围
用户比较 2 个策略但未说明配对 相同任务/种子通常应使用配对数据
目标差异小于当前差异区间半宽 当前评测没有足够分辨率
聚合多个任务 episode 可能因任务聚类而非独立
100% 或 0% 成功 点估计不代表真实概率为 1 或 0
多模型多切片 未校正多重比较可能增加假阳性

七、验证测试

至少建立以下 golden cases:

输入 预期
0/10 下界 0;上界按方法计算
10/10 上界 1;下界非 1
63/70 CP 95% 0.804754---0.958840
63/70 Wilson 95% 0.8077---0.9507(允许舍入差)
90/100 CP 95% 0.8238---0.9510
92/100 CP 95% 0.8484---0.9648
非整数/负数/k>n 阻止计算并给字段错误
超过 safe integer 或 MAX_INPUT_N 阻止计算并说明产品上限
Beta 反演不收敛/NaN/Infinity 返回数值失败,不展示区间结论
精度搜索超过 MAX_PLANNED_N_PER_GROUP 返回 search_limit_exceeded
差异 CI 跨 0 不支持方向性胜出结论
差异 CI 排除 0 但跨 MDE 有统计方向,工程意义未确定

还要测试:预期比例与 p=0.5 最坏比例规划、k 取整边界、非对称区间两侧误差、每组总量/新增量、URL hash 还原、服务端短链不可用时的降级、百分比格式、键盘输入、屏幕阅读器、移动端长数字、复制 Markdown、不同语言小数点以及离线工作。

八、MVP 与后续版本

MVP

  • 单比例 Wilson/CP;
  • 双独立比例差异;
  • 相同场景/种子检测与"配对分析需 V2"阻断提示;
  • 自然语言解释;
  • 目标精度规划;
  • 独立两比例 Cohen's h 功效规划;
  • Markdown/JSON 导出;
  • URL hash 分享与全部本地计算。

V2

  • 配对四格表与 McNemar;
  • 配对比例差区间与配对功效规划;
  • 可选服务端短链与跨设备持久化;
  • CSV 批量任务;
  • 宏/微平均;
  • 分层 bootstrap;
  • 生成论文表格和可嵌入图表。

V3

  • 轨迹质量与部分得分;
  • Horizon 曲线;
  • Benchmark 报告模板;
  • 本地 WASM bootstrap;
  • 可复现实验 manifest。

风险与限制

计算器无法判断成功判定器是否正确、episode 是否独立、任务是否代表真实部署或是否存在训练数据污染。输出必须显示假设,而不是给"统计认证"。样本量建议是近似规划,尤其在层级、配对和自适应采样下需要更专门模型。

结论

最有价值的机器人成功率计算器不是公式包装,而是一道结论门:保留分母、显示区间、区分估计精度与差异功效、阻断错误的独立比较、暴露任务聚类假设,并在数值失败时拒绝生成判断。9/10 与 900/1000 不能只得到同一个 90%;同样,两组来自相同任务/种子的运行也不能因为输入方便就退化成独立比较。

这套合同可以纯浏览器实现,但"本地计算"不等于"输入不会留下任何痕迹"。URL fragment 不会作为 URL query 发送给服务器,复制链接、浏览器历史、接收方设备和页面内脚本仍可能接触其中的参数;因此分享、分析与短链必须分别说明边界。

参考资料

相关推荐
码农小旋风1 小时前
GPT-6 Astra 直接进 Blender,AI 开始从会说变成会做
人工智能·gpt·blender
weixin_618232301 小时前
OpenAI智能体“劫持”德国老网站当留言板
人工智能·安全
未来之窗软件服务1 小时前
城市街道社区综合管理开发之档案管理—东方仙盟
人工智能·仙盟创梦ide·档案系统
武哥聊编程1 小时前
【AI实战项目】基于SpringAI+Springboot+Vue的AI智能简历优化助手
vue.js·人工智能·spring boot
phoenix-bai1 小时前
表格神经网络架构发展史:从 MLP 到表格基础模型的二十年
人工智能·神经网络·架构
大虾别跑1 小时前
ai-daily-2026-09-07
人工智能
微三云 - 廖会灵 (私域系统开发)1 小时前
垂直行业 SaaS 实践|AI 美业小程序,构建美业服务全链路数字化闭环
人工智能·小程序
m0_614523551 小时前
工程工作流:一句需求做视频封面,先拆主题再做小图验收
人工智能·音视频
2501_933670791 小时前
内容电商运营岗位能力模型:SQL、Excel、投放数据与AI工具怎么准备
人工智能·sql·excel