
千笔-AIWritePaper · https://www.aiwritepaper.com
在线问卷里的 AI bot / agent 回应越来越难一眼识破,风险不只在「数据脏了」,而在设计、采集、报告、审稿 四段都可能把污染写成结论。CARMA(Consortium for the Advancement of Research Methods & Analysis)2026 夏季研讨会公开主题就是这件事:先讲 bot 如何成为问题、再看检测与规模研究,最后一场专门给作者与审稿人 出降低风险的建议。8 月 19 日场次标题为 Author/Reviewer Guidelines for Minimizing Risks of AI Bots/Agents,公开名单为 Louis Tay(Purdue)、Simone Zhang(NYU)、Gargi Sawhney(Auburn);配套页面写明覆盖研究设计、数据采集、报告与稿件评价。本文不写观后感扩写、不编造讲者原话或检出率,而把可操作验收落成闸门表 + 失败含义 + 当天最小实验。
视频:https://www.youtube.com/watch?v=OxRNwW2eh4I
公开场次页:https://carmattu.com/carma-2026-summer-symposium/

图:G1 设计闸 / G2 采集闸 / G3 报告闸 / G4 审稿闸;每级「AI 可做---人类必做---失败含义」;底部最小实验产物。
目标说明
读完应能独立完成五件事:
- 用一句话说清验收核:设计能防、采集能记、报告能披露、审稿能拦------而不是「用了某个 bot 检测器」。
- 对照选型/验收表,判断课题该先补设计闸,还是先补审稿清单。
- 写出每道闸的失败含义(缺哪份文件=未验收)。
- 当天跑最小实验:
carma-acceptance.csv+carma-mini-experiment.csv+carma-gate-log.csv,至少 1 条故意 fail。 - 对外披露时保留公开口径:bot/agent 污染是数据质量问题,作者与审稿人都有动作;不把研讨会写成某产品认证。
适用边界
适合
- 管理学/心理学/社会学等在线问卷研究,准备投稿或正在审稿。
- 已有问卷平台导出,但从未留下「可疑回应如何裁定」的日志。
- 需要把「我们做了注意力检查」升级成可审计闸门,而不是口头保证。
- 审稿人想要一份不依赖供应商分数的勾选清单。
不适合
- 把研讨会金句扩成「所有在线问卷都已作废」站队文。
- 无闸门日志却宣称「已按 CARMA 完成防 bot」。
- 编造未在公开材料出现的精确污染率、检测 AUC 或本院通过率。
- 用本文换取绕过伦理审查或伪造清洗记录:不提供、不鼓励。
- 把 bot 检测器分数当成人类终裁。
风险
公开页面强调的是问题存在、检测研究、作者/审稿建议 ,不是你家清洗插件的合格证。AI 生成的问卷回答可能在语言上更「合格」,注意力检查不一定挡得住。最小实验证明的是闸门可跑通,不是某批数据已清洁。视频逐字稿本次未能稳定拉取,下文只使用可核验的场次地图与工程转写,不冒充逐字讲义。
选型 / 验收表
| 闸门 | AI/平台可做 | 人类必做 | 产物 | 失败含义 |
|---|---|---|---|---|
| G1 设计 | 草稿题项、注意力检查候选 | 锁抽样框、激励结构、身份核验策略 | design-note.md | 只有题库无防污染设计 |
| G2 采集 | 平台风控标记、重复 IP/时序旗标 | 裁定 include/flag/exclude 并写理由 | screen-log.csv | 只有导出表无裁定列 |
| G3 报告 | 方法段润色 | 披露招募、清洗规则、剔除计数 | report-checklist.md | 「数据已清洗」无可复盘数字 |
| G4 审稿 | 帮审稿人列问题草稿 | 人类按清单追问并终裁 | review-gate.md + gate-log | 用检测插件分代替审稿意见 |
完整表见 _w/carma-acceptance.csv。
机制要点(工程转写)
公开三场地图可以压成四道闸:6 月 18 日讲「问题如何出现」,7 月 22 日讲「有多大、怎么检测」,8 月 19 日(本视频)讲「作者与审稿人分别做什么」。工程上不要复刻全部讲座,只要能证明:设计有防污染位、采集有行级裁定、报告有可复盘数字、审稿有人类终裁。
Gate 1 · 设计:先减诱因,再谈检测
作者侧最小动作:
- 写清抽样框与招募渠道(面板 / 社交媒体 / 课堂),各渠道的激励是否高到值得用 bot 刷。
- 身份与注意力策略写成枚举:开放链接 / 一次性令牌 / 机构邮箱 / 视频核验------选了什么、故意不选什么。
- 预注册或附录里预写「何种旗标触发人工复核」,禁止事后才发明规则。
失败含义:方法节只有「采用在线问卷」,没有任何防污染设计句。
Gate 2 · 采集:旗标可助,剔除终裁在人
采集日志最小字段:resp_id,channel,duration_s,flag_type,human_decision,reason,reviewer,timestamp。
决策枚举限制为:include / flag_for_review / exclude。禁止「模型说是 bot 就自动删」且不留理由。当天最小实验见 _w/carma-mini-experiment.csv(含一条故意 fail:只有平台分、无人类理由)。
失败含义:清洗前后 N 对不上,或剔除理由写「异常」却无旗标类型。
Gate 3 · 报告:数字可复盘,不是「已清洗」
报告清单至少勾这些:
- 招募起止与渠道拆分 N;
- 进入分析的 N、剔除 N、剔除规则版本号;
- 是否使用自动化检测、工具名/版本、人类抽检比例;
- 限制:检测漏报/误报都可能,结论如何降级。
失败含义:只有「删除了低质量回答」,给不出前后计数。
Gate 4 · 审稿:清单追问,插件分不是意见
审稿人当天可直接问:
- 抽样框与激励是否写清?
- 清洗规则是预写还是事后发明?
- 行级裁定是否可抽检?
- 自动化分数是否被当成终裁?
- 若去掉被剔除的样本,主结论是否仍成立?(作者必须回答,或标明未做敏感性分析)
审稿终裁枚举:accept_with_disclosure / major_revision_data / reject_irreproducible。禁止「检测器 99 分所以过」。
当天最小实验
- 复制验收表,口头讲解四行失败含义。
- 造 8--12 行模拟问卷日志(不要用真实未授权数据):含时长过短、重复文本、平台高风险分、正常对照。
- 人类裁定每行;至少 1 行故意只写分数不写理由 → 记 fail。
- 填
carma-gate-log.csv:哪道闸、谁裁定、时间(Asia/Shanghai)。 - 产出三件套:acceptance / mini-experiment / gate-log。
| 产物 | 作用 |
|---|---|
| acceptance CSV | 证明选型可讲解 |
| mini-experiment CSV | 证明采集裁定会咬人 |
| gate-log CSV | 证明人类终裁留下痕迹 |
可验证清单
- 视频 URL 已引用:
OxRNwW2eh4I。 - 四行闸门失败含义能口头复述。
- 最小实验 ≥8 行,含至少 1 个 fail/partial。
- gate-log 有人类决策枚举,无「自动全删」。
- 未编造污染率/检测 AUC/学院通过率。
- 未把研讨会写成产品认证。
踩坑
- 只加两道注意力检查就宣称已防 bot。
- 平台风险分直接当剔除令。
- 报告写「已清洗」却无前后 N。
- 审稿意见只引用检测器商标。
- 用真实可识别数据做演示:最小实验必须用模拟行。
作者侧当天可抄的设计注记
把下面四句放进 design-note.md 就能开 G1:
- 招募渠道与激励:________(高激励开放链接=高风险)。
- 身份策略:________(一次性令牌 / 机构邮箱 / 其他)。
- 预写复核触发:时长 < t、重复 n-gram、平台旗标、地理异常------选中的打勾。
- 人类抽检比例:至少 __% 的旗标行由第二人看。
审稿人侧当天可抄的否决句
- 「方法节未披露清洗前后 N,G3 失败,建议 major revision。」
- 「剔除仅依据未经验证的 bot 分数,且无敏感性分析,G4 不得过。」
- 「设计未写抽样框与激励,G1 失败;先补再谈结果。」
这些句子不依赖任何商标,审稿意见才像方法学判断。
与「学术声音 / 综述闸门」的差别
术语锁管的是改稿时词还在不在;综述三列表管的是主张指不指回 DOI;本篇管的是人机数据污染有没有被设计、记录、披露、审出来。表格不能混用。问卷研究若同时写综述,两套闸门都要交,不要用 claim-map 冒充 bot 清洗日志。
失败样本怎么造
故意留一行:flag_type=vendor_score, human_decision=exclude, reason=(空)。协议应把它标成 fail,因为它证明「分数代替理由」。如果你们的表允许空理由仍 pass,先修表,不要先修作文。
对外沟通模板
「我们按公开的作者/审稿风险清单做了四道闸;当前权限停在人工裁定。研讨会材料用于阶段地图,不代表本批数据已无污染,也不代表某检测器被认证。」这段话可直接放进组会纪要。
权限与伦理
最小实验只用模拟 ID。若要处理真实回答,另走伦理与数据管理,不在当天枚举里开放 export_raw。发现疑似自动化刷题且涉及人身攻击或违法内容,停止会话并按机构流程上报------本文协议不覆盖取证对抗。
当天交付物清单
_w/carma-acceptance.csv_w/carma-mini-experiment.csv_w/carma-gate-log.csv- 组会纪要中的对外沟通模板一句
审稿意见怎么写才像闸门而不是立场
避免「怀疑作者用了 AI 填问卷」这种无法勾选的句子。改成指向产物:
- G1:请补充抽样框、激励与身份策略;缺一则方法不可复盘。
- G2:请提供清洗前后 N 与至少 10 行去标识裁定表示例(或说明伦理限制)。
- G3:请写明自动化工具名/版本与人类抽检比例;未抽检则降为 major revision。
- G4:请报告剔除样本后的敏感性分析;未做则结论必须降级。
作者回修时,应把审稿人的问题编号写进 gate-log.notes,形成可对账物证:问题编号必须能在日志里找到。若伦理不允许分享行级数据,必须写替代抽检方案(例如独立统计员出具计数),不能空着。
设计阶段的激励红线(作者自检)
高额开放链接 + 可转发的问卷 URL,是 bot 的高诱因组合。自检三问:
- 完成问卷的金钱/积分是否明显高于同类研究?
- 链接是否可被公开转帖而无一次性令牌?
- 是否允许同一设备无限次提交?
三个「是」同时出现,G1 默认 fail,除非你另有强身份核验。这不是道德指控,是激励结构验收。
最小实验时间盒
90 分钟足够:20 分钟讲四闸失败含义,30 分钟造 10 行模拟日志并裁定,20 分钟写报告清单草稿,20 分钟整理 CSV。超时通常是因为一上来就想清洗真实数据------请把范围裁回模拟行。
总结
防 AI bot 审稿靠的是设计---采集---报告---审稿四道闸 + 失败含义 + 人类终裁日志,不是更灵敏的检测商标。先跑通三份 CSV 最小实验,再决定稿件能否进审。去掉任何产品名,读者手里仍应剩下可审计闸门产物。