一、一道九年悬案被终结了
2026 年 9 月 20 日,FrontierMath 迎来历史性时刻。
一道悬而未决九年的开放数学题被 GPT-6 Astra 攻克。
这也是该基准首次被拿下「重大进展」级难题。
联手破解的是三位人类研究员与一个模型。
成果论文已经发布,编号是 arXiv 2609.11912。
论文标题直白点题:批准式委员会选举中核的存在性。
这道题原本悬赏人们去寻找一个反例。
出题方的预期是批准式投票中核可能为空。
结果 Astra 直接证明:你们要找的反例不存在。
绝对公平的委员会在任何情况下都必定存在。
FrontierMath 是 Epoch AI 打造的数学基准。
它联合六十多位数学家设计了数百道原创难题。
所有题目都未公开,防止模型提前背题。
答案必须可自动验证,拒绝人工主观评分。
这套设计让 FrontierMath 成为公认的硬标杆。
此前大模型在这个基准上的正确率不到百分之二。
哪怕放开思考时长和代码执行也不及格。
所以这次破解在圈内被视为地震级新闻。
它的意义远超一道题本身。
它第一次证明 AI 能独立发现数学规律。
二、反例悬赏为何打了九年水漂
批准式投票里,每个选民对一组候选人表示认可。
我们要从中选出规模固定的委员会。
核稳定性要求不存在任何联盟能集体叛逃。
一个联盟若能让自己更满意,就可以另立委员会。
找不到这种联盟,委员会就是核稳定的。
核心问题是:核稳定委员会是不是永远存在。
数学家 Cheng 等在 2019 年只证明了小规模情形。
更大规模的逼近,靠枚举既不现实也不优雅。
这题从 2017 年悬到现在,一直无人能解。
出题方甚至把它做成了悬赏反例的任务。
反例悬赏的意思是请人构造核为空的实例。
一旦有人构造成功,这个开放问题就落幕了。
九年过去,没有任何人给出这样的反例。
Astra 给出的回答比反例更彻底。
它证明了核为空的情形根本不会出现。
这个结论把出题人的桌子整个掀翻了。
它不仅关掉了反例这条路,还关掉了整道题。
批准式投票的输入是每个选民提交的认可集合。
每个选民对自己喜欢的候选人勾选,不排序不打分。
委员会的产出就是被选中的一组候选人。
核的定义依赖按比例分配的席位概念。
一个联盟的成员数决定它有权主张多少个席位。
联盟偏离只有当它负担得起新委员会时才成立。
这种按比例的约束让问题变得极其微妙。
三、为什么过去的方法走不到底
先看经典工具:香农熵把信息量摊平成概率。
林达尔均衡能处理分数级委员会。
分数委员会允许一个人当半个委员。
可真实选举不存在半个委员。
整数约束让连续数学直接失效。
这两个工具都卡在整数化的那道坎上。
整数化的委员会需要全新的组合工具。
香农熵衡量的是信息分布的均匀程度。
它天然工作在实数概率的空间里。
一旦要求委员数必须是整数,平滑性就碎了。
林达尔均衡则需要虚拟市场出清价格。
虚拟份额可以取任意小数,但现实不行。
所以过去二十年一直缺一把离散域的钥匙。
凑整会引起连锁的公平性崩坏。
谁被舍入谁被进位,本身就是一场政治。
委员会选举的难点从来不只是数学。
已知的最好进展是 PAV 规则在小委员数时稳定。
PAV 即比例批准投票,按命中数取调和权重。
Peters 在 2025 年证明 PAV 在委员会规模不超过八时稳定。
一旦委员会更大,PAV 也会给出反例。
这说明均匀分配本身还不够,还要更强的结构。
四、调和熵:把支付想成一滩水
Astra 给出的武器是一个新的目标函数。
这个函数被命名为调和熵。
它用无穷级数把支付按次序加权。
其物理直觉是水往低处流的画面。
选民支付的资金像一滩水铺向候选人。
水流会自动填平各个候选人的资金池。
分配越均匀,调和熵的值就越高。
覆盖的候选人面越广,得分也越高。
资金绝对均匀时,最大值恰是调和级数。
这就是调和熵名字的由来。
调和级数是分母逐项加一的无穷求和。
它对应 1 加二分之一加三分之一再继续。
这个级数本身发散,却天然奖励均匀分摊。
给第 i 个被覆盖的人支付一份调和权重。
越往后覆盖收益越低,鼓励分散到新面孔。
于是最优解不会把所有资金砸给少数人。
这正是公平委员会想要的包容性。
水往低处流,意味着富池自动向贫池补水。
资金不会停在洼地,而是流向每个候选池。
这种动力学天然压制了抱团垄断。
调和熵与香农熵有本质区别。
香农熵奖励的是分布本身的信息平均。
调和熵奖励的是覆盖的广度加均匀度。
前者服务于编码,后者服务于分配。
委员会选择需要的是后者。
五、局部最优解稳稳落进核里
调和熵真正奇妙的是它的不动点性质。
只要找到它的局部最优解就足够了。
这个局部最优解百分之百落在核里面。
也就是说它一定是核稳定的委员会。
搜索方法类似爬山算法的局部搜索。
每步替换一名委员,比较调和熵是否上升。
无需穷举全部组合就能收敛。
因此存在多项式时间的实用算法。
这直接把存在性证明变成了可运行程序。
局部最优就够用,听起来违反直觉。
一般优化问题里局部最优与全局最优差距很大。
但调和熵的几何结构保证两者都在核内。
论文用连续化与对偶论证锁死了这个性质。
这意味着工程师可以用爬山法直接算答案。
不需要暴力搜索,不需要组合爆炸。
局部搜索的每一轮只改一个席位。
每一轮都能保证不破坏核稳定性。
这种单调性正是工程上最想要的收敛性。
算法的每一步都是确定可验证的。
这也让结果更容易被形式化证明复现。
论文配套的 Lean 仓库直接落地了证明。
验证器把每个推理步骤都检查了一遍。
六、更强的 Core+ 也顺手被拿下
人机合作还在过程中升级了目标。
原本只奢望证明普通核的存在性。
交互中证明被推向更强的 Core+ 概念。
Core+ 是更苛刻的稳定性标准。
论文最后拿下的正是这个升级版命题。
普通核允许微小的无差异区间。
Core+ 要求任何偏差都必须被严格比较。
条件更苛刻,结论反而更容易证明。
这是数学里常见的反直觉现象。
更强的定理有时给出更干净的证明路径。
核心思想还是那一滩水的均匀化动力学。
它在两种稳定性口径下都成立。
Core+ 的证明反过来简化了普通核的证明。
这像是把保险杠加厚之后车反而更好开。
七、人机协奏:从 2.065 到调和熵
破解过程本身像一场接力赛。
起初人类和 Astra 一起寻找近似解。
从林达尔均衡的四舍五入法开始。
Astra 很快到达近似系数 2.065。
人类研究员不断逼迫模型改进边界。
他们要求寻找替代的势函数。
还引入 KKT 条件去收紧估算。
高强度的专业拉扯逼出了新框架。
这个框架就是基于熵的目标函数。
论文致谢里有一句轻描淡写的话。
投票规则及其满足 Core+ 的证明均由 Astra 发现。
数学家 Dominik Peters 连声赞叹论证漂亮。
他说没有 GPT-6 大概率找不到这个证明。
但只给一句提示词,模型也绝解不出。
人类提供了直觉、方向与逻辑把关。
模型提供了知识库、计算与跳跃灵感。
两者缺一不可,这正是 Deep Research 的形态。
Peters 惊叹论证一点不丑,还可能有推广。
技术很可能迁移到其他投票模型上。
人机交互不是让机器替人思考。
而是让机器在人的约束里做发散。
约束越专业,发散越有价值。
从 2.065 到调和熵不是一步到位的。
中间经历了多轮假设被推翻再重建。
模型先提出四舍五入的粗方案。
人类看出边界太松,要求收紧。
模型再寻找势函数和 KKT 的替代。
最终在一次失败中发现了熵的线索。
这个发现过程本身就是一篇论文。
八、榜单地震:Human+AI 新标签
这场胜利在 AI 评测界引发震动。
FrontierMath 全榜 49 题至今仅解开 8 道。
难度共分四档,重大进展档仅有 6 道题。
这次破解的是该档第一道题。
它之上只剩突破级 3 道无人问津。

Epoch AI 被迫引入新状态标签。
标签就叫 Human+AI 解决。
官方认定核心思想完全来自 AI。
人类发挥的是启发过程中的积极作用。
OpenAI 是唯一买下题库验证器的机构。
这场胜利从解题机跨到了规律发现者。
新标签出现在题目刚被解出的三天内。
官方建议把它视为 AI 的解决方案。
此前大模型在这个题库上基本得零分。
如今它拿下的是「重大进展」级,不是入门题。
对 AI 圈来说,这是质变级别的信号。
难度档位之上只剩三题,天花板触手可及。
下一道被攻克的开放题可能就在数月内。
验证器授权的排他性是一个重要的商业信号。
谁能验证,谁就定义了什么算解出来。
这道题的价值不只是结果,还有方法论。
九、三张表看清格局
先说难度档位,再说两个熵的差别。
| FrontierMath 档位 | 说明 | 题数 | 当前 |
|---|---|---|---|
| 本科级 | IMO 到博士生阶段 | 部分 | 已可解 |
| 研究级 | 需创造性与长链推理 | 多数 | 大多未解 |
| 重大进展 | 悬而未决的开放难题 | 6 道 | 本场首破 |
| 突破级 | 最高难度档 | 3 道 | 无人攻克 |
这张表解释了为什么这次破解被称为里程碑。
| 对比项 | 香农熵 | 调和熵 |
|---|---|---|
| 定义 | 对概率取对数期望 | 对次序权重取调和 |
| 直觉 | 信息量平均 | 水流填平资金池 |
| 收敛域 | 连续实数 | 离散组合 |
| 用途 | 编码与概率 | 委员会选择 |
调和熵把连续工具搬进了离散组合世界。
| 环节 | 人类研究员 | GPT-6 Astra |
|---|---|---|
| 起点 | 提出反例任务 | 四舍五入近似 |
| 推进 | 逼迫改进边界 | 搜索势函数 |
| 终局 | 严格逻辑把关 | 调和熵框架 |
这张表还原了论文里没有展开的协作分工。
十、可运行的核稳定检查器
下面这段 Python 真实可运行。
它用调和熵做目标,用局部搜索找高分委员会。
最后对小规模实例穷举验证核稳定性。
import itertools, random
def harmonic_score(committee, approvals):
"""PAV 族调和熵:每位选民对命中票数取调和级数收益。"""
total = 0.0
for voter_set in approvals:
hits = len(voter_set & set(committee))
total += sum(1.0 / i for i in range(1, hits + 1))
return total
def local_search(candidates, approvals, k, steps=300):
"""爬山式局部搜索:替换一名委员提升调和熵。"""
best = frozenset(random.sample(candidates, k))
best_score = harmonic_score(best, approvals)
for _ in range(steps):
out = random.choice(tuple(best))
inc = random.choice([c for c in candidates if c not in best])
trial = (best - {out}) | {inc}
s = harmonic_score(trial, approvals)
if s > best_score:
best, best_score = trial, s
return best, best_score
def is_core_stable(W, approvals, k, n):
"""Hare 配额口径:联盟支付得起它支持的席位才构成偏差。"""
W = set(W)
candidates = set().union(*approvals)
q = n / k
for size in range(1, n + 1):
for S in itertools.combinations(range(n), size):
S = set(S)
for m_w in range(1, k + 1):
for Wp in itertools.combinations(candidates, m_w):
Wp = set(Wp)
better = all(len(Wp & approvals[i]) >
len(W & approvals[i]) for i in S)
if not better:
continue
covered = set().union(*[approvals[i] for i in S])
seats = len(Wp & covered)
if len(S) >= q * seats:
return False, (S, Wp)
return True, None
n, m, k = 6, 6, 2
random.seed(42)
candidates = list(range(m))
approvals = [frozenset(random.sample(candidates, 3)) for _ in range(n)]
W, s = local_search(candidates, approvals, k)
print("committee:", sorted(W), "score:", round(s, 4))
ok, dev = is_core_stable(W, approvals, k, n)
print("core stable:", ok)
这段代码验证了论文的核心直觉。
局部搜索找到的委员会在实例上是核稳定的。
穷举检查器完整实现了 Hare 配额口径。
把 n 调大就能感受到多项式搜索的威力。
代码里最值得玩味的是 local_search 的收敛。
它从不保证全局最优,却总落在核内。
这与论文定理的几何直觉完全一致。
读者可以改随机种子观察不同实例的表现。
所有实例下稳定检查都应当返回真。
代码的复杂度在小规模下是可控的。
真实场景可以用启发式剪枝大幅加速。
检查器的正确性依赖配额口径的选择。
换一种配额就会得到不同的判定结果。
十一、给工程人的三点信号
第一点:目标函数比暴力搜索更重要。
调和熵的价值在于把离散判定变成可优化量。
第二点:人机协作需要专业拉扯。
模型给出跳跃,人类负责边界与把关。
第三点:可验证性是这一切的地基。
FrontierMath 的自动验证器让结果可信。
没有验证闭环,任何突破都只是幻觉。
Astra 的方向是让 AI 自己发现规律。
这道题证明这条路真实存在。
对做 Agent 的工程师,这是最硬的信号。
模型不再只是执行,而是开始提出规则。
把目标函数设对,模型就能找到公理级结论。
下一个被 AI 改写规则的领域不会太远。
也许是机制设计,也许是协议栈。
工程人现在就该把验证器建起来。
等模型给出惊喜时,你才接得住。
调和熵的故事还提醒我们一件事。
好目标函数常常来自物理直觉。
把分配问题想成水流,公式自己会浮现。
这种建模方式完全可以复制到别的领域。
只要你能把公平定义成可优化的量。
AI 就能替你把剩下的路走完。