【导语在第67届国际数学奥林匹克落幕中国队夺冠之际GitHub上一场AI横评引发关注Claude Fable 5、GPT - 5.6 Sol等四个AI模型在单挑IMO 2026全部6道题中拿下满分成绩远超人类选手展现出强大的数学能力。】AI奥数成绩断层式碾压人类前Google工程师Deedy Das进行的AI横评中Claude Fable 5、GPT - 5.6 Sol的xhigh版本、Kimi K3和AxiomProver四个AI模型全部在单挑IMO 2026的6道题中拿下满分42分。过去七年IMO4347名人类选手参赛只有30人拿过满分比例仅为0.69%AI成绩实现断层式碾压。不同模型在表现上也各有特点。Claude Fable 5耗时2.5小时花费51美元9轮对话6轮有效输出全程输出70万tokenGPT - 5.6 Sol用时3.8小时成本低至20美元总输出23万token最为节省Kimi K3历经17.4小时鏖战花费31美元2.8万亿参数的MoE模型输出154万token是Sol的6.5倍。数学直觉的多样解题路径以P1题为例这道题要求证明特定操作过程一定会终止最终恰好剩一个大于1的数M且M的值不依赖于操作顺序。Claude Fable 5直接生造了一个每步必定缩水的计数器Φ T N证明每执行一步操作Φ至少减少1从而得出过程在有限步内终止。GPT - 5.6 Sol则通过追踪乘积P和大于1的数的个数K这两个量证明(P, K)这个二元组在字典序下严格递减得出过程终止。而在证明M的值不依赖于操作顺序的(b)部分三个模型都证明了对每个素数p黑板上所有数被p整除次数的最大公约数在操作中不变。全场最廉价白卷与AI进化之路在全场最具挑战性的P6题上Claude Fable 5用时26分钟两轮获得满分GPT - 5.6 Sol用时60分钟两轮满分Kimi K3用时381分钟四轮满分。而Grok 4.5只挤出7053个token提交文件显示证明未完成仅花费0.18美元成为全场最廉价的白卷还存在工具调用层面不动手的agent能力问题。回顾AI在奥数领域的发展2024年DeepMind的AlphaProof首次在IMO级别摸到银牌门槛2025年OpenAI未公开模型和解5题拿下35分金牌Gemini Deep Think达到同等段位2026年三个通用大模型直接拿下满分且未经过专项数学训练部分模型开源实现三年三级跳。普通人生活或因AI逻辑推导能力重构能进行长链条逻辑推导的AI模型不仅能解数学题还可应用于合同条款核验、保险理赔条件判断、税务方案合规检查等领域。过去这些工作只有专业人士能做且按小时计费如今随着这种能力铺进消费级产品普通人遇棘手问题打开手机就能解决。编辑观点此次AI在奥数竞赛中的出色表现彰显其强大逻辑推导能力未来有望在多领域发挥作用重构普通人生活但也需关注其可能带来的就业结构变化等问题。
AI挑战国际奥数:Claude Fable 5等四模型满分,碾压人类选手!
【导语在第67届国际数学奥林匹克落幕中国队夺冠之际GitHub上一场AI横评引发关注Claude Fable 5、GPT - 5.6 Sol等四个AI模型在单挑IMO 2026全部6道题中拿下满分成绩远超人类选手展现出强大的数学能力。】AI奥数成绩断层式碾压人类前Google工程师Deedy Das进行的AI横评中Claude Fable 5、GPT - 5.6 Sol的xhigh版本、Kimi K3和AxiomProver四个AI模型全部在单挑IMO 2026的6道题中拿下满分42分。过去七年IMO4347名人类选手参赛只有30人拿过满分比例仅为0.69%AI成绩实现断层式碾压。不同模型在表现上也各有特点。Claude Fable 5耗时2.5小时花费51美元9轮对话6轮有效输出全程输出70万tokenGPT - 5.6 Sol用时3.8小时成本低至20美元总输出23万token最为节省Kimi K3历经17.4小时鏖战花费31美元2.8万亿参数的MoE模型输出154万token是Sol的6.5倍。数学直觉的多样解题路径以P1题为例这道题要求证明特定操作过程一定会终止最终恰好剩一个大于1的数M且M的值不依赖于操作顺序。Claude Fable 5直接生造了一个每步必定缩水的计数器Φ T N证明每执行一步操作Φ至少减少1从而得出过程在有限步内终止。GPT - 5.6 Sol则通过追踪乘积P和大于1的数的个数K这两个量证明(P, K)这个二元组在字典序下严格递减得出过程终止。而在证明M的值不依赖于操作顺序的(b)部分三个模型都证明了对每个素数p黑板上所有数被p整除次数的最大公约数在操作中不变。全场最廉价白卷与AI进化之路在全场最具挑战性的P6题上Claude Fable 5用时26分钟两轮获得满分GPT - 5.6 Sol用时60分钟两轮满分Kimi K3用时381分钟四轮满分。而Grok 4.5只挤出7053个token提交文件显示证明未完成仅花费0.18美元成为全场最廉价的白卷还存在工具调用层面不动手的agent能力问题。回顾AI在奥数领域的发展2024年DeepMind的AlphaProof首次在IMO级别摸到银牌门槛2025年OpenAI未公开模型和解5题拿下35分金牌Gemini Deep Think达到同等段位2026年三个通用大模型直接拿下满分且未经过专项数学训练部分模型开源实现三年三级跳。普通人生活或因AI逻辑推导能力重构能进行长链条逻辑推导的AI模型不仅能解数学题还可应用于合同条款核验、保险理赔条件判断、税务方案合规检查等领域。过去这些工作只有专业人士能做且按小时计费如今随着这种能力铺进消费级产品普通人遇棘手问题打开手机就能解决。编辑观点此次AI在奥数竞赛中的出色表现彰显其强大逻辑推导能力未来有望在多领域发挥作用重构普通人生活但也需关注其可能带来的就业结构变化等问题。