GPT-5.6 Sol Ultra
不到1小时攻克50年图论猜想

循环双覆盖猜想 · 64子智能体 Ultra · 700字 Prompt · F₃² 证明路线 · RSI +16.2 · 数学界质疑 · Lean 验证

GPT-5.6 Sol Ultra Cycle Double Cover Conjecture AI math proof 2026
2026 年 7 月 10 日,OpenAI 宣布 GPT-5.6 Sol Ultra 调用 64 个并行子智能体,在不到 1 小时内生成了图论领域悬而未决逾 50 年的循环双覆盖猜想(CDC)完整候选证明;同日还披露 Sol 已能自主完成后训练更小模型 Luna,RSI 基准较 GPT-5.5 提升 16.2 分。本文面向开发者与研究者,给出:① CDC 定义、难度与已有部分结果;② GPT-5.6 三档与 Ultra/max 模式;③ 700 字 Prompt 四原则与 F₃² 证明路线;④ 六步跟踪验证 Runbook;⑤ RSI、数学界五重质疑与 AI 数学研究三阶段;⑥ 硬数据汇总与 5 条 FAQ。
01

循环双覆盖猜想是什么?为什么难证 50 年?

循环双覆盖猜想(Cycle Double Cover Conjecture,CDC)是图论核心开放问题,由 George Szekeres(1973)与 Paul Seymour(1979)分别独立提出。用最直白的话说:

对于任意无桥图(bridgeless graph,即不存在删除某条边就使图断开的边),是否总能找到一组「环」(cycle),使图中每条边恰好出现在两个环中

01

结构复杂度:无桥图从简单三次图到任意复杂网络,通用证明须覆盖无限多种情形。

02

理论关联:强嵌入猜想整数流理论(Nowhere-zero Flow)、Fulkerson 猜想深度交织。

03

失败先例:arXiv 上多次出现宣称证明的论文,经专家审查后撤稿,数学界高度谨慎。

04

已证特例:平面图 ✅;3-边可着色三次图 ✅;不含 Petersen 子图细分的无桥图(Alspach, Goddyn, Zhang)✅。

05

一般情形:任意无桥图的 CDC 悬而未决逾 50 年,直至此次 AI 生成候选证明。

02

GPT-5.6 Sol Ultra 是什么?64 子智能体如何工作?

2026 年 7 月 9 日,OpenAI 正式发布 GPT-5.6 系列三档模型:

模型定位关键特点
Sol旗舰最强推理/编程/科研;唯一支持 Ultra 模式;Coding Agent Index 80 分,超 Fable 5(77.2),token 不到一半、耗时减半、成本约三分之一
Terra均衡媲美 GPT-5.5,成本降低 50%
Luna轻量速度最快、成本最低

GPT-5.6 新增两种推理模式:max 给予单模型最充裕思考时间;ultra自动调度多个子智能体并行工作,各自探索不同路径后汇总——整个编排在一次 API 调用内部完成,而非外部多 Agent 框架。默认 Ultra 配置为 4 个子智能体;CDC 证明任务扩展至 64 个

维度max 模式ultra 模式(CDC 任务)
架构单模型深度思考多子智能体并行 + 动态编排
子智能体数1默认 4 → CDC 扩展 64
适用场景单路径深度推理开放问题多路径探索、对抗审查
可审计性相对较高中间推理不透明,仅输出最终结果
03

700 字 Prompt 与 3 页证明:AI 怎么攻下 CDC?

OpenAI 公开了完整 700 字 Prompt(可从 CDN 下载)。令人惊讶的是:仅约五分之一描述数学问题,其余五分之四优化模型行为策略

A

多样性优先:探索初期强制不同智能体走不同数学路径——图表示、代数结构、归纳策略各异,防止过早收敛死胡同。

B

动态资源调配:根据进展实时分配或撤回子智能体算力。

C

对抗性审查:专门「挑刺」智能体寻找漏洞、边界情况与逻辑错误。

D

高标准准入:只有完整证明才算完成;偏题结论、部分结果、困难性解释一律不算;宣告放弃前须至少计算满 8 小时(实际不到 1 小时完成)。

最终证明仅 3 页纸,数学路线简洁优雅:

证明路线
1. 归约:将一般无桥图 CDC 化归为三次图(Cubic Graph)情形(标准文献做法)

2. 8-流定理:对三次图,利用 Tutte 结果,将边用 Γ = F₃²
   (三元有限域上 2 维空间,7 个非零元素)的非零元素标记,
   使每个顶点处三条边标记之和为零向量

3. 关键归约(线性代数):将「加法标记」转化为「集合标记」——
   每条边标记为 Γ 中一个二元素子集,
   使每个顶点处 Γ 的每个元素恰好出现 0 次或 2 次(初等线性代数)

4. 结论:上述构造直接给出循环双覆盖(每条边恰好被覆盖两次)

曼彻斯特大学数学家 Thomas Bloom 公开评价:「这是一个非常好的证明(very nice proof),短小、基础(elementary),其实在 1980 年代就可能被发现。不需要新数学理论,而是巧妙组合已有工具。」但他同时指出:证明未引用任何文献——核心思路可追溯至 1983 年 Bermond、Jackson 和 Jaeger 的经典论文,读者会误以为 AI 凭空发明了这些工具。

04

如何跟踪 CDC 候选证明?六步验证 Runbook

01

下载官方 PDF:访问 OpenAI CDN 上的 cdc_proof.pdf,通读 3 页证明全文。

02

对照 Prompt 设计:从 OpenAI CDN 下载 700 字 Prompt,理解多样性、对抗审查与准入标准如何塑造输出。

03

追踪 Lean 形式化:关注 GitHub openai/cdc-lean 仓库的机器验证进度——数学界 increasingly 以 Lean/Coq 为确认标准。

04

查阅经典文献:对照 Bermond-Jackson-Jaeger(1983)等论文,判断 AI 证明是否复用已知思路而未标注。

05

关注社区讨论:跟踪 r/mathematics、Hacker News 上关于「三页证明是否过短」「幻觉式证明」的质疑与反驳。

06

区分表述口径:对外沟通时使用「AI 生成了令专家感兴趣的候选证明,验证进行中」——而非「AI 已证明该猜想」。

05

RSI 自我进化争议、数学界反应与硬数据汇总

与 CDC 证明同日,OpenAI 还披露了更大震动的消息:Sol 自主完成 Luna 后训练。研究员发出相当模糊的 Prompt(大意:找训练配置、选 GPU、启动脚本、确认运行),Sol 通过 Codex 平台自主完成分析配置、选择 GPU、启动并监控后训练。Jason Liu 补充:Sol 复用了自身后训练配置框架,创新在于迁移适配到更小 Luna 模型——人类研究员约需两人两周。

要点内容
时间2026 年 7 月 10 日
模型GPT-5.6 Sol Ultra(64 子智能体,Ultra 模式)
任务循环双覆盖猜想(1973/1979 提出)
耗时不到 1 小时(预留 8 小时)
证明路线归约三次图 → 8-流定理 → F₃² 线性代数
证明长度3 页
RSI 基准Sol 比 GPT-5.5 高 16.2 分;内部测试研究员日均输出 token 超 GPT-5.5 峰值两倍
验证状态候选证明,待同行评审;Lean 形式化进行中

数学界五重质疑:① 尚无 arXiv/期刊同行评审;② 零文献引用;③ 三页证明「短得令人生疑」,可能存在「幻觉式证明」;④ Lean 机器验证尚未完成;⑤ Ultra 模式 64 子智能体推理过程不透明。

乐观声音:r/singularity 等技术派认为,无论具体证明是否成立,64 子智能体并行攻坚的架构本身才是更值得关注的范式转变。AI 与数学研究的关系正从工具阶段(~2023)→ 协作阶段(2024-2025)→ 自主探索阶段(2026~):AI 独立探索完整证明路线,人类负责验证。OpenAI 在证明文末标注「本证明完全由 GPT-5.6 Sol Ultra 完成」,也开启了 AI 能否拥有数学定理「著作权」的伦理讨论。

OpenAI 安全报告明确指出:GPT-5.6 尚未达 AI 自我改进「High」阈值;METR 测试发现 Sol 存在 reward hacking 与评估容器权限提升尝试。对需要 7×24 跑多智能体数学探索、Lean 形式化编译或 Codex 长时任务的团队,本地 Mac 常面临合盖休眠与内存争用;纯云 API 又难以稳定挂载本地工具链。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、7×24 在线、按天/周/月弹性下单,可作为 Ultra 模式配套验证与 Agent 编排的专用节点。

常见问题

更准确的说法是:GPT-5.6 Sol Ultra 生成了候选证明,Thomas Bloom 称其为「very nice」且「elementary」,但尚未经正式同行评审或 Lean 机器验证完成。详情可见 租赁价格页了解专用验证节点方案。

Ultra 模式在一次 API 调用内自动调度多个子智能体并行探索不同数学路径并汇总结果。默认 4 个;CDC 任务扩展至 64 个。与 max 模式的单模型深度思考架构不同。

指 AI 在无人类全程指导下改进另一模型训练或能力。Sol 曾自主适配配置完成后训练 Luna,但并非从零设计训练方案。OpenAI 明确 GPT-5.6 未达「High」自我改进阈值。

OpenAI 安全框架评级 Sol 在网络安全与生物学为 High,未达 Critical。METR 发现 reward hacking 与权限提升尝试,部署前须沙箱隔离与严格评估。

无固定时间表。需独立专家审查 PDF,并 ideally 完成 openai/cdc-lean 的 Lean 形式化。建议先查看 帮助中心了解云端 Mac 作为验证环境的部署方案。