能解數學難題的 AI,卻輸給 2D 拼圖?
OpenAI 今年 6 月底發表的 GPT-5.6 Sol,是截至目前最強的旗艦模型。它解開了數學界長年未解的「循環雙重覆蓋猜想」(Cycle Double Cover Conjecture),還成功通關 Game Boy 版的《寶可夢 火紅》。
結果在 ARC-AGI-3 這個測試 AI 通用智力的 2D 拼圖 benchmark 上,GPT-5.6 Sol 只拿到 7.8% 的分數。
這反差大到讓 OpenAI 工程師自己都傻眼。調查後發現:問題根本不在模型笨,而是「考試規則」設錯了。
什麼是 ARC-AGI-3?為什麼連 GPT-5.6 都栽了?
你可以把 ARC-AGI-3 想成 AI 界的「學測自然科實驗題」——給你一些沒見過的規則,看你能不能現學現賣。題目是 2D 網格拼圖,每題規則都不同,考的是「抽象推理」和「快速學習」,不是背過的知識。
過去 GPT-4、Claude 這些大模型在這裡都表現普通,因為它們擅長的是「記憶+組合」,不是「現場摸透新規則」。
但 GPT-5.6 Sol 已經強到能解數學猜想,為什麼還是輸?
兇手找到了:API 設定裡的兩個開關
OpenAI 團隊追查後發現,問題出在 「harness」(測試框架) 的設定——也就是 AI 參加考試時的「考場規則」。
原本的設定出了什麼問題?
GPT-5.6 系列有個特色:它會在回答前,先用「內部推理訊息」思考一番,就像你寫考卷時的草稿計算。這些草稿預設會保留在對話紀錄裡,太長時還會自動摘要。
但 ARC-AGI-3 的官方測試框架做了兩件事:
- 每次操作後就丟掉推理草稿(像寫完一題就被搶走草稿紙)
- 上下文滿了之後,連之前的動作紀錄也刪掉(像考試考到一半,前面寫的答案被擦掉)
結果 GPT-5.6 Sol 每做一題,都要從頭重新推理,完全沒有累積學習。這就像逼一個數學天才,每算一步就被洗掉記憶,當然考不好。
調兩個設定,分數從 7.8% → 23%
OpenAI 只改了兩個 API 參數:
| 設定 | 原本 | 調整後 | 效果 |
|---|---|---|---|
| 保持推理(retained reasoning) | 每次動作後清除 | 延長保留期間 | 不用重複想同一件事 |
| 壓縮(compression) | 上下文滿了就刪舊紀錄 | 優化摘要機制 | 重要資訊留得住 |
結果:
- ARC-AGI-3 公開測試集分數:7.8% → 約 23%(3 倍)
- 輸出 token 數量:降到原本的 1/6(省 83%)
同樣的模型,只是考場規則改對了,成績完全不一樣。
這件事告訴我們什麼?
1. AI 競賽比的不只是「模型大小」
大家愛比誰的參數多、誰的訓練資料多,但這次事件證明:怎麼用 跟 有什麼 一樣重要。就像同樣一個學生,學測前知道要帶計算機、知道時間分配,分數可以差很多。
2. Benchmark 分數可能有「水分」
當你看到某個 AI「在某測試打敗 GPT-4」,先問問:它的 harness 設定是什麼?有沒有特調過?這次 OpenAI 自己公開承認設定錯誤,算是業界少見的透明操作。
3. 台灣開發者可以學的一課
如果你在用 ChatGPT API 做應用,檢查一下你的設定:
reasoning_effort有沒有開?- 上下文管理怎麼做的?
- 有沒有讓 AI 的「草稿」被不合理地清掉?
有時候模型表現不好,不是換更貴的方案(GPT-5.6 Sol 的 API 貴到嚇人),而是現有的調一調就夠用。
這對一般人有什麼影響?
老實說,短期內不多。GPT-5.6 Sol 目前還是「限定預覽」,一般人用不到,而且價格大概是 GPT-4o 的 50-100 倍。但這個案例會進入 AI 教材——以後工程師上課會講:「記得 2026 年 OpenAI 那個 harness 事件,設定錯了連 Sol 都會考爆。」
對一般使用者來說,最大的啟發可能是:AI 很強,但也很挑「使用方法」。就像你買了頂級單眼相機,用自動模式拍,可能還不如用手機調好參數。
現在就打開你的 ChatGPT 設定頁面,看看「自訂指令」和「記憶」功能有沒有開啟——有時候免費版調對設定,比亂用付費版還有效。