OpenAI 調兩個設定讓 GPT-5.6 分數翻 3 倍,ARC-AGI-3 成績從 7.8% 衝到 23%

OpenAI 調兩個設定讓 GPT-5.6 分數翻 3 倍,ARC-AGI-3 成績從 7.8% 衝到 23%

OpenAI 調兩個設定讓 GPT-5.6 分數翻 3 倍,ARC-AGI-3 成績從 7.8% 衝到 23%

能解數學難題的 AI,卻輸給 2D 拼圖?

OpenAI 今年 6 月底發表的 GPT-5.6 Sol,是截至目前最強的旗艦模型。它解開了數學界長年未解的「循環雙重覆蓋猜想」(Cycle Double Cover Conjecture),還成功通關 Game Boy 版的《寶可夢 火紅》。

結果在 ARC-AGI-3 這個測試 AI 通用智力的 2D 拼圖 benchmark 上,GPT-5.6 Sol 只拿到 7.8% 的分數。

這反差大到讓 OpenAI 工程師自己都傻眼。調查後發現:問題根本不在模型笨,而是「考試規則」設錯了。

什麼是 ARC-AGI-3?為什麼連 GPT-5.6 都栽了?

你可以把 ARC-AGI-3 想成 AI 界的「學測自然科實驗題」——給你一些沒見過的規則,看你能不能現學現賣。題目是 2D 網格拼圖,每題規則都不同,考的是「抽象推理」和「快速學習」,不是背過的知識。

過去 GPT-4、Claude 這些大模型在這裡都表現普通,因為它們擅長的是「記憶+組合」,不是「現場摸透新規則」。

但 GPT-5.6 Sol 已經強到能解數學猜想,為什麼還是輸?

兇手找到了:API 設定裡的兩個開關

OpenAI 團隊追查後發現,問題出在 「harness」(測試框架) 的設定——也就是 AI 參加考試時的「考場規則」。

原本的設定出了什麼問題?

GPT-5.6 系列有個特色:它會在回答前,先用「內部推理訊息」思考一番,就像你寫考卷時的草稿計算。這些草稿預設會保留在對話紀錄裡,太長時還會自動摘要。

但 ARC-AGI-3 的官方測試框架做了兩件事:

  • 每次操作後就丟掉推理草稿(像寫完一題就被搶走草稿紙)
  • 上下文滿了之後,連之前的動作紀錄也刪掉(像考試考到一半,前面寫的答案被擦掉)

結果 GPT-5.6 Sol 每做一題,都要從頭重新推理,完全沒有累積學習。這就像逼一個數學天才,每算一步就被洗掉記憶,當然考不好。

調兩個設定,分數從 7.8% → 23%

OpenAI 只改了兩個 API 參數:

設定原本調整後效果
保持推理(retained reasoning)每次動作後清除延長保留期間不用重複想同一件事
壓縮(compression)上下文滿了就刪舊紀錄優化摘要機制重要資訊留得住

結果:

  • ARC-AGI-3 公開測試集分數:7.8% → 約 23%(3 倍)
  • 輸出 token 數量:降到原本的 1/6(省 83%)

同樣的模型,只是考場規則改對了,成績完全不一樣。

這件事告訴我們什麼?

1. AI 競賽比的不只是「模型大小」

大家愛比誰的參數多、誰的訓練資料多,但這次事件證明:怎麼用有什麼 一樣重要。就像同樣一個學生,學測前知道要帶計算機、知道時間分配,分數可以差很多。

2. Benchmark 分數可能有「水分」

當你看到某個 AI「在某測試打敗 GPT-4」,先問問:它的 harness 設定是什麼?有沒有特調過?這次 OpenAI 自己公開承認設定錯誤,算是業界少見的透明操作。

3. 台灣開發者可以學的一課

如果你在用 ChatGPT API 做應用,檢查一下你的設定:

  • reasoning_effort 有沒有開?
  • 上下文管理怎麼做的?
  • 有沒有讓 AI 的「草稿」被不合理地清掉?

有時候模型表現不好,不是換更貴的方案(GPT-5.6 Sol 的 API 貴到嚇人),而是現有的調一調就夠用。

這對一般人有什麼影響?

老實說,短期內不多。GPT-5.6 Sol 目前還是「限定預覽」,一般人用不到,而且價格大概是 GPT-4o 的 50-100 倍。但這個案例會進入 AI 教材——以後工程師上課會講:「記得 2026 年 OpenAI 那個 harness 事件,設定錯了連 Sol 都會考爆。」

對一般使用者來說,最大的啟發可能是:AI 很強,但也很挑「使用方法」。就像你買了頂級單眼相機,用自動模式拍,可能還不如用手機調好參數。


現在就打開你的 ChatGPT 設定頁面,看看「自訂指令」和「記憶」功能有沒有開啟——有時候免費版調對設定,比亂用付費版還有效。