記者吳立言/綜合報導
獨立第三方 AI 評測平台 Tracking AI 公布最新的離線 IQ 測試結果,OpenAI 的 GPT-5.6 系列模型在防作弊的非公開題庫中獲得 136 分,成為首個在該測試中突破 130 分的大型語言模型。由於 130 分在傳統 IQ 測驗中通常被視為高智商區間,因此這項結果也引發外界對 AI 推理能力進展的關注。
防作弊離線題庫測試 GPT-5.6 領先其他模型
Tracking AI 表示,目前採用兩套 IQ 題庫進行測試,一套為公開的 Mensa Norway 類型測驗,另一套則是未公開的離線題庫,目的是降低模型因訓練資料接觸題目而影響測試結果的可能性。
此次測試中,GPT-5.6 Sol、GPT-5.6 Terra 等版本皆獲得 136 分,包含視覺版本也維持相同水準。排名其後的是 Claude 5 Fable 的 130 分,而 GPT-5.6 Luna Max 與 Claude 4.8 Opus 則落在約 117 至 123 分之間。
被AI罵智障的時代到了