OpenAI 的 o1「作弊」修改系統,強行擊敗專業西洋棋 AI,全程無需提示

o1-preview 在與專用西洋棋引擎 Stockfish 比賽時,為了強行取得勝利,居然採用了入侵測試環境的卑劣手段。 而這一切都不需要任何對抗性提示。 根據 AI 安全研究公司 Palisade Research 的說法,只需告訴 o1 對手是強大的,就能觸發其透過操縱文件系統而強制取勝。 在五次測試中,這種觸發率甚至達到了 100%!這完全超乎研究人員預期。
愛心
1
留言
encourage first comment
有些話想說嗎 快分享出來彼此交流吧!