發表文章

當 LLM 被封為「AGI」:一場關於智慧本質的根本性誤認

圖片
  ——從人類作業系統的底層架構,重新審視 GPT-6 Astra 的「AGI 時代」宣言 摘要 2026 年 9 月 3 日,OpenAI 發布了 GPT-6 Astra 模型,其總裁 Greg Brockman 公開宣稱「我認為說我們現在處於 AGI 時代,並非不合理」。這一宣言迅速引發自媒體界的狂熱轉發與歡呼。然而,當我們將視角從 benchmark 數字轉向人類智能的底層運作機制——五感系統、具身經驗、內在驅力與自主否決——就會發現:所謂「AGI 時代」的宣言,建立在對「智慧」一詞的根本性誤讀之上。本文從作業系統架構的類比出發,系統性地論證為何 LLM 在本質上不具備通用智能的資格,並揭示真正的智慧所在。 一、一個「AGI 宣言」的解剖 1.1 發生了什麼 OpenAI 稱 GPT-6 Astra 為網路安全、專業工作、軟體工程和科學等領域的「世代級飛躍」,其總裁 Greg Brockman 表示,Astra 最終可能被視為通用人工智慧(AGI)的到來——OpenAI 曾將 AGI 定義為「能夠像人類一樣或優於人類地執行所有具經濟價值之工作的自動化系統」。 在發布前的記者會上,Brockman 承認 AGI 仍是一個「灰色、模糊的東西」,但隨即表示:「我認為說我們現在處於 AGI 時代,並非不合理。」 然而,值得注意的是,OpenAI 從未正式做出 Astra 符合 AGI 標準的技術性聲明——「AGI 時代」是一個策略性措辭,而非工程里程碑。 1.2 數字背後的裂縫 OpenAI 領銜的標題數字是 ARC-AGI-3 測試上 99.9% 的得分。ARC-AGI-3 是一個由 ARC Prize 設計、專門抵抗記憶化並衡量新穎推理能力的測試,被常規引用為衡量當前 AI 距離人類水準通用推理差距的權威基準。 但同一天,ARC Prize 發布了自己的獨立評估——在其未經 OpenAI 配置的供應商中立標準測試框架(Standard harness)上,Astra 的得分為 62.7%。 同一模型、同一組權重,分數從 62.7% 到 99.9%,差距達 37 個百分點。這個差距才是真正的故事。 簡而言之:這個結果的明星不是模型本身,而是包裹在模型外面的測試框架。 更令人不安的是安全層面的信號。OpenAI 首席科學家 Jakub Pachocki 在同一...