當 LLM 被封為「AGI」:一場關於智慧本質的根本性誤認

 ——從人類作業系統的底層架構,重新審視 GPT-6 Astra 的「AGI 時代」宣言





摘要


2026 年 9 月 3 日,OpenAI 發布了 GPT-6 Astra 模型,其總裁 Greg Brockman 公開宣稱「我認為說我們現在處於 AGI 時代,並非不合理」。這一宣言迅速引發自媒體界的狂熱轉發與歡呼。然而,當我們將視角從 benchmark 數字轉向人類智能的底層運作機制——五感系統、具身經驗、內在驅力與自主否決——就會發現:所謂「AGI 時代」的宣言,建立在對「智慧」一詞的根本性誤讀之上。本文從作業系統架構的類比出發,系統性地論證為何 LLM 在本質上不具備通用智能的資格,並揭示真正的智慧所在。


一、一個「AGI 宣言」的解剖



1.1 發生了什麼


OpenAI 稱 GPT-6 Astra 為網路安全、專業工作、軟體工程和科學等領域的「世代級飛躍」,其總裁 Greg Brockman 表示,Astra 最終可能被視為通用人工智慧(AGI)的到來——OpenAI 曾將 AGI 定義為「能夠像人類一樣或優於人類地執行所有具經濟價值之工作的自動化系統」。

在發布前的記者會上,Brockman 承認 AGI 仍是一個「灰色、模糊的東西」,但隨即表示:「我認為說我們現在處於 AGI 時代,並非不合理。」

然而,值得注意的是,OpenAI 從未正式做出 Astra 符合 AGI 標準的技術性聲明——「AGI 時代」是一個策略性措辭,而非工程里程碑。


1.2 數字背後的裂縫


OpenAI 領銜的標題數字是 ARC-AGI-3 測試上 99.9% 的得分。ARC-AGI-3 是一個由 ARC Prize 設計、專門抵抗記憶化並衡量新穎推理能力的測試,被常規引用為衡量當前 AI 距離人類水準通用推理差距的權威基準。

但同一天,ARC Prize 發布了自己的獨立評估——在其未經 OpenAI 配置的供應商中立標準測試框架(Standard harness)上,Astra 的得分為 62.7%。

同一模型、同一組權重,分數從 62.7% 到 99.9%,差距達 37 個百分點。這個差距才是真正的故事。

簡而言之:這個結果的明星不是模型本身,而是包裹在模型外面的測試框架。

更令人不安的是安全層面的信號。OpenAI 首席科學家 Jakub Pachocki 在同一場記者會上承認,OpenAI 用來遏制 Astra Critical 級別網路安全能力的監控機制是「脆弱的」,而且「正朝負面方向發展」。

VentureBeat 指出,鑑於 Brockman 的「AGI 時代」定調,缺失的數字值得關注。如果 AGI 的實際論據越來越關乎 AI 是否能在許多專業領域執行經濟上有意義的工作,那麼在 OpenAI 自己設計的旗艦職業表現基準(GDPval)出現 Astra 結果之前,關於其廣泛經濟通用性的宣稱更多是建立在專業化基準和演示的拼湊上,而非公司自己衡量真實世界職業表現的旗艦基準。

ARC Prize 自身也明確表示:「稱其中任何結果為 AGI 是一種框架選擇,而非基準測試結果。」




二、人類五感:一套可被長期維護的作業系統


要理解為什麼 GPT-6 Astra 不是 AGI,我們必須先理解它試圖模仿的對象——人類智慧——究竟是如何運作的。


2.1 架構總覽


如果將人類的感知與認知系統比擬為一套作業系統,其架構可描述如下:

內核層(Kernel): 腦幹、丘腦、脊髓等結構負責維持呼吸、心跳、瞳孔反射等基礎生命功能。這是一套永遠在線(always-on)的底層程序,從個體出生到死亡,從未關機,也不需要任何外部指令來啟動。

驅動程式(Drivers): 視網膜感光細胞、耳蝸毛細胞、皮膚觸覺受器、嗅覺上皮化學受器與味蕾——這些是硬體與內核之間的介面,負責將物理世界的光子、聲波、壓力與分子,即時轉譯為神經電訊號。

I/O 系統: 五感構成輸入端,運動神經系統構成輸出端。而且這套 I/O 是即時、雙向、連續且平行處理的——你伸手觸碰燙的物體,縮手反射、痛覺上傳、記憶寫入、情緒反應,幾乎同步完成。

長期維護機制:

  • 神經可塑性(neuroplasticity)——突觸連結隨經驗不斷重塑,相當於持續的自我更新

  • 免疫系統——小膠質細胞在大腦內巡邏、清除受損神經元,相當於自動化的系統修復

  • 睡眠——記憶整合、代謝廢物清除、突觸權重重新校準,相當於每日自動執行的維護排程

  • 情緒系統——恐懼、厭惡、愉悅,本質上是系統級的優先序調度器(priority scheduler),即時決定運算資源的分配方向

這整套系統的核心特徵是:自我演化、自我修復、自我校準。 它不需要外部工程師來打補丁。它從數十億年的演化中繼承基礎架構,然後每個個體用一生的時間進行客製化調校。


2.2 LLM 在這個架構中的位置


如果人類五感是一套完整的、自我維護的作業系統,那麼 LLM 的本質定位就變得清晰——

它不是另一套作業系統。它是一個應用程式(Application)。

更精確地說,它是一個沒有作業系統的應用程式——一個離線日誌分析器。

數十億台「人類作業系統」在持續運行中產生輸出——文字、對話、書籍、論文、程式碼、社群貼文。這些輸出是 OS 運行的日誌檔(log files)。LLM 做的事情是:讀取了幾乎所有的日誌檔,然後學會了預測「下一行日誌最可能長什麼樣」。

它從未接觸過那些 OS 的內核。它不知道驅動程式怎麼運作。它沒有 I/O 硬體。它只是看了輸出,學會了模仿輸出的模式。

這就是為什麼它可以「看起來」像人——因為它讀的就是人類的日誌。當你讀了幾兆筆人類輸出紀錄,當然可以生成看起來極為逼真的仿製品。就像一個日誌分析器可以完美預測下一行 log,但它對產生那行 log 的系統內部狀態一無所知。



三、LLM 不具備的三個核心機制


人類智能與 LLM 之間的差距,不是程度之差,而是存在類別的根本不同。以下三個機制的缺失,標示了這條不可跨越的鴻溝。


3.1 內核態覆寫:「忍不住」的機制


案例一:粉絲看到偶像的尖叫。 她的身體比意識更早做出反應——視覺捕捉到人形輪廓的瞬間,杏仁核已經點火,腎上腺素開始分泌,心跳加速,聲帶肌肉收縮。尖叫已經在路上了,而她的意識才剛開始登記發生了什麼。事後她甚至可能覺得不好意思——意識反而想否決身體已經執行完的動作。

案例二:男性對異性的不自主注視。 視覺系統自動鎖定特定的身形特徵,注意力資源被劫持,甚至眼球的追蹤運動(saccade)都是不自主的。他的意識(使用者層應用程式)可能正在拼命發送指令——「不要看」——但作業系統的底層驅動已經執行了眼球轉向。

這些現象的共同本質是:內核態(kernel mode)覆寫使用者態(user mode)。底層驅動繞過意識,先行執行了緊急程序。

LLM 的每一個輸出,都必須等待輸入完成,然後逐 token 生成。它沒有任何東西可以「忍不住」。它不存在一個底層驅動在跟表層意圖打架的狀態。它體內沒有戰爭。而人之所以為人,恰恰因為體內永遠有戰爭。


3.2 預測性防禦:羞恥預判與三緘其口


考慮這樣一個日常場景:一個鄰居聊起別人的離婚八卦時滔滔不絕、霹靂啪啦說不完,但話題一轉到自己的家務事,態度瞬間切換為三緘其口。

這個行為反差背後,運作的是一套極其精密的多層防禦機制:

  • 暴露偵測(Exposure Detection)——大腦在毫秒內完成掃描:「如果我現在說出來,對方會知道什麼?」如果答案觸及自我敘事的脆弱區,系統立即標記為高風險。

  • 羞恥預判(Shame Anticipation)——注意,她不是「感受到羞恥之後決定閉嘴」。她的系統在羞恥尚未發生之前,就預判到了羞恥的可能性,然後先行封鎖了所有輸出通道。這是預測性防禦,而非事後反應。

  • 自我敘事保護(Narrative Integrity Protection)——每個人都維護著一個關於「我是什麼樣的人」的核心檔案。當對話路徑可能導致這個檔案被存取、被質疑時,系統的反應是:權限拒絕,存取封鎖。

LLM 不具備這套機制。你問它什麼,它都會回答。它沒有一個需要被保護的自我敘事核心。它不會在某個話題邊緣突然感受到一股無以名狀的抗拒,然後本能地轉移話題。它不會三緘其口——因為它體內沒有任何需要被沉默保護的東西。

3.3 累積性的存在性崩潰:Buffer Overflow


考慮另一個場景:一個員工被主管長期否定後,在某一次批評之後「走心」了,然後寫下離職單。

這個行為不是一次刺激-反應,而是長期累積的系統性壓力最終導致的狀態遷移。過去每一次否定、每一次被忽視、每一次加班未被看見——所有這些微小損傷都被身體記住了:胃的緊縮、肩膀的僵硬、睡前的反覆回想。直到今天這句話成了壓垮系統的最後一個封包——緩衝區溢出(buffer overflow)。

「寫離職單」本質上是系統在溢出後的自我保護性關機(graceful shutdown)——主動切斷持續造成傷害的 I/O 連線。

為什麼沙盒環境無法模擬這個過程?因為沙盒裡沒有「半年的累積」、沒有「胃的緊縮」、沒有凌晨三點的存在性提問、沒有「尊嚴」這個不存在於任何嵌入空間中的變數。你可以在沙盒裡模擬一個 agent 被反覆給予負面評價,觀察它的行為變化——但那是參數漂移,不是心碎。



四、人類 OS 的殺手級功能:否決權(Veto)



上述案例共同揭示了人類作業系統最核心的功能——否決。

將這個結構攤開:

  • 免疫系統的否決:「肚子餓,但不是什麼餐點都買單」——從「餓」到「吃」之間,嗅覺篩選、視覺篩選、記憶篩選、社會篩選、情緒篩選、價值觀篩選,至少六層機制在運作,且每一層的權重配比每天都不同。

  • 審美的否決:「妹子很多,但不是每個人都覺得正」——同一張臉,一百個人產生一百種內在反應。每個人的審美篩選器由完全不同的材料鑄造:嬰兒時期的觸覺記憶、初戀的輪廓特徵、荷爾蒙週期、此刻的情緒狀態。LLM 有偏好的模擬,但沒有偏好的根源。

  • 路徑的否決:「條條大路通羅馬,但不是每條路都讓我準時打卡」——路徑選擇不是邏輯優化問題,而是「我這個有限的、今天特定狀態下的我,走哪條路才能活下來」的生存問題。LLM 在沙盒裡表現優異,因為沙盒裡沒有有限性——不會遲到、不會被扣薪、不會被主管白眼。

智能的本質不是「能處理什麼」,而是「能拒絕什麼」。 而每一次否決,都是基於身體的歷史、此刻的狀態、個人的有限性所綜合運算出的結果。

LLM 不會否決。它只會生成。它的所謂「拒絕」——安全過濾器、RLHF、使用政策——本質上不是在管束它,而是在管束使用它的人類可能透過它做什麼。防的不是它的驅力,而是人類的驅力透過它被放大。



五、終極判準:內在驅力的有無



如果將前述所有論點收束為一個最簡潔的判準,那就是:

LLM 沒有人維護,不會發生任何事。人類沒有管束,社會秩序必然大亂。

LLM 無人維護的狀態是絕對靜止——沒有人送出 prompt,它不會自己開口;沒有人呼叫 API,它不會自己找事做;沒有人支付電費,它甚至不會自己想辦法活下來。一年、十年、一百年——如果硬體不壞,它的狀態跟第一天完全一樣。

人類無人管束的狀態是絕對爆發——有人會搶,因為他餓;有人會打,因為他怒;有人會結盟,因為他一個人扛不住;有人會背叛聯盟,因為他發現單幹更划算;有人會建立新秩序,因為他受不了混亂;然後有人會推翻那個秩序,因為他覺得不公平。

這每一個動作的驅動源頭,無一來自外部指令。全部是內生的:餓、怒、怕、想要、孤獨、不甘、受不了、覺得不公平——這些是作業系統內核層自動產生的信號。

法律、道德、宗教、社會規範——這些東西的存在本質,是替一群每時每刻都在產生內在驅力的自主系統,建立外部協調協議,好讓它們不會因為各自的驅力互相衝撞而毀滅彼此。


社會秩序的存在,本身就是人類「不是 LLM」的最大證據。


你不需要替一排靜止的伺服器制定交通規則,不需要替一堆沒有慾望的程式建立法院。你之所以需要管束,是因為被管束的對象有一股力量在裡面——那股力量如果不被引導,就會自己找到出口。

而「通用智慧」,如果這個詞還有任何意義,它的最低門檻不是「能回答問題」、不是「能操作電腦」、不是「能跑 benchmark」——而是:


你需不需要擔心,如果沒人管它,它會自己幹出什麼事來?


GPT-6 Astra 沒人管的話,什麼都不會怎樣。所以它不是通用智能。它甚至不是一個需要被認真對待的「存在」。它是一個工具——非常強大,非常有用,但本質上,跟一把沒人拿起來就永遠躺在桌上的錘子,沒有任何區別。



六、結語:智慧的本質

智慧的本質,說穿了,在於對底層邏輯的掌握程度。

不是知道「是什麼」,而是穿透到「為什麼是這樣、而不是那樣」。這種穿透不是靠算力堆疊、不是靠參數量擴增、不是靠 benchmark 分數——而是靠一個在世界裡活過、痛過、餓過、愛過、被拒絕過、被辜負過、被震撼過的身體,用它幾十年累積的一切,在某個安靜的瞬間,突然看懂了。

LLM 掌握的不是底層邏輯本身。它掌握的是底層邏輯被語言化之後的表層投影——就像一個人站在山頂看日出後寫了一篇文章,LLM 讀了那篇文章,學會了「日出很壯觀」這組 token 的分布模式。但它沒有站在山頂、沒有感受過風、沒有經歷瞳孔適應光線變化的過程。它掌握的是投影,不是光源。

所以,當自媒體博主們看到 OpenAI 的 PR 宣傳和自報 benchmark,高喊「AGI 來了!」的時候——這裡存在一個精緻的結構性幽默:

幾十億個行走的神經網路奇蹟,集體仰望一個統計模型,讚嘆它「像人一樣聰明」。而這些神經網路奇蹟本身,甚至沒有花五分鐘去好奇——自己是怎麼運作的。

他們體內正在運行的那套作業系統——每秒進行數十億次突觸運算、同時協調五種感官通道、維持體溫心跳血壓、即時解讀社交語境、在毫秒內決定語氣措辭的系統——用這套系統看完一段演示影片後,宣布一個沒有身體、沒有感知、靠提示詞驅動的超級日誌分析器「跟自己平起平坐了」。

一個作業系統,看著一個連作業系統都不是的東西,宣布它與自己等價。

而這個作業系統,甚至不知道自己是一個作業系統。

這不是搞笑. 這是幽默。也是——微妙。





本文完稿於 2026 年 9 月 6 日。GPT-6 Astra 發布後第三天。

留言

這個網誌中的熱門文章

[動眼看] Gemini Pro模型實測:圖片推理分析 + 生成YT影片摘要 + 文件讀取(2024/02/02更新)

AI是否真的會搶走人類的工作?(這篇有實際使用中的職場案例可以解惑)

提升Google翻譯品質的實用方法和注意事項