重點摘要
鵜鶘測試無罪,但 AI 帳本藏了 1.65 兆美元等待浮現
Dylan Castillo 以 1,008 張 SVG 系統測試證明:AI 實驗室並未針對「鵜鶘騎自行車」基準特訓,但基準測試的信任危機本身從未消散。
五大科技巨頭表外負債高達 1.65 兆美元,Oracle 四年成長逾 30 倍;技術會計顧問將現行結構比擬為 Enron 崩潰前夕的帳面合規陷阱。
AI 投資閉環遮蔽真實外部需求,表外義務 4 年成長 8 倍與能源消耗攀升,共同構成 AI 產業可持續性的最大未解變數。
前情提要
什麼是 Pelicanmaxxing?AI 實驗室的規模幻術
Simon Willison 多年來習慣以「鵜鶘騎自行車 SVG」作為固定測試 prompt,因為這類輸出長期佔據 Hacker News 熱門回應,逐漸形成非正式的社群基準。
2025 年起,外界開始懷疑 AI 實驗室是否針對這題刻意調教模型——這個現象被稱為「Pelicanmaxxing」。
研究者 Dylan Castillo 以系統化方式回應這個質疑:他對七個前沿模型進行 1,008 張 SVG 圖測試,涵蓋 48 種動物與交通工具的配對組合,使用固定效應迴歸加上 LLM 評審打分。
結論清晰:鵜鶘在 8 種動物中排名第 6,自行車在載具中排名第 7,鵜鶘加自行車組合在 48 種配對中排名第 42——並無統計顯著的「鵜鶘加成」。
Castillo 本人坦言:「我找不到任何跡象顯示鵜鶘自行車圖片明顯優於其他組合。」更可能的解釋是「SVGmaxxing」——各實驗室在整體向量圖形能力上的全面提升,而非單點作弊。
名詞解釋
固定效應迴歸 (Fixed Effects Regression) :一種排除個體差異干擾的統計方法,用於消除不同動物或交通工具本身難度的影響,讓跨組比較更公平。
帳面之下:AI 公司如何隱藏巨額債務
就在 Pelicanmaxxing 爭議平息之際,Nikkei Asia 一份 2026 年 7 月的研究揭示了更嚴峻的財務真相。
Alphabet、Microsoft、Amazon、Meta 與 Oracle 五大科技巨頭,表外負債合計高達約 1.65 兆美元,超過其帳面正式揭露的 1.35 兆美元,比例達帳面債務的 122%。
Meta 一家的表外曝險便高達約 4,200 億美元,接近其透明債務的三倍;Oracle 的隱性負債四年來成長逾 30 倍,達 2,733 億美元,主要來源是與 Stargate 專案相關的資料中心承諾。
這些表外義務自 2022 年以來已成長約 8 倍,融資工具涵蓋資料中心租約、GPU 供應合約及特殊目的載具 (SPV) 。
名詞解釋
特殊目的載具(SPV,Special Purpose Vehicle):企業設立的獨立法律實體,用於隔離特定資產或負債,使其不直接出現在母公司的資產負債表上。
技術會計顧問 Tom Selling 直言:「如果其中一家公司是紙牌屋,靠這種會計處理撐著,那會怎樣?」他將現行財務結構比擬為 2001 年 Enron 崩潰前夕。
社群激辯:必要投資還是即將破裂的泡沫?
HN 社群在 AI 債務議題上呈現鮮明分歧。
支持者認為,這不過是 GAAP 合規框架下的「CFO 101 基本操作」——科技公司開始像傳統資本密集產業一樣使用槓桿,而其千億美元級別的獲利本就足以支撐現有規模。
批評者則指向更根本的結構性問題:科技巨頭互相投資、互相付費,形成封閉的資金循環,讓真實的外部需求幾乎無從分辨。AI 板塊已佔 S&P 500 約 40%,若多家高槓桿公司同步出現流動性問題,波及範圍將遠超科技業本身。
一位 HN 評論者指出,私人信用已滲入部分壽險公司,「這終將成為所有人的問題」——反映出風險傳染路徑已悄然延伸至退休金與保險資產。
可持續性展望:AI 產業的下一步
兩條脈絡在此收斂:Pelicanmaxxing 的無罪證明讓社群暫時鬆了一口氣,但隨即意識到更根本的問題——當連「鵜鶘是否被特訓」這種問題都需要嚴謹統計研究才能釐清,投資人與用戶又如何驗證 AI 能力的真實進步?
表外債務 4 年成長 8 倍、AI 耗電量持續攀升(2025 年已佔全球用電 0.5%),讓整個 AI 投資週期的可持續性疑慮不斷加深。
科技巨頭目前仍享有足夠的信用評等與現金流緩衝,但資料中心租約的「一次性滾入資產負債表」機制,意味著龐大義務只是尚未浮現,而非已被消化。
AI 基礎建設的真正壓力測試,仍在前方等待。
多元觀點
正方立場
表外義務在 GAAP 框架下完全合規,屬於傳統資本密集產業的標準融資操作。科技巨頭擁有強勁的現金流與千億美元級別的年獲利,足以支撐現有槓桿規模。
航空、電信、能源等產業長期以租約與長期合約融資運作,AI 資料中心投資不過是類似路徑。基礎建設需求由真實算力需求驅動,超前布局是合理的競爭策略,而非財務工程。
批評者混淆了「不透明」與「不健康」——GAAP 附注揭露已提供足夠資訊,問題在於市場未主動解讀,而非企業刻意隱瞞。
反方立場
循環投資結構是核心問題:科技巨頭互相投資 AI 新創,後者的收入又以 GPU 採購和雲端費用回流,形成封閉資金迴路,讓真實的外部需求幾乎無法與內部交叉補貼區分。
Oracle 四年負債成長 30 倍、整體表外義務 4 年成長 8 倍,與 Enron 崩潰前「帳面合規但結構脆弱」的狀態高度相似。
最嚴峻的風險是義務的一次性浮現時點:資料中心完工移交時,租約義務才會集中入帳,若屆時外部需求未如預期,將觸發連鎖式流動性壓力,衝擊波及持有 401(k) 的一般大眾。
中立/務實觀點
爭論雙方都指向同一個根本問題:資訊不對稱。現行 GAAP 框架雖合規,卻讓外部投資人需要逐行解讀財報附注才能拼湊出真實風險敞口,一般投資人根本難以做到。
解方不在於宣判 AI 泡沫或否認風險,而在於建立更完整的表外義務揭露標準——正如 2002 年薩班斯-奧克斯利法案回應 Enron 教訓所做的事。
Pelicanmaxxing 爭議的同一個教訓在財務領域重現:需要系統性的第三方驗證機制,而非仰賴市場直覺自我糾錯。
實務影響
對開發者的影響
Pelicanmaxxing 研究提醒:非正式社群基準的觀察偏差可能遠超想像。單一 prompt 的亮眼表現,更可能反映訓練資料的分布特性(如攝影慣例讓自行車圖片普遍朝右),而非刻意的針對性調教。
評估 AI 模型時,應優先參考有完整方法論披露的系統性測試,而非依賴社群的驚嘆號式分享。
對團隊/組織的影響
AI 供應商的財務穩定性,正成為採購決策的新風險維度。表外負債結構意味著即使帳面健康,特定流動性情境下仍可能出現服務中斷或合約重談。
企業 AI 策略應納入供應商集中度管控,避免核心業務單點依賴於槓桿程度極高的 AI 基礎建設提供者。
短期行動建議
- 要求 AI 工具供應商提供獨立第三方能力評測報告,而非僅依賴官方基準數字
- 追蹤主要 AI 供應商的信用評等變化與年報中的表外義務揭露趨勢
- 規劃雙軌 AI 供應策略,降低對單一平台的過度依賴
社會面向
產業結構變化
AI 基礎建設投資的槓桿化,正在重寫 AI 產業的風險分布。過去科技公司以「輕資產、高毛利」著稱,如今 Oracle 的隱性負債規模已超越許多傳統重工業企業。
這種轉變尚未反映在多數投資人的估值框架中,科技股的「債務輕型」溢價面臨重新定價的壓力。
倫理邊界
Pelicanmaxxing 爭議與表外負債問題,揭示了 AI 產業的雙重透明度危機:基準測試可能被「優化」,財務報表可能被「架構」。
兩種形式都指向相同的資訊不對稱困境——外部評估極為困難,「市場自我糾正」的前提愈發脆弱。
長期趨勢預測
若 AI 基礎建設繼續以當前速度擴張槓桿,監管機構介入財務披露標準的機率將大幅提升。歐盟已有相關動作,美國 SEC 也可能針對科技公司表外義務設立新的揭露要求。
與此同時,AI 能力評估的標準化壓力持續增加,推動更嚴謹的第三方基準測試機制——讓 Pelicanmaxxing 式的社群質疑能以更低成本得到解答。
唱反調
Pelicanmaxxing 反駁研究僅涵蓋 SVG 這一項任務類型,並不能排除其他任務或基準測試上的針對性優化行為
表外負債在 GAAP 框架下完全合規,用 Enron 比喻可能過度渲染恐慌,忽略了科技巨頭相較 Enron 更強健的現金流與多元收入結構
社群風向
如果我在管理這些大型 AI 公司,我會撥出一個小團隊來製作並發布一個鵜鶘專屬模型,明確為此任務訓練——做出史上最棒的 SVG 鵜鶘生成模型,就為了好玩。
說公平話,當我在相關問題後看到這種語言模式,並不覺得這是 AI 的破綻。LLM 使用這種模式時,往往是先設立稻草人再打倒它。
鑑於 AI 高管們過去幾年小心翼翼地對川普大加讚揚(並奉上大筆現金),我猜政府紓困不會被排除在選項之外。
我原本理所當然地以為 AI 實驗室在做 pelicanmaxxing,為了在 Simon Willison 的非正式基準上拿高分。但結果是我的憤世嫉俗這次罕見地落空了。
忍不住讓 OpenAI Codex 為每種模型和推理強度的組合各畫了一隻鵜鶘——我確實覺得 gpt-5.4 xhigh 的結果最好,那隻鵜鶘嘴裡還叼著一條魚!
炒作指數
行動建議
用多種動物與交通工具組合測試你常用的 AI 模型 SVG 生成能力,建立個人小型基準,取代主觀印象式評測
建立 AI 供應商財務健康追蹤表,定期比對表外義務揭露與信用評等變化,納入採購風險評估矩陣
追蹤 SEC 和歐盟對科技公司表外負債的披露要求動向,以及獨立 AI 能力評測機構的崛起進展