重點摘要
鵜鶘退休了,但 AI 圖像生成的品質問題還沒解決
Karpathy 用《魔戒》3D 世界宣告鵜鶘基準過時,引發社群激辯:Three.js 成果究竟代表空間推理突破,還是只是對豐富訓練範例的模式匹配?
AI 無法有效感知自身的視覺輸出,需「費力截圖」監控進度;腳踏車結構錯誤在 SVG 測試中持續出現,反映空間推理的真實局限至今未解。
研究顯示各大 AI 實驗室並未針對性「刷鵜鶘題」,進步是廣譜的;下一個質的突破需要 AI 獲得真正的視覺感知閉環能力,而非更大的 token 消耗。
前情提要
章節一:Pelican 是什麼——Karpathy 的 AI 圖像生成實驗
2024 年 10 月,開發者 Simon Willison 設計了一個看似荒誕的非正式基準測試:要求 AI 生成「一隻騎腳踏車的鵜鶘」SVG 圖像。這個測試的設計精準觸碰了 AI 的多項核心弱點——SVG 語法正確性、動物解剖結構理解、空間構圖推理,以及在缺乏明確訓練資料的情境下生成創意內容的能力。
2026 年 8 月 2 日,Andrej Karpathy 在 X 平台發文,宣告這個時代正走向終結。他展示了用 Claude Opus 5 將《魔戒》開場段落渲染成互動式 3D 世界的實驗:約 2 小時生成 5,500 行 Three.js 程式碼,消耗近 100 萬 tokens(費用約 $10 美元),並透過 ElevenLabs API 加入旁白音效。
這個宣言在 Hacker News 引發 421 點、333 則留言的熱烈討論,成為 AI 基準測試進化史上的一個標誌性時刻。研究人員也在同期對 7 個前沿模型進行系統性評估,測試 48 種動物與交通工具組合,共生成 1,008 張 SVG,為這場論辯提供了量化基礎。
章節二:社群評價兩極化——「沒有實用場景」vs「技術前瞻」
Karpathy 的展示立即在社群引發截然不同的解讀。支持者 jmugan 認為新測試方向「揭示了對物理世界的理解能力」,比靜態 SVG 基準更能區分模型的真實能力;maxutility 則指出鵜鶘測試已「飽和」——現在的模型不再出現災難性失敗,舊基準已失去區分意義。
質疑聲浪同樣強烈,且涵蓋不同層面的批評。HarHarVeryFunny 直指 Three.js 演示「主要展示的是代碼生成能力,而非更廣泛的推理能力」;throwatdem12311 則從遊戲設計視角提問:「如果目標不是讓遊戲有趣,那根本就沒有意義。」
最尖銳的批評來自 YmiYugy,他直接點出輸出品質的核心問題:這類 AI 插圖的品質差到難以想像任何實際應用場景。這場辯論的本質,是社群對「技術可行性展示」與「實際能力進步」之間如何劃界的根本分歧。
章節三:AI 插圖的品質瓶頸與技術限制
技術面的分析揭示了一個關鍵不對稱性:Three.js 比 SVG 更容易被 LLM 產出,但原因不在於 AI 空間推理更強。Three.js 擁有極為豐富的官方範例,包括 Minecraft 渲染器和第一人稱射擊遊戲演示,模型能從這些已知模式推理,而非真正理解三維空間幾何。
SVG 的挑戰更能暴露 AI 的真實局限。研究數據顯示,AI 繪製鵜鶘身體的能力確實逐年進步,但「腳踏車仍然是個難關」——鏈條走向錯誤、鑽石車架缺失、叉管偏移不正確等問題持續出現,這些都需要真正的座標空間推理,而非模式匹配。
名詞解釋
SVG(Scalable Vector Graphics) :可縮放向量圖形格式,以 XML 描述圖形幾何位置,需要明確的座標空間推理——正因如此比有豐富文件範例的 Three.js 更難被 LLM 正確生成。
Karpathy 也坦承 AI 自我審核存在根本瓶頸:LLM 無法有效感知它所生成的影片或遊戲內容,必須「費力截圖」才能監控自身進度,導致輸出品質難以穩定提升。這個感知迴圈的缺失,是目前 AI 圖像生成品質上限的核心技術障礙。
章節四:從實驗到實用——AI 圖像生成的下一步
從鵜鶘 SVG 到《魔戒》3D 世界,基準測試的演進軌跡反映了 AI 能力邊界的真實移動。至 2026 年,測試重點已從靜態圖形生成轉向推理模型、多模態能力與代理式迭代精煉。值得注意的是,研究數據顯示各 AI 實驗室並未針對鵜鶘基準進行特定優化,所謂的「pelicanmaxxing」現象並不存在——進步是廣譜的,而非針對性刷題的結果。
實用性的缺口仍然存在。vanjajaja1 的觀察提示了一個重要面向:Karpathy 的 LOTR prompt 本身並不特別,社群成員使用相似 prompt 也能得到類似甚至更好的結果,意味著成本門檻與可重現性都是值得考量的現實因素。
下一步的關鍵突破,可能不在於更長的 context 或更大的 token 消耗,而在於解決 AI 的視覺感知閉環問題——讓模型能真正「看到」並理解自己的輸出,形成有效的迭代精煉迴圈,而不是盲目一次性生成。這個方向,將是 AI 圖像生成從「有趣的實驗」走向「可靠的生產工具」的核心挑戰。
多元觀點
正方立場
Karpathy 的實驗代表了 AI 能力正在跨越質的門檻。舊有的鵜鶘 SVG 基準已「飽和」——不再有災難性失敗,失去了區分不同模型能力的意義。
新的測試方向(互動式 3D 世界、代理式迭代生成)更能揭示模型對物理世界的理解能力,以及在長時間複雜任務中的穩定性。jmugan 等研究者認為,這類展示比靜態圖形測試更能反映 AI 的真實推理深度,是基準測試必要的進化。
反方立場
批評者指出,Three.js 的成功主要源於函式庫擁有極為豐富的官方範例,LLM 本質上是在做模式匹配,而非真正的空間推理。HarHarVeryFunny 的觀察一針見血:這些演示展示的是代碼生成能力,不是更廣泛的推理能力。
更根本的問題是 YmiYugy 提出的品質疑慮——AI 圖像輸出的品質仍然不足以支撐任何可想像的實際應用場景,炫技式 demo 無法掩蓋這個事實。throwatdem12311 也補充:若輸出無法帶來實際使用價值,技術展示本身就失去意義。
中立/務實觀點
最務實的框架是區分兩件事:代碼生成能力(Three.js 場景)與空間推理能力(SVG 座標精確性)。前者因豐富訓練資料而進步顯著,後者仍面臨根本性的感知閉環問題,兩者不應混為一談。
研究也顯示各 AI 實驗室並未針對性「刷鵜鶘題」,進步是廣譜的。對開發者而言,實用建議是:把 AI 圖像生成視為創意起點而非最終交付物,在有豐富範例支撐的框架內使用,並對人工後處理保持預期。
實務影響
對開發者的影響
開發者需要明確區分 AI 圖像生成的適用場景與局限。Three.js 等有豐富文件支撐的框架,AI 能快速生成可運行的原型;但需要精確空間推理的 SVG 插圖或自訂視覺設計,仍需大量人工後處理。
把 AI 生成物視為「草稿」而非「成品」的心態調整,能避免對工具能力的錯誤預期。在有豐富訓練範例的框架內使用 AI 生成,是目前成本效益最高的策略。
對團隊/組織的影響
若評估將 AI 圖像生成引入產品流程,需謹慎區分「可接受原型」與「可直接上線成品」之間的差距。目前 AI 生成的 3D 或插圖內容較適合作為創意起點、內部原型或低保真度展示,而非需要精確度的正式視覺資產。
成本評估也需納入實際數字:100 萬 tokens 生成一個「有趣但參差」的 3D 場景,換算成本效益需要具體場景支撐,否則不建議作為常態工作流程。
短期行動建議
- 在 Three.js 或 WebGL 框架下試驗 AI 輔助 3D 原型生成,測試自身工作流程的整合可能性
- 若需要 SVG 插圖,嘗試多輪視覺反饋流程:生成→截圖→請模型修正,比一次性生成更能提升品質
- 追蹤多模態模型視覺感知能力的發展,這是解決品質上限的關鍵技術方向
社會面向
產業結構變化
AI 基準測試的演進,正在改變評估 AI 能力的社群標準。從「能否完成任務」到「完成品質是否實用」,這個轉變意味著業界對 AI 的期望值正在提升,單純的可行性展示不再足以代表有意義的突破。
研究顯示各大 AI 實驗室並未針對性優化特定基準,反映了廣譜能力提升的現實,而非個別刷題的結果。這也意味著 AI 能力的進步正在趨於系統性,而非點狀的。
倫理邊界
Karpathy 實驗消耗約 $10 美元和 2 小時生成一個「有趣但參差」的 3D 世界,引發了資源消耗與實際產出價值之間比例的質疑。當大量 token 消耗換來的是炫技式演示而非可靠的生產工具,如何評估 AI 研發資源的分配優先序,是個開放的產業倫理問題。
長期趨勢預測
短期內,AI 圖像與 3D 生成仍將依賴豐富的訓練範例和 context 學習;中長期的關鍵突破點在於視覺感知閉環能力——讓模型能夠真正「看到」並迭代修正自身輸出,而非盲目一次性生成。
一旦這個瓶頸突破,AI 圖像生成才有可能從「有趣的實驗」演進為「可靠的生產工具」,Karpathy 所預示的新時代才會真正落地。
唱反調
Three.js 範例的豐富程度決定了 LLM 的上限,而非模型的空間推理能力——換言之,Karpathy 展示的可能只是「記憶匹配」而非「空間理解」,用更難的 3D 框架測試只會換來同樣的幻覺。
消耗 100 萬 tokens 和 2 小時生成一個「參差不齊但有趣」的 3D 世界,換算單位產出成本,目前仍難以與專業 3D 設計師的效率競爭,炫技式 demo 不等於商業可行性。
社群風向
依我個人看法,輸出品質差到我無法想像這類插圖有任何實際應用場景。
快速瀏覽一下 Three.js 範例頁面就能明白為什麼 LLM 這麼容易生成像樣的 Three.js——這個函式庫文件極為完整,包含 Minecraft 渲染和第一人稱射擊遊戲演示。一到兩年前 Twitter 上 Three.js 氛圍感程式碼開始爆紅時,我就沒特別驚訝,因為我知道它在做什麼。
我希望如果你在製作一款遊戲,目標應該是讓它好玩!如果這不是重點,那根本就沒有意義。
他說 prompt 是《魔戒》的第一段,但沒提到有前置說明。有人似乎用了同樣的想法,得到了類似甚至更好的結果,所以 prompt 本身可能並不特別。
AI 基準測試系統是在浪費時間,開發者們正在自行設計測試。我最喜歡的一個:「騎腳踏車的鵜鶘」SVG 測試。聽起來荒謬,但它實際上在測試空間推理、解剖學知識,以及 AI 能否畫出腳踏車車架(顯然非常困難)。
炒作指數
行動建議
在 Three.js 或 WebGL 框架下試驗 AI 輔助 3D 原型生成,測試是否能融入自身創意工作流程——這類有豐富官方範例支撐的框架,是目前 AI 圖像生成成本效益最高的切入點。
若需要精確 SVG 插圖,嘗試加入多輪視覺反饋步驟:生成→截圖→請模型修正,比一次性盲目生成更能彌補 AI 感知閉環的缺陷,提升最終品質。
追蹤多模態模型的視覺感知迴圈能力發展——當 AI 能真正「看到並修正」自身輸出時,才是 AI 圖像生成品質突破的真正節點,也是評估是否導入生產流程的關鍵訊號。