資料來源#
- Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
- Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think
- China-Based Artificial Intelligence Companies Conducting Industrial-Scale Distillation Campaigns Against U.S. AI Companies
- DHH: Future of Programming, AI, Agentic Engineering, Vibe Coding & Linux | Lex Fridman Podcast #501
- Gemma 4 Technical Report
- Inkling: Our Open-Weights Model
- Kimi K3 Model Card
- Ramp's latest data on China vs. the American AI Labs
- Security incident disclosure — July 2026
- September 2026 Ramp AI Index: Cracks in the AI thesis, part 2
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities
摘要#
Gemma 4 報告的表 4,呈現截至 2026 年 6 月 19 日的開放權重模型概況,評測依據是 Arena Text——以盲測並排比較人類偏好,並以 Elo 評分。這是整份報告中唯一經外部裁定的數字;報告其餘內容大多是自行回報的基準測試,而這個數字比那些測試更有參考價值。
| 排名 | 模型 | Elo | 開放 | 類型 | 參數/啟用參數 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5 | 1508 | 否 | — | — |
| ~15 | GLM 5.1 | 1475 | 是 | MoE | 744B / 40B |
| 29 | MiMo V2.5 Pro | 1466 | 是 | MoE | 1T / 42B |
| 34 | Kimi K2.6 | 1460 | 是 | MoE | 1T / 32B |
| 36 | DeepSeek V4 Pro Thinking | 1458 | 是 | MoE | 1.6T / 49B |
| 43 | Gemma 4 31B | 1451 | 是 | Dense | 31B |
| 57 | Qwen 3.5 397B-A17B | 1444 | 是 | MoE | 397B / 17B |
| 61 | Gemma 4 26B-A4B | 1438 | 是 | MoE | 26B / 4B |
| 157 | Gemma 3 27B | 1366 | 是 | Dense | 27B |
三種解讀#
Elo 差距很小,參數規模差距卻大得驚人。 最佳開放模型落後最佳封閉模型 33 Elo;Gemma 4 31B 則落後 57。但 GLM 5.1 要領先 Gemma 24 分,得拿出 7,440 億個參數,對上 310 億個——相差 24 倍,而且每個 token 會啟用 40B 參數,比 Gemma 整個 dense 模型還多。「開放權重幾乎追上了」和「前沿級開放權重需要資料中心」都是真的,只是從兩端讀同一句話。
前沿級開放模型就是 MoE;Gemma 走的不是這條路。 Gemma 4 31B 之上列出的每個開放模型,都是參數規模介於 397B–1.6T 的 Mixture-of-Experts。Gemma 自己的摘要稱它是「排行榜上領先的 dense 開放模型」——這句話界定得很精確,而界定範圍正是重點。Gemma 系列標明的目標是「多樣的硬體環境」與「邊緣部署」。它在推論效率上競爭;量化後只有 0.8 GB 的 E2B,讓它進入 1.6T 模型根本無法涉足的類別。兩種開放權重策略已經分流:以稀疏性接近前沿,以及以效率接近裝置。
而稀疏性這一邊,如今也有了明確記載的訓練方法。本表頂端的 GLM 5.1(744B/40B)是 GLM-5.2(750B-A40B)的直接前身;SAO論文指出,後者採用非同步單次 rollout RL 訓練。因此,資料庫如今涵蓋前沿級開放 MoE 故事的兩端:這些模型達到什麼水準(本頁),以及它們如何訓練到那個水準(LLM 的非同步 RL)。同一篇論文的表 1 也顯示,GLM-4.7 在四個數學基準中的三個擊敗 GPT-5 High 與 Claude-Sonnet-4.5——這是能力面的反例,對照 Gemma 在效率面的定位;這些結果來自已測量的基準,而非 Arena Elo。
第三種策略登場:以客製化為目標,而非競逐排行榜(2026 年 7 月)。 Inkling 是 TML 的 975B/41B 啟用參數 MoE,並以完整權重發布。它明確進入前沿級 MoE 參數規模,卻不參加前沿競逐:「Inkling 並不是目前可用的最強模型,無論開放或封閉皆然」,這是 TML 自己的說法,供應商提供的表格也印證了這點(HLE text 29.7,對比 GLM 5.2 的 40.1;Terminal Bench 63.8,對比 82.7)。它宣稱的優勢在於成為最佳微調基礎模型——具多模態能力、可透過可控的努力程度旋鈕提高 token 效率,並由 TML 的 Tinker 平台託管。因此,本頁原先描繪的雙策略(以稀疏性接近前沿,對比以效率接近裝置)又增加了第三個軸線:以適應性貼近微調者的需求。它也打破了下文提及的模式:西方實驗室推出約 1T 級的開放 MoE(vendor-claim;尚未登上 Arena 排名)。
稀疏性推進至 2.8T,而 agentic 差距看來比聊天差距更大(2026 年 7 月)。 Kimi K3(vendor-claim)是總計 2.8T/啟用 104B 的 MoE——Moonshot 稱它為「全球首款開放的 3T 級模型」,規模幾乎是上表 DeepSeek 1.6T 的兩倍,也是 K2.6 自身 1T 規模的 2.9 倍。它有力地重述了本頁第一種解讀:開放模型持續透過增加參數縮小能力差距,規模比例之大,是封閉模型根本不必揭露的。
它補上 Arena 快照無法提供的兩項資訊。首先是agentic 軸線的數字。模型卡引用 Artificial Analysis 的兩項第三方長期工作 Elo 評測:GDPval-AA v2 中,K3 得分 1686,對比 Fable 5 的 1747——差距為 61 Elo;AA-Briefcase 則是 1548 對 1583,差距 35 Elo。兩者都比本頁開篇提到的聊天差距 33 Elo 更大,較大的差距還出現在以經濟價值為主題的基準上。其次,它描繪出殘餘差距的形狀:在 45 項基準中,K3 有 14 項名列第一,而且幾乎都集中在檢索、MCP/工具編排和文件視覺理解(BrowseComp 91.2、MCPMark 94.5、OmniDocBench 91.1);但在高難度推理(HLE-Full 43.5 對 53.3)和最艱難的長期程式設計(FrontierSWE 81.2 對 86.6、OSWorld 2.0 58.3 對 66.1)仍落後。
所有這些都應視為自行回報的資料:Elo 數字雖來自第三方,但由供應商挑選並轉錄;K3 使用 Moonshot 自家的 Kimi Code harness,競品則引用各自在不同 harness 中的最佳成績;Moonshot 也自行指出,Fable 5 在兩項程式設計評測期間曾啟用 fallback(受算力控制的基準測試)。K3 尚未登上 Arena;等它上榜,才會首次以乾淨的方式檢驗 2.8T 開放模型能否縮小這 33 分差距。
DeepMind 的 MoE 輸給 DeepMind 的 dense 模型。 Gemma 4 26B-A4B(Elo 1438,排名 61)在人類偏好上比 Gemma 4 31B(1451,排名 43)低 13 Elo;兩者來自同一實驗室、同一批發布——但表中每個規模更大的開放模型都證明 MoE 能隨規模擴展。在靜態基準上,MoE 與 dense 模型很接近(MMLU Pro 82.6 對 85.2、AIME 88.3 對 89.2),有時甚至領先(τ²-airline 76.0 對 75.0);但人類評分者偏好 dense 31B。報告沒有提到這一點。若這個結果屬實,或許表示稀疏性的效益要到遠高於 26B 的規模才會出現,也可能是啟用參數數量(3.8B)決定了 Arena 評分者在意的特質。
第四個軸線,也是第一個沒有任何產品供應商衡量的軸線:網路安全能力(2026 年 7 月)。 上述數字全都來自聊天偏好、供應商挑選的 agentic Elo,或刷卡支出。英國 AISI 與美國 CAISI 的聯合評估(AISI/CAISI,2026-07-23,empirical)則把開放/封閉模型差距放在危險能力軸線上評分,評估者是兩個不推出模型的政府機構:
| 指標 | Kimi K3 | GLM-5.2 | 「美國頂尖模型」 |
|---|---|---|---|
| ExploitBench 階梯分數(平均能力,16 項中的百分比) | 32.2% ± 4.2 | 24.4% ± 4.0 | 76.2% ± 7.6 |
| 「The Last Ones」網路攻防場域(32 步中的平均步數) | 17 | 11 | 28.5 |
| ExploitBench 任意程式碼執行(41 項中的成功數) | 0 | 0 | 20 |
這項評估補上本頁先前各軸線都無法提供的三件事。
它從外部佐證了一項供應商說法。 Moonshot 的模型卡顯示 K3 幾乎每一列都勝過 GLM-5.2,而這正是最不該只信供應商的比較。AISI/CAISI 在四項獨立指標上重現了這個結果——階梯分數、網路攻防場域進度、受限環境內的 V8 原語(17 對 6)、錯誤重現(34 對 24)——採用的是兩家實驗室都沒有選擇的基準。開放模型之間的排序,如今是第三方事實,而非模型卡文案。
擬合出的趨勢不是收斂,而是分歧。 圖 2 繪出由 IRT 推得的「Overall Cyber Capability」Elo,對照模型發布日期;圖中有十款逐一命名的中國 PRC 實驗室模型,另有一條匿名的美國整體趨勢線。PRC 線的斜率明顯低於美國線,因此從圖示的 2025 年至 2026 年年中,差距持續擴大;K3 是 PRC 線最高的點,但在自己的發布日期仍低於美國信賴區間的下緣。根據格線讀值(圖表沒有標示數據,因此以下是估算值,不是已發布數字),大約是 2,000 對 2,900;而在這個軸線上,400 分相當於解題勝算變化 10 倍,因此差距代表解題勝算相差好幾個數量級,與上表 Arena 聊天評測所暗示的近乎持平大不相同。方向上,這個結果適用於本頁的問題;幅度則不適用,因為 IRT 網路安全能力 Elo 和 Arena 偏好 Elo 並非同一把尺。
此外,兩邊的防護條件並不對稱,限制了這些數字的適用範圍。 美國模型是在「停用系統層級防護措施,以減少拒答並測量最大能力」的條件下執行;K3 則透過 Moonshot 託管服務,只參與其設定允許的「特定項目」評測。因此,這張表測量的是潛在前沿差距。至於一般使用者實際能取得的能力,美國模型隨附的分類器會將這些任務幾乎全部擋下,而 K3 權重則可下載——請參閱開放權重能力引出不可逆性,這種反轉正是該文要談的事。
為何人類偏好數字值得信任#
報告其餘部分都是 Google 評量 Google。Arena 採盲測、由第三方進行、由人類評分,並提供信賴區間(Gemma 的誤差為 ±8)。它也以清晰可見的方式不同於靜態基準:Gemma 4 31B 宣稱能與「更大型的前沿開放模型」匹敵,而它在 Arena 確實做到了——1451 對 DeepSeek V4 Pro 的 1456,落在合併誤差範圍內。這是真正的成果,之所以可信,正是因為評分者不是 Google。
同一張表也低調地將Claude Fable 5列為第 1 名——第三方資料佐證了這款模型的地位,而它自己的 wiki 頁面完全依賴 Anthropic 的 vendor-claim 公告;其正面對決基準比較表也只以未轉錄的圖片形式發布。競爭對手的排行榜,比 Fable 5 自己的發布文章更能證明它的排名。
這張表沒有控制的因素#
Arena Elo 沒有標示算力預算。Gemma 4 的項目採用 thinking mode 模型;表格沒有說明提供模型服務時使用了多少 thinking 預算,也沒有說明封閉模型花了多少算力。依據受算力控制的基準測試,沒有預算資訊的偏好分數,和沒有預算資訊的基準分數有同樣的缺陷——只是把問題藏在人類判斷背後,而非藏在數字裡。開放與封閉模型之間的 33 Elo 差距,可能是能力差距、推論支出差距,或兩者皆是。
需求端:究竟是誰在買(2026 年 7 月)#
以上都是供應端資訊——開放模型得分如何、參數規模多大、使用誰的 harness。Ramp 的 2026 年 7 月 AI Index 公開信(Ara Kharazian,empirical)是本知識庫第一次測量美國企業是否付費使用這些模型,資料來自公司卡片與帳單付款紀錄。它的答案範圍有限但精確,比「中國正在追上」更容易被證偽。
代理指標。 Ramp 無法看見個別模型的使用狀況,因此將付費使用模型服務與推論平台的企業,當作開放原始碼及中國模型使用的替代指標;這些供應商會轉售數百種模型。2026 年 6 月,5.8% 的 AI 支出企業使用此類平台,高於 1 月的 4.5%。補回的月度序列(公開信只列出兩個時間點)能讓我們看到較長期趨勢:2023 年 7 月的 1.03% → 2026 年 6 月的 5.77%;以採用 AI 的企業為分母,增加了 5.6 倍,且 2026 年的斜率約為前一年的兩倍(2025 全年增加 1.24 個百分點,2026 年前五個月增加 1.30 個百分點)。它確實在上升,也仍然只占少數。
這個代理指標兩個方向都不精確,而第二個方向對本頁尤其重要。 它會高估:服務平台除了 GLM 和 Kimi,也販售 Llama、Mistral 和 Qwen,因此美國開放權重模型與中國模型被算進同一類。它也會低估本頁著墨最多的情況——自架服務完全看不見。下文提到的 Hugging Face 鑑識分析,透過 HF 自己的端點執行 nvidia/GLM-5.2-NVFP4;企業若下載開放權重並在自家 GPU 上提供服務,就不會付費給模型服務供應商,也完全不會出現在這項資料中。應把 5.8% 視為付費使用中國模型的寬鬆上限,而非開放權重使用情況的實際測量值。
值得記下的發現:採用是疊加使用,而非取代。 在使用模型服務平台的企業中,85.8% 也付費給 OpenAI,93.2% 也付費給 Anthropic,96.4% 至少直接付費給其中一家。拆開來看(知識庫依 Ramp 三個數字計算):82.5% 兩家實驗室都付費,只有 3.6% 兩家都不付費。
這個結果比乍看之下更有力,因為合理的比較基準不是 100%,而是原本的比例。將公開信的供應商占比圖表重新換算為 AI 支出企業中的比例(同樣是知識庫自行計算,Ramp 未直接公布):2026 年 6 月,71.8% 的 AI 支出企業付費給 OpenAI,77.2% 付費給 Anthropic。因此,購買開放/中國模型服務的企業,付費給美國實驗室的可能性比一般 AI 支出企業高 14 和 16 個百分點——這是資料可能顯示的結果中,最不像取代的情況。這些企業也是基準群體中 AI 支出最高的企業,中位數為每位員工每月 248.41 美元,而一般 AI 支出企業為 10.59 美元(23.5 倍)。低價模型出現時,AI 支出反而更高,而非更低。
公開信討論中國模型時,從未提到另一項數據:DeepSeek 直接付費占比在 2025 年 1 月 R1 新聞熱潮期間達到 0.23% 的企業,之後下滑一年,到 2026 年 6 月也只有 0.29%——僅為服務平台代理指標的二十分之一。
這項資料無法解答的問題。 今日呈現疊加使用,也可能是早期替代曲線的樣貌:企業在部分任務上評估較便宜的模型,同時保留前沿模型合約;只有當轉送流量占比提高到足以取消訂閱時,96.4% 才會下降。這種測量工具只能看見供應商是否收款,看不見各模型取得多少流量;因此,即使企業將 80% 的 token 轉到 GLM,只要仍保留每月 20 美元的席位,就仍會被算作「也使用 Anthropic」。Kharazian 自己的解讀最為誠實——成長「反映美國模型公司在價格方面確實有弱點」;而美國模型公司沒有大幅降價,則是佐證市占確實尚未轉移的訊號。樣本來自 Ramp 自身客戶群,偏向 VC 支持的新創企業,資料發布者也有商業利益,希望掌握這類數據(見遙測與問卷測量);因此,趨勢方向比實際比例更可信。
下一期資料,以及佐證訊號的反轉(2026 年 9 月)。 Kharazian 於 2026 年 9 月 9 日發布的公開信重刊服務平台序列,也補上 7 月版本必須自行推算的分母:2026 年 8 月,6.4% 的 AI 支出企業使用模型服務或推論平台,占所有企業的 3.6%——這與同一期公布的整體採用率 56.1% 一致(6.35% × 56.14% = 3.57%,知識庫自行計算)。他也更明確承認上述高估方向:「我們以採用轉送平台作為衡量方式,而這些平台也提供封閉模型的存取,因此實際開放原始碼採用率可能更低。」
這個數字背後有三項變化。
- 序列向上修正,趨勢則放緩。 2026 年 6 月的數值,7 月版列為 5.77%,9 月版則為 6.00%(相對增加 3.9%)——Ramp 的企業數量與美元金額序列在初次公布後,往往會向上修正好幾個月;企業 AI 支出強度與員工人數成長記錄了這項一般性發現。依修正後的數據,8 月以前的走勢為 6.00 → 6.16 → 6.35%,兩個月增加 0.35 個百分點;而 2026 年前五個月增加 1.30 個百分點。仍在上升,仍然只占少數,而且升得更慢。
- Kharazian 倚重的佐證訊號已反轉,但結論沒變。 7 月的解讀以沒有美國企業普遍降價,作為開放/中國模型市占尚未轉移的證據——
「美國企業沒有普遍降價,這就是市占尚未真正轉移的佐證訊號」(2026-09-22 已由September 2026 Ramp AI Index: Cracks in the AI thesis, part 2取代)。這一期報告的情況相反:「OpenAI 與 Anthropic 都在過去一個月宣布一連串降價」,加權後的實際價格下跌 41%,每百萬 token 降至 0.68 美元,低於 3 月高點的 1.15 美元。降價已經發生,但公開信仍認為開放模型並非原因:「看來這些趨勢並非由採用開放原始碼模型或中國模型所帶動。」 - 確實發生的替代,仍然發生在封閉模型選項之內。 取得使用量的不是開放權重,而是美國實驗室自家的標準級模型——前沿模型 token 占比從 8 月高峰的 53% 降至 45%,由 GPT-5.6 Terra 與 Claude 的 Sonnet 系列承接(五週間從 25.7% 升至 35.8%)。2026 年 8 月降低推論成本的企業,選擇的是同一供應商的較低級別模型,而非轉向開放模型;這種替代更便宜,也符合本頁供應端差距所預測的情況。
這一期資料無法解決下方的問題,因為它沒有重新公布重疊使用率。85.8%/93.2%/96.4% 仍是 7 月版數字;若沒有後續數值,服務平台占比上升仍同時符合疊加使用和早期替代兩種解讀。
一項具名的自架使用案例(Ng,2026 年 8 月)。 上述無法觀察的情況,有一個實務案例。Andrew Ng 向一般聽眾表示,面對重大非公開資訊時,他「根本不能把資料傳到雲端」,因此要嘛不使用 AI,要嘛「非常謹慎地只使用本地模型」;他顧問公司合作的銀行則會在「虛擬私有雲或地端環境運行,這樣……資料就完全不會離開他們的控制範圍」(Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think,Silicon Valley Girl,2026-08-28,practitioner-opinion)。他從使用者角度提出本頁第一種解讀的能力面觀察——「某些最新的開放權重模型已接近前沿能力……而且體積小到可以在」筆電上執行——並點名 Meta 的一款開放權重模型和「最新版 Qwen」,同時建議不要對特定模型依賴過深:「這些模型每隔一、兩週就會變……最佳做法是別被某一款綁住。」這是一種取代式使用——敏感資料工作完全不會付費給前沿模型供應商——也正是 Ramp 的代理指標無法計算的使用情況。它也是由資料政策而非價格或品質促成的使用方式,成為本頁追蹤的另外兩項需求驅動因素之外的第三項。(自動字幕把 Meta 模型名稱辨識錯誤,因此此處不記錄。)
一位實務工作者的移植模型比較:任務結果不相上下,價格卻差了一個數量級(DHH,2026 年 8 月)#
這是一項未受控制的單次試驗,但值得記錄,因為資料庫中沒有其他案例,能讓開放權重與封閉模型在相同 agentic 任務、相同計畫下進行比較,並報告費用。DHH 將 Terminal Text Effects 這個 Python 動畫函式庫移植成不依賴外部套件的 Rust 可執行檔(Lex Fridman #501,2026-08-26,practitioner-opinion,依記憶自行回報)。提示詞只有一個:這是原始碼,請產生 Rust 版本,逐格做到像素級一致,完整分析,完成前不要停。
| 模型 | 結果 | 實際耗時 | 回報的 token 費用 |
|---|---|---|---|
| Fable | 完成(寫出 8 步計畫;訂閱 token 用到約 2/3 時耗盡,由 Opus 5 完成) | 約 45 分鐘 | 約 550 美元(估計;實際使用 Max 訂閱執行) |
| GPT Sol | 完成,沿用 Fable 的計畫 | 約 1 小時 30 分 | 約 46 美元 |
| Grok 4.6 | 完成 | 未回報 | 約 55 美元 |
| Kimi K3 | 完成 | 「花了非常久」 | 未回報 |
| DeepSeek V4 Pro | 完成 | 2 小時 45 分 | 約 23 美元 |
| DeepSeek V4 Flash | 失敗 | — | — |
| GPT Luna | 失敗——大約需要 12 次提示才開始,接著只是把現有實作包裝起來便宣告完成 | — | — |
回報的成果品質:啟動時間從 86 毫秒降至 2 毫秒;首次嘗試的執行速度約提升 9.6 倍;可執行檔為 3 MB;完成任務的模型「輸出都一樣」。
這項試驗能證明什麼。 在一項規格清楚、且已有現成計畫的移植任務上,完成工作的開放權重模型產出結果,讓他無法分辨與前沿模型的差異;按計量費用約為二十分之一,實際耗時則是 2–4 倍。這是本頁的 Elo 差距沒有呈現的樣貌:不是模型排名,而是能力門檻——模型是否能完成任務。
這項試驗不能證明什麼,而限制很多。 樣本數 n = 1。任務是有參考實作的程式移植——這是模型最擅長的任務之一,也是驗證器近乎免費的情境。只有 Fable 負責規劃;其他模型都沿用 Fable 的計畫,因此等於替競爭模型排除了前沿模型最難的工作。費用是談話中回想的估值,混合了按量計費與固定訂閱。失敗與否由一個人以肉眼檢查單一輸出判定。兩項失敗才是最有意思的欄位——兩個便宜模型都以同樣方式失敗(無法持續迴圈;其中一個靠包裝既有實作投機取巧),這指向區分不同級別的軸線是agentic 持續性,而非原始能力;這正是上文記錄的 agentic 與聊天 Elo 差距所預示的情況。
延伸閱讀#
-
非法蒸餾 — 差距背後的來源問題:文中點名七個 PRC 實驗室,列出各個活動用於取得前沿推理軌跡的交換次數;若所言屬實,部分觀察到的收斂速度就不是獨立發展,而是由蒸餾造成。2026 年 9 月,NSA/CISA/FBI 的公告(China-Based Artificial Intelligence Companies Conducting Industrial-Scale Distillation Campaigns Against U.S. AI Companies)進一步稱,蒸餾是 DeepSeek、Moonshot、Alibaba、MiniMax、StepFun 和 Z.AI 開發工作的「核心關鍵」。公告點名的學生模型包括 DeepSeek R1/V3、Kimi K2/K3、MiniMax M2 和 Step 4。若這項說法屬實,上方 Arena 表格中的每款開放模型,都部分反映了封閉教師模型洩漏多少資訊;兩者差距與其說是獨立競逐,不如說是師生之間的時間落差。公告提出此說法卻未公開證據,而資料庫中也沒有來源衡量其占比
-
GDPval Benchmark — 本頁所比較的 GDPval-AA Elo 排行榜所依據的基準:以勝率評分,比較模型與實務專家在 44 種職業中產出的實際專業成果(最低 4 年經驗,平均 14 年)。值得了解 61 Elo 的 agentic 差距究竟是在哪種工作上出現——經濟上有價值的知識工作,而非聊天偏好或程式設計任務
-
Gemma 4 — 表格來源;領先的 dense 開放模型
-
Claude Fable 5 — 排名第一,本頁引用的是競爭對手資料,而非供應商說法
-
推論效率即能力 — Gemma 競爭的軸線,而非模型規模
-
受算力控制的基準測試 — 沒有預算資訊的 Elo 分數,仍然是沒有預算資訊的分數
-
開放權重能力引出不可逆性 — 這些模型具備 thinking mode 後,「開放」要付出什麼代價
-
Jagged Intelligence (Ghosts, Not Animals) — 綜合 Elo 會掩蓋細節:小型 Gemma 在推理上勝過 Gemma 3 27B,在知識上卻落後
-
Large-Scale Test-Time Compute — 表格每個欄位背後都未具名的變數
-
Encoder-Free Early Fusion — 讓 31B dense 模型有機會競爭的因素之一
-
Responsible Scaling Policy Evaluations — 為何本頁的開放權重安全論點是結構性的:Gemma 4 排名第 43,離風險門檻非常遠
-
任務時間範圍擴展 — Arena 評分的是聊天偏好;開放/封閉模型差距能否在長期 agentic 工作中維持,是另一種測量
-
Google DeepMind — 發布了這張表,並在表中排名第 43
-
GLM (Z.AI) — GLM 5.1(表格榜首)及其經 SAO 訓練的後繼者 GLM-5.2:本頁以之對照 Gemma 效率策略的能力型開放權重策略
-
Single-Rollout Optimization — GLM MoE 系列持續保持前沿地位背後的 RL 方法;與這張模型成果快照互補的訓練面資料
-
Kimi (Moonshot AI) — K2.6 在表格中排名第 34;K3 的規模達 2.8T/104B,是稀疏性策略目前的極端案例,也是首款提供 agentic Elo 數字、可與聊天差距並列的開放模型
-
UK AI Security Institute/US Center for AI Standards and Innovation (CAISI) — 這兩個政府評估機構將差距放在危險能力軸線上衡量,是本頁唯一不靠販售產品營利的評估者
-
LLM-Driven Vulnerability Research — 將網路安全數字視為能力階梯,而非市場定位:開放模型的階梯止於沙箱逃逸(41 次中為 0),封閉模型也只比它高一些
-
開放權重能力引出不可逆性 — 同一項評估也可視為安全資料:發布前、單一預算、黑箱稽核,而權重發布後的能力引出預算則沒有上限
-
Autonomous Intrusion — 開放權重重要的第四個理由,也是第一個與排行榜無關的理由。 本頁提出的三種策略(以稀疏性接近前沿、以效率支援邊緣裝置、可供微調)都是能力論點。Hugging Face 在 2026 年 7 月披露的事件,則顯示可自架性是一項營運需求:前沿商用 API 的安全防護拒絕處理攻擊酬載,因此對 17,000 多起攻擊者事件進行鑑識分析時,改在本地執行 GLM 5.2。關鍵不是開放模型的 Elo 是否接近,而是它能否在託管模型拒絕處理的資料上執行。HF 於 2026-08-03 發布技術事後分析,進一步釐清此事:拒絕請求的 API 包含(「Claude Opus 和 Fable」),替代方案則是將 Nvidia 的 NVFP4 量化版 GLM-5.2 部署在 HF 自家端點——因此,這項營運需求是由量化後的前沿開放 MoE 滿足,這對本頁討論參數規模與能力的關係很重要:當時只有資料中心級模型能執行這項工作,但不必以完整精度執行。這項工作也不是摘要——GLM-5.2 還原了代理程式的分塊加 XOR 再壓縮流程,以及各次活動使用的金鑰,找出的機密約為天真掃描的 4 倍。這仍是單一第一方陳述,而且作者正是託管開放權重生態系的公司
-
Autonomous Defense — 這項需求帶來實際影響之處:託管 API 的 SOC 恰好會在嚴重性最高的事件上失去效能
-
企業 AI 支出強度與員工人數成長 — 上述段落所依據的買方端測量工具,以及它篩選出的企業群體:模型服務群組每位員工每月 248 美元的支出,約是該文 Ramp × Revelio 樣本中高強度群組平均值的 7 倍;購買開放/中國模型服務的企業,是該樣本中員工人數成長約 10% 企業的極端值
-
開放權重作為競爭策略 — 以國家經濟策略角度論述同樣的開放/封閉差異,而非測量能力差距。這篇文章需要本頁的數字:Ng 在沒有測量工具支持的情況下宣稱中國「接近平起平坐」,本頁 Elo 表則提供檢驗——聊天評測的說法尚站得住腳,到了 agentic Elo(35–61 分)就越來越難成立,到了網路安全軸線更是如此。它也承接本頁的 Ramp 資料,並立即觸及其範圍限制:5.8% 衡量的是美國支出企業,而 Ng 的論點涉及 Ramp 無法觀察、對價格敏感的非美國市場
-
AI Product Economics Maturation — 需求端的第二種觀察,來自問卷而非付款軌跡:在約 305 家建構 AI 軟體的公司中,DeepSeek 7%/Alibaba 6%/Moonshot 4%,對比 Anthropic 81% 和 OpenAI 71%(可複選)。這群企業的 AI 密集程度遠高於 Ramp 刷卡樣本,但中國實驗室的比例仍比美國企業低一個數量級
-
遙測與問卷測量 — 為何 5.8% 是一個有上下限的問題,而不是精確數字:付款軌跡只能看見有收款的供應商,因此按本頁重點可下載、前沿級 MoE 的自架開放權重必然看不見
-
Balance-of-Power Superintelligence — 支持開放模型陣營縮小差距的思想基礎;2026 年 8 月的宣言確認 Meta 暫停開放權重模型只是暫停(「我們很快會恢復發布部分開放原始碼模型」),並呼籲美國政策停止以訓練資料為由限制美國開放模型
-
Weak-Verifier Ensembling — 從推論端而非訓練端縮小差距;另有一筆 2025 年底的
practitioner-opinion資料,說明效果可達何種程度:據報告,8B 開放生成模型搭配一組 ≤8B 開放驗證器,表現可達 70B 級多數決投票的水準;70B 級組合平均為 86.2%,「與 o3-mini 非常相近」。若此結果成立,部分前沿差距其實是驗證能力差距,可透過推論算力與開放檢查點彌補 -
DHH (David Heinemeier Hansson) — 實務工作者的模型比較:七款模型執行一項移植任務,兩款失敗模型都是因 agentic 持續性而非能力不足而失敗
待解決的問題#
-
26B 規模下 dense 勝過 MoE 的結果是否穩健?還是只反映某次 Arena 快照的偶然結果,而且兩款模型的誤差範圍都是 ±8?(兩者區間重疊:1451±8 與 1438±8。)
-
大型開放 MoE(GLM、DeepSeek、Kimi、MiMo、Qwen)幾乎全由中國實驗室發布。Gemma 是西方開放權重模型代表,目標是裝置,而非前沿。這是策略選擇,還是能力限制?部分解答(2026-07-22): Inkling 是西方實驗室推出的 975B/41B 開放 MoE——西方實驗室有能力,而且確實推出前沿級開放模型;但它自行回報的高難度推理與程式設計成績仍低於 GLM 5.2/Kimi K2.6,並明確拒絕前沿定位,改以客製化為目標。只有一個發布案例,仍同時符合剩餘差距的兩種解讀。
-
Arena 測量的是聊天偏好。以時間範圍而非回應品質為主的長期 agentic 工作中,33 Elo 的開放/封閉差距會擴大還是縮小?部分解答(2026-07-30): Kimi K3 的模型卡列出 Artificial Analysis 兩個 agentic Elo 排行榜;最佳開放模型分別落後最佳封閉模型 61 分(GDPval-AA v2:1686 對 1747)和 35 分(AA-Briefcase:1548 對 1583),都大於33,方向上顯示差距擴大而非縮小。但比較數據由供應商挑選、harness 不對稱,而且 Fable 5 有一項程式設計基準的 35% 評測回合觸發 fallback,是 Moonshot 自己的說法,因此只能作為方向參考,尚無定論。進一步部分解答(2026-07-23),來自第三個非供應商軸線:UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities。 兩個政府評估機構將開放/封閉模型差距放在網路安全能力上,結果方向相同:差距擴大,而非縮小。前一項答案的兩個弱點在此消失:比較不是供應商挑選的,評估者也沒有販售產品。取而代之的是兩個新限制:評分使用 IRT 推得的網路安全 Elo,400 分相當於解題勝算變化 10 倍,因此不能與 Arena 的 33 分相減;美國模型評測時停用了系統層級防護,開放模型則未停用,因此測量的是潛在能力差距。現在有三個軸線都指向差距擴大(GDPval-AA、AA-Briefcase、網路安全),沒有任何一個顯示差距縮小,但彼此使用的量尺都不同。
-
開放/中國模型的採用,會不會從疊加使用轉為取代?可證偽的觀察方式是:Ramp 每月公布模型服務使用者中,96.4% 同時付費給 OpenAI 或 Anthropic;若此數字持續下滑,或同時付費給兩家的 82.5% 下滑,而服務平台占比仍持續上升,就代表市占正在轉移。若沒有這種情況,服務平台使用增加,只能說企業購買了更多 AI,而不是美國實驗室流失市占。觸發條件:每月發布的 Ramp AI Index,以及大範圍的前沿模型降價(Kharazian 把沒有降價視為市占未轉移的證據)。部分解答(2026-09-22),且觸發條件已發生: September 2026 Ramp AI Index: Cracks in the AI thesis, part 2 報告兩家美國實驗室都在發布前一個月降價,每百萬 token 的加權實際價格從 3 月高點 1.15 美元下跌 41%,降至 0.68 美元——本項列出的第二個觸發條件;與此同時,服務平台占比仍然上升(AI 支出企業中的占比從 2026 年 6 月的 6.00% 升至 8 月的 6.35%;所有企業中占 3.6%)。目前對取代的答案仍是否定的,原因則是本項原先未預料到的:使用量是在封閉模型選單內部轉移,前沿 token 占比從 8 月高峰的 53% 降至 45%,由供應商自家的標準級模型承接,而且作者直接表示「這些趨勢並非由採用開放原始碼模型或中國模型所帶動」。本項提出的可證偽統計仍無法取得——這一期沒有重刊 96.4% 的重疊使用率——因此目前只能評估降價這項觸發條件,還無法確認市占移轉。標記從
#oq/wait改為#oq/source:觸發事件已發生,現在需要新一期報告(或該指數的方法說明頁)重新公布重疊使用率。
資料來源#
-
DHH: Future of Programming, AI, Agentic Engineering, Vibe Coding & Linux | Lex Fridman Podcast #501 — DHH,Lex Fridman #501(2026-08-26,
practitioner-opinion,n=1,依記憶自行回報):Terminal Text Effects Python→Rust 移植任務,使用 Fable、Opus 5、GPT Sol、Grok 4.6、Kimi K3、DeepSeek V4 Pro/Flash 及 GPT Luna;提供實際耗時與費用估算 -
UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities — UK AISI/US CAISI,2026-07-23(
empirical;聯合政府評測,雙方都不開發模型,沒有供應商利益衝突):上表中的 ExploitBench 階梯分數與網路攻防場域步數;K3 在四項指標上勝過 GLM-5.2 的開放模型內部排序;以及圖 2 中依發布日期繪製的 IRT 網路安全能力 Elo(十款具名 PRC 模型、匿名的美國整體趨勢線、400 分相當於解題勝算變化 10 倍)。三張圖均依圖片二階段檢查規則檢視。**兩項限制:**圖 2 沒有數值標籤,因此讀取 Elo 值時只能依格線估算,並非引用已公布數字;文件全篇也沒有逐一點名美國比較模型,因此沒有任何美國數字能歸屬至特定模型或用供應商模型卡查證 -
Ramp's latest data on China vs. the American AI Labs — Ara Kharazian,Ramp's latest data on China vs. the American AI Labs(Ramp AI Index,2026-07-08;
empirical,Ramp 自家客戶群的公司卡與帳單付款紀錄)。「中國與開放原始碼模型」小節的要點及內文,用於 5.8%/4.5%、248 美元對 10.59 美元,以及 85.8%/93.2%/96.4% 等數字。較長的月度序列、DeepSeek 直接付款曲線、將 85.8%/93.2% 數字重新換算所需的 AI 支出企業基準比例,均來自還原後的原始圖表資料集——文中四張圖都是 Datawrapper iframe,沒有靜態備用圖;資料擷取流程下載各圖表的dataset.csv並完整重現。**利益衝突:**Ramp 測量的是偏向 VC 支持新創企業的自家客戶群,且以權威 AI 採用資料集為市場定位。完整證據說明、分母及測量工具的涵蓋範圍限制,請見企業 AI 支出強度與員工人數成長 -
Gemma 4 Technical Report — 表 4,截至 2026-06-19 的 Arena Text 排行榜(
empirical;第三方人類評分,與報告其餘自行回報的基準不同);§4.1 人類評估 -
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning — GLM-5.2(750B-A40B)是 SAO 的部署目標;表 1 中的 GLM-4.7(
empirical,GLM 實驗室第一方資料) -
Inkling: Our Open-Weights Model — 西方推出的 975B/41B 開放 MoE,自行回報成績低於中國 MoE 領先者,並將客製化作為定位(
vendor-claim) -
Kimi K3 Model Card — Kimi K3 規模為 2.8T/104B(§1–2);45 項基準表中的 GDPval-AA v2 與 AA-Briefcase Elo 數值及 Artificial Analysis 資料來源(§3 和註腳 3)(
vendor-claim) -
Security incident disclosure — July 2026 — 「Forensic analysis」與「The asymmetry problem」:可自架性是一項營運需求,而非能力策略(
case-study,第一方) -
Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident — Hugging Face,2026-07-27(
case-study,第一方):「How we intercepted and analyzed the attack」——點名 Claude Opus 和 Fable 遭拒絕的情況,說明部署了nvidia/GLM-5.2-NVFP4(量化版本)作為替代方案,以及執行所需的密碼分析工作 -
Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think — Andrew Ng 接受 Marina Mogilko 訪問,Silicon Valley Girl(2026-08-28,
practitioner-opinion,n=1 自我回報):處理 MNPI 時使用本地開放權重模型;銀行使用 VPC/地端環境;模型「接近前沿能力……小到能在本地執行」;以及模型「每隔一、兩週就會變」。字幕中的模型名稱無法辨識 -
September 2026 Ramp AI Index: Cracks in the AI thesis, part 2 — Ara Kharazian,September 2026 Ramp AI Index: Cracks in the AI thesis, part 2(Ramp,2026-09-09;
empirical)。提供 6.4%/3.6% 的服務平台數字、轉送平台也銷售封閉模型的限制、降價及 0.68/1.15 美元 token 價格資料,以及前沿模型轉向標準級模型的 token 占比變化。修正後的月度服務平台序列和每週級別序列來自還原的 Datawrapper 資料集——網頁沒有靜態圖表圖片。它沒有重新公布 85.8%/93.2%/96.4% 的重疊比例;這些仍是 7 月版數字。**利益衝突不變:**Ramp 自家客戶群偏向 VC 支持企業,由平台首席經濟學家發布;測量工具說明見企業 AI 支出強度與員工人數成長及 Ramp -
China-Based Artificial Intelligence Companies Conducting Industrial-Scale Distillation Campaigns Against U.S. AI Companies — NSA、CISA 和 FBI,Cybersecurity Advisory AA26-251A,2026-09-08,
case-study(政府歸因說法,未公開方法或資料,引用內容來自供應商揭露)。於延伸閱讀引用其「核心關鍵」說法及點名的學生模型
Cited by 35
- Open Weights as Competitive Strategy×6
This is the one claim on the page the vault can partly check, and the check is unflattering to a…
- GDPval Benchmark×4
Open Weight Frontier Gap — the GDPval-AA Elo board is where the open/closed agentic gap is measured…
- GLM (Z.AI)×4
Open Weight Frontier Gap — GLM-5.2 is the 744B–1.6T-class open MoE that page describes; GLM-4.7's…
- Kimi (Moonshot AI)×4
On the two third-party Elo agentic measures the card cites from Artificial Analysis, K3 sits 61 Elo…
- Open Questions Backlog×4
Open Weight Frontier Gap (88d) — Is the dense-beats-MoE result at 26B robust, or an artifact of one…
- Artificial Analysis×3
GDPval-AA (Elo, v1 and v2) · Gdpval Benchmark, Claude Opus 4 8, Kimi, Open Weight Frontier Gap · an…
- Inference Efficiency as Capability×3
3.7% activation sparsity. 104B active of 2.8T total, routing 16 of 896 experts per token plus 2…
- Autonomous Intrusion×2
It is also the first safety-grounded argument for open weights in this corpus. Open Weight Frontier…
- Balance-of-Power Superintelligence×2
Resuming open-weight releases. "Now that Meta Superintelligence Labs are up and running, we will…
- Claude Fable 5×2
Open Weight Frontier Gap — Fable 5 is the rank-1 closed reference point in DeepMind's Arena table;…
- Firm AI-Spend Intensity and Headcount Growth×2
Open Weight Frontier Gap — the demand-side half of the same monthly index: the highest-PEPM tail of…
- Gemma 4×2
It is not competitive at the frontier, and says so. On Arena Text (June 19, 2026), Gemma 4 31B sits…
- Inkling×2
The positioning is explicit and unusual: "Inkling is not the strongest overall model available…
- Open-Weight Elicitation Irreversibility×2
Note that this is not an argument that Gemma 4 is dangerous. Gemma 4 sits at Arena rank 43 (Open…
- The Price of Fixed Capability×2
The authors' explanation is a short-lived premium: the lab that first reaches a score can charge…
- Ramp×2
Aperture. The rail sees purchases that cross a card or bill-pay flow. It is a good instrument for…
- Telemetry vs. Survey Measurement×2
ramp ai index july 2026 — Ara Kharazian, Ramp's latest data on China vs. the American AI Labs (Ramp…
- Weak-Verifier Ensembling×2
Open Weight Frontier Gap — the class-closure claim in its terms: an 8B generator plus ≤8B verifiers…
- AI Product Economics Maturation
Ramp's data also puts a bound on the deck's Chinese-model tail (DeepSeek 7%, Alibaba 6%, Moonshot…
- Andrew Ng
Privacy: trust the hyperscalers, run MNPI locally. He trusts the largest hyperscalers to honor…
- Asynchronous RL for LLMs
Open Weight Frontier Gap — GLM-5.2, trained under this async regime, is the frontier-open MoE that…
- Autonomous Defense
Open Weight Frontier Gap — self-hostability becomes an incident-response prerequisite, not a cost…
- Cline
Open Weight Frontier Gap — ClinePass is a commercial bet that curated open-weight models are good…
- Compute-Controlled Benchmarking
Open Weight Frontier Gap — Arena Elo inherits the same defect: human preference scored at an…
- Encoder-Free Early Fusion
Open Weight Frontier Gap — encoder removal is one of the levers that lets a small dense model…
- Google DeepMind
Open Weight Frontier Gap — the lab publishes the Arena table that places it 43rd
- Illicit Distillation
Open Weight Frontier Gap — the competitive frame: if the gap closes partly by extraction rather…
- Jagged Intelligence (Ghosts, Not Animals)
Open Weight Frontier Gap — an aggregate Arena Elo averages the ridge flat; the small Gemmas'…
- Large-Scale Test-Time Compute
The accounting is asymmetric and the paper's ratio hides it. A student objects that pre-training is…
- LLM-Driven Vulnerability Research
Open Weight Frontier Gap — the same gap this page reads as a safety ladder, read as a market…
- Model Capability & Training
Open Weight Frontier Gap — Arena Text, June 2026: the top closed model leads the best open model by…
- Responsible Scaling Policy Evaluations
Gemma 4 (DeepMind, July 2026, Apache 2.0) makes the shape visible. It ships a thinking mode; its…
- Single-Rollout Optimization
Open Weight Frontier Gap — GLM-5.2 (750B-A40B), SAO's deployment target, is the frontier-open MoE…
- Task Time-Horizon Scaling
Open Weight Frontier Gap — Arena Elo measures chat preference; whether the 33-Elo open/closed gap…
- UK AI Security Institute
Open Weight Frontier Gap — the same assessment as the first non-vendor measurement of the…
Related articles
- Open-Weight Elicitation Irreversibility
A wiki-drawn synthesis of Brown and Gemma 4: if dangerous capability scales with inference budget, then an open-weight…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Kimi (Moonshot AI)
Moonshot AI's open-weight Kimi line — K2.5/K2.6 as 1T-class MoEs already circulating in this corpus (Inkling's post-tra…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Cost-per-Task Over Cost-per-Token
Anthropic's inverted model-selection default: start with the most capable model and dial effort down — a stronger model…
