資料來源#
- BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL
- Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Staleness-Learning Rate Scaling Laws for Asynchronous RLHF
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
摘要#
SAO(單次軌跡非同步最佳化)以每個提示一條軌跡(群組大小為 1),取代 GRPO 每個提示產生一組回應的做法,並在軌跡完成後立即送入訓練。這帶來兩項好處:減少離策略偏移(不必等待群組中最慢的成員——請參閱適用於 LLM 的非同步 RL),而且能適用於 GRPO 在結構上無法處理的情境——只會對每個提示回傳單一回饋軌跡的線上與複雜代理式環境。
代價在於,這正是這個領域最初放棄單軌跡方法的原因:方差。沒有群組,就沒有用於優勢估計的群組相對基準,因此單次軌跡的梯度會像 REINFORCE 一樣嘈雜。SAO 的回答是刻意採取逆流而行的策略——重新採用近期 GRPO/RLOO 浪潮意圖避開的價值模型(評論器),並把全部工程預算投入讓評論器穩定到足以充當基準。此方法已部署於訓練 GLM-5.2(750B-A40B)。
值得一提的逆流而行#
過去兩年,LLM 的 RL 發展方向一直是遠離價值函數。GRPO、RLOO 等方法主打自己「免評論器」:不必訓練獨立的價值網路、記憶體減半,也沒有價值學習的不穩定性。SAO 認為,對於當前最重要的情境,這條路走不通。免評論器的優勢估計在結構上依賴群組——你需要對同一提示取得多個回應,才能計算相對獎勵——但非同步/線上代理式回饋恰好只提供一條。因此價值模型回歸了,不是出於懷舊,而是因為它是唯一能從單條軌跡運作的基準。這項賭注是:訓練良好的評論器勝過群組相對基準,而讓人們不再採用評論器的不穩定問題可以解決。論文大部分篇幅都在說明如何解決。
讓單次軌跡評論器穩定的四項設計#
**1. 價值更新速度快於策略(TTUR,K=2)。**單次軌跡 RL 的核心不穩定性來自策略與價值之間的相互依賴:不準確的 V_ϕ 會產生嘈雜的優勢,進而導致破壞性的策略更新。SAO 將更新頻率拆開——每次策略更新前,先執行 K 次價值網路更新(實驗中 K=2),讓價值估計在用於計算優勢前先追上目前策略。這是為 LLM 調整的雙時間尺度更新規則。
2. 凍結注意力的評論器。在初步實驗中,價值模型的梯度範數遠大於策略模型;分解分析指出不穩定性來自全注意力層,MoE 層則保持穩定。因此在 RL 期間,SAO 凍結 V_ϕ 的注意力模組,只訓練 MoE 投影層——其假設是,預訓練好的注意力已經能關注正確的 token,因此將最佳化限制在 MoE 層可正則化評論器。消融結果:移除此設計後,AIME2025 從 97.3 降至 90.6。
3. 跳過觀察的 token 級 GAE。代理式軌跡會交錯出現模型動作與環境回饋:T = [a₀, o₀, a₁, o₁, …]。標準 GAE 會計算相鄰 token 之間的價值差異,但從動作最後一個 token 到觀察第一個 token 的邊界,對模型而言是不連續的(模型並未產生 o_i),因此跨越此處估計優勢,會讓評論器試圖預測外部環境狀態的價值,並引入雜訊。SAO 的解法是直接連接動作到動作,略過觀察 token:
Â(a_{i,N}) = δ + γλ · Â(a_{i+1,0}), with δ = r_t + γ V(a_{i+1,0}) − V(a_{i,N})
如此一來,優勢估計便只限於模型生成的 token。token 級優於步驟級:把每個回合視為一個動作(步驟級 GAE)表現較差——表 5 的 400 步結果:步驟平均 85.8、步驟最後 token 87.3、token 級 89.8(AIME2025)——因為更細緻的監督能捕捉軌跡中的邏輯轉折,而逐回合訊號會將其平滑掉。
**4. 擴大的價值預訓練。**評論器的冷啟動是實際瓶頸;擴大價值預訓練語料,能提供穩健的初始化,讓單次軌跡與 TTUR 機制從訓練初期就能發揮作用,而不是花上數百步與糟糕的評論器搏鬥。
結果#
每項設計選擇都不可或缺——消融結果(表 4)顯示,移除任何一項都會降低準確度;兩種成本較低的單次軌跡基準(一種使用移動平均獎勵基準,另一種使用原版 VAPO)都明顯落後或直接崩潰:
| 變體 | AIME2025 | BeyondAIME |
|---|---|---|
| SAO | 97.3 | 74.8 |
| 無較快價值更新 | 95.0 | 69.8 |
| 無凍結注意力 | 90.6 | 74.5 |
| 原版 VAPO(無 DIS) | 91.3 | 69.0 |
| 移動平均基準 | 79.8 | 55.3 |
在程式碼任務上,SWE-Bench Verified(Qwen3-30B-A3B 骨幹模型、OpenHands 框架、300 回合、128k context):基礎模型 23.0 → GRPO+DIS 27.0 → SAO 29.8。在使用 Python 推理(TIR)的設定下,SAO 在四個數學推理基準上全面勝過 SFT 基準與 GRPO(AIME2025 97.3、BeyondAIME 74.8、HMMT 88.3、IMOAnswerBench 74.0),表現接近規模大得多的 GLM-4.7。
線上學習結果:單次軌跡獨有的適用場景#
SAO 最有力的主張不是基準分數提升,而是一種GRPO 無法具備的能力。在非平穩環境中——每個提示只會取得一條回饋軌跡,而且獎勵標準本身會隨時間改變——GRPO 的群組相對基準在結構上不適用。以價值為基礎的 SAO 評論器則不受此限:它能從單條軌跡提供依狀態而定的基準。
展示實驗是一項模擬線上寫作任務,訓練過程中途在幾種風格原型(可愛風、中二風、古典風)之間切換目標風格,使用 GLM-4.7 作為 LLM 評審,評分 r = r_quality × r_style ∈ {0,1}。偏好轉變時,SAO 迅速重新對齊——抑制舊有的主導風格,並收斂到新的目標——而移動平均基準(128 個獎勵的滑動視窗)則反應遲緩,因為歷史視窗仍偏向先前的分布。評論器能追上轉變;移動平均只能把轉變納入平均。
另一種穩定化設計,以及它沒有爭論的部分#
SAO 的兩項貢獻可以分開看(DIS 帶來穩定性,單次軌跡帶來效能上限),因此競爭方法的穩定化設計只會針對第一項。ESTR(Baidu 等人,arXiv 2607.22186,2026-07-24,empirical)就是這類競爭方法:它以依 token 局部熵縮放的邊界,取代固定幅度的保留規則,|δ_t| ≤ √(τ(H_t + ε));其論點是重要性比率的自然尺度會隨熵增加,所以任何不隨位置改變的界限都無法區分被放大的低熵取樣雜訊與合理的高熵探索。其配對預算消融是關鍵證據——將三種保留規則重新校準至相同的 0.07% 第 0 步遮罩比例後,其中兩種仍然崩潰,其中一種的預算與勝出方法同級——因此決定穩定性的是被遮罩族群的平均熵(0.11、1.67、3.47),而非其大小。完整分析請見適用於 LLM 的非同步 RL。
有三點需要精確說明,因為兩者重疊的部分比表面看來更窄。
**它完全沒有觸及單次軌跡這一半。**ESTR 在所有任務上都使用 GRPO 優勢,每個提示取 n = 8 條軌跡樣本(表 3)——是群組,不是單條軌跡——也完全沒有討論評論器、價值預訓練或單軌跡回饋。這裡沒有任何內容能動搖本文的核心賭注:訓練良好的評論器勝過群組基準。
**它在 DIS 的行為代理問題上意見一致。**ESTR 附錄 G 指定「將軌跡 log 機率作為近端錨點(繞過模式)」——也就是 DIS 採取的移除 π_θ_old 做法,只是各自獨立得出。兩篇論文也都基於相同理由,排除解耦陳舊度的做法:如果一條軌跡跨越多個權重版本,就不存在單一行為策略可供重建。真正的分歧範圍很窄:信任邊界的形狀,僅此而已。
**這項批評是否適用於 DIS,是本 wiki 的推論,不是 ESTR 的主張。**ESTR 從未提及 DIS 或 SAO;它列出的基準方法是 IcePop 和 KPop。兩者之間的連結,是本 wiki 自己指出 DIS「是 IcePop 機制的更嚴格版本」——若此說成立,更嚴格反而會讓校準失準的問題加重,因為縮窄固定區間無法改變其形狀。尚未確認:SAO 報告了裁剪比率,卻從未報告遮罩 token 的熵,而這正是區分兩種設計所需的診斷指標。要看哪些證據能解決這個問題,請參閱適用於 LLM 的非同步 RL中的相同討論。
對觀察邊界採取相反立場的設計#
SAO 的四種評論器穩定化做法中,跳過觀察的 GAE是唯一對世界而非最佳化提出隱含主張的一項:動作到觀察的邊界沒有值得傳遞的可學習價值訊號,只有模型未產生之外部狀態所帶來的雜訊。TRACE(Tao 等人,UW–Madison + Microsoft Research,arXiv 2607.13988,2026-07-15,empirical)是語料中第一個以完全相反前提建構方法的來源:它在工具呼叫邊界切分軌跡,並將所有密集獎勵都建立在跨越觀察的價值變化上;此變化以凍結參考模型所讀出的 log 比率黃金答案可預測性價值之 TD 差異衡量——全程沒有訓練評論器。在封閉網路的 BrowseComp-Plus 上,這種密集邊界訊號相較於結果獎勵式 GRPO,在 4B 骨幹模型上平均提升 4.5 分,在 30B-A3B 上提升 5.6 分(完整分析、數字與解析說明見回合級信用分配)。
**請將此視為類比強度的證據,而非 SAO 設計的消融結果。**這項區分不可或缺,也很容易被忽略:
- **兩種價值函數本質不同。**SAO 擔心的是,要求一個學習而來的
V_ϕ跨越觀察估計優勢時,會試圖預測外部環境狀態,接著這種錯誤又會回饋到策略更新中。TRACE 的價值函數從未經過學習,也未經過最佳化——它是策略初始化的凍結副本,用來為黃金答案的 log 機率打分,再與自身作差。它不會像訓練中的評論器那樣退化,因此它在邊界上的成功,不能證明評論器也能在此安然無恙。 - **兩種設計其實同意損失函數的做法。**TRACE 和 SAO 一樣,會從策略梯度損失中遮罩掉工具觀察。因此真正的分歧並非「要不要在觀察 token 上訓練」,而是更狹義的問題:跨越觀察的價值差異是訊號還是雜訊?
- **目前沒有共同實驗。**TRACE 從未提及跳過觀察的 GAE,也完全沒有執行 GAE 實驗組(其受控基準為 GRPO、GSPO 和 GiGRPO),而且任務、骨幹模型、目標與獎勵都和 SAO 不同。要解決此問題,需要在相同評論器、相同任務下,比較跳過觀察與跨觀察 GAE。
- 它確實改變的一點:它讓這項前提成為可爭論的假設,而非理所當然。在長時程搜尋中,觀察明顯就是價值變化的來源,而且變化高度集中——TRACE 的一條定性軌跡中,提供關鍵措辭的
browser.open獲得δ = +5.86,而下一回合確認該內容的字面find得到+0.00。
範圍更窄、成本更低,且在不同面向重新採用評論器#
SAO 的逆流而行是全面重返評論器:它重新設計價值模型本身(凍結注意力、TTUR、跳過觀察的 GAE、擴大的價值預訓練),以讓不需要群組、只靠單條軌跡的評論器穩定運作。BRACE(Zhao、Xie、Zheng 等人,Baidu,arXiv 2609.09783,v1 2026-09-09,empirical)則從較窄的切入點重返評論器:保留標準的群組式 PPO 評論器,只修正它用來回歸的價值目標,以 k 上限修正時距加上等權重的蒙地卡羅尾項,取代 V-trace 未能解決的涵蓋率與控制力取捨。這種較窄修正的實測成本很低——BRACE 相較未修正的非同步 PPO,只增加 1.5% 步驟時間(表 2)——這為定向修正評論器的低成本提供了有用參照,可與 SAO 全面投入評論器工程的預算相較。兩者並未彼此比較,解決的問題也不同:BRACE 從未使用單次軌跡(全程群組大小 > 1,與 GRPO 相同),而 SAO 的貢獻,正是在完全沒有群組可供退而求其次時,展示評論器能帶來什麼。完整分析請見錨定貝爾曼殘差修正(BRACE)。
相關連結#
- 錨定貝爾曼殘差修正(BRACE) — 範圍更窄的評論器端修正,保留群組,只修正價值目標,成本僅為本文評論器工程成本的一小部分;兩種重返評論器的方法解決不同問題,且未彼此比較
- 適用於 LLM 的非同步 RL — SAO 的另一半;單次軌跡移除了非同步情境下暴露出的群組同步屏障,DIS 則讓由此產生的更新保持穩定;此文也是 ESTR 的完整討論處,這項競爭穩定化方法針對 DIS 的固定幅度邊界提出異議,卻不觸及單次軌跡這一半
- 陳舊度–學習率縮放 — 本文未執行的空白對照組:沒有 DIS、完全不遮罩時,純非同步 GRPO 能撐多久;其每步偏差上限為
O(Sη),崩潰時距為Tη。這是 SAO 的穩定化方法試圖推遠的界線;也只有在學習率相同時,SAO 的「約 1000 步穩定」和基準方法的「約 90/160 步」才可比較——SAO 沒有公布學習率 - 回合級信用分配 — 對 SAO 的觀察邊界採取相反立場的設計:其所有獎勵訊號都來自跨越工具觀察的價值變化,使用的是凍結探針,而非訓練中的評論器
- 群組相對策略最佳化(GRPO) — SAO 所取代的方法;本文所說的逆流而行,正是朝 GRPO 移除的評論器回頭
- LLM 評審 — 線上學習的獎勵訊號來自 LLM 評審(GLM-4.7),根據品質 × 風格評分
- Large-Scale Test-Time Compute — 此方法訓練的長時程代理式模型,其能力接著會隨推論預算擴大
- 開放權重前沿差距 — GLM-5.2(750B-A40B)是 SAO 的部署目標,也是該文追蹤的前沿開放式 MoE 模型
- 苦澀的教訓 — SAO 同時移除結構(移除群組基準、移除
π_θ_old),也新增了許多機制(凍結注意力的評論器、跳過觀察的 GAE、長度自適應 λ)——與 Gemma 4 同樣具有雙向改動的特徵 - Reward Hacking — 以價值為基礎的評論器能提供比稀疏群組相對訊號更密集、依狀態而定的獎勵訊號;這是否會改變 Goodhart 曲面,目前尚未探索
- GLM(Z.AI) — 實際部署案例:GLM-5.2(750B-A40B);GLM-4.7 同時作為基準上限與線上模擬評審
- 來自執行回饋的 RL(RLEF) — 本文開放問題提及的執行回饋案例,採用端對端訓練:RLEF 將直譯器的失敗文字跨回合回饋,並獎勵成功存續者,因此至少在程式碼任務上,環境回應被視為關鍵訊號。它沒有執行 GAE 實驗組,信用分配也比 SAO 粗略,所以雖然加深疑慮,仍未解決問題
- 離線多步驟工具使用 RL(SWiRL) — 採取繞過而非解決此系統問題的方法:SWiRL 在 RL 期間完全不接觸環境,而是根據離線收集的凍結情境為提出的動作評分,因此它以離策略落差取代本文的在策略軌跡工程,而沒有人評估此落差在更長時程下的代價
開放問題#
- 整套方法賭的是訓練良好的評論器勝過群組基準。在這裡——使用擴大價值預訓練的 30B-A3B 骨幹模型——它確實勝出,但評論器會讓訓練記憶體加倍。到了什麼規模,即使 GRPO 的品質較差,免群組的簡潔性仍能在成本上扳回一城?部分回答(2026-09-24),而且僅涉及不同的成本面向:BRACE估算在已採用評論器的 PPO 執行上,定向評論器端修正的成本:相較未修正的非同步 PPO,步驟時間額外增加 1.5%(222.47 秒/步,相較 219.20 秒/步,表 2),而同步步驟速率維持在未修正非同步 PPO 的 2.49 倍,對照組則為 2.46 倍。這界定的是修正評論器陳舊偏差的邊際成本,而不是採用評論器本身的成本——BRACE 從未使用免群組方法,其基準本來就包含完整評論器,也未涉及本問題所指的記憶體加倍面向。因此,GRPO 成本這一側仍未觸及;新增的資料點是,既然已經付出評論器的成本,修正評論器也不必昂貴。
- 凍結注意力的理由來自一項假設(「預訓練好的注意力已經能關注正確的 token」),但目前只經由梯度範數軌跡與一項消融驗證。當價值模型必須關注預訓練時從未見過的工具輸出時,這項假設還成立嗎?
- 跳過觀察的 GAE 假設環境回饋沒有值得傳遞的可學習價值訊號。對於環境回應本身就是關鍵資訊的代理(例如編譯器錯誤、測試結果),跳過它是否會漏掉訊號?部分回答(2026-08-12),但僅屬類比——這項前提目前可以質疑,尚未被推翻:TRACE以跨越工具觀察的價值變化為基礎,建構了整套密集獎勵方法;在長時程搜尋中,使用相同骨幹模型、資料與協定時,相較結果獎勵式 GRPO,平均分數在 Qwen3-4B 上提高 4.5 分,在 Qwen3-30B-A3B 上提高 5.6 分;而且信用分配明顯集中在承載證據的觀察上(提供關鍵資訊的頁面開啟動作獲得
δ = +5.86,下一回合逐字查找確認則為+0.00)。因此,至少在一種長時程環境中,觀察並非價值中立。三項因素使這仍不足以定案:TRACE 的價值函數是凍結參考模型的黃金答案 log 機率,從未經過訓練,因此不會遭遇這項設計選擇要保護學習而來的評論器免受的特定失效;TRACE 和 SAO 一樣,會從損失中遮罩掉觀察 token,因此兩者只在跨越邊界的價值差異上有分歧,而非是否在觀察 token 上訓練;而且目前沒有共同實驗——TRACE 沒有執行 GAE 實驗組,也未提及跳過觀察,因此仍未進行直接測試(相同評論器、相同任務下比較跳過觀察與跨觀察 GAE)。問題中提到的編譯器錯誤/測試結果案例仍未觸及:這裡是檢索,不是執行回饋。 - 線上學習的勝利來自受控模擬偏好轉變,並由 LLM 評審打分。論文本身也指出,面向真實使用者的線上適應需要防護措施、監控與隱私審查,而這些都不在研究範圍內。
資料來源#
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning — Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Hou、Li、Tang、Dong(Tsinghua / Z.AI),arXiv 2607.07508,2026-07-08。§3.2(單次軌跡與價值模型設計)、§4(結果、消融)、§4.5(線上學習)、附錄 A(步驟級與 token 級 GAE)。
empirical。 - Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning — Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning, Zhao、Xie、Zheng 等人(BUPT / Peking / USTC / CAS + Baidu),arXiv 2607.22186,v1 2026-07-24,
empirical。§4.3(保留規則)、§I.2 + 表 7(配對預算消融)、附錄 G + 表 3(n = 8軌跡樣本、「繞過模式」近端錨點——界定與本文重疊範圍的兩項事實)。完整分析與四項解析警告見適用於 LLM 的非同步 RL。 - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents — TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents, Tao、Peng、Yao、Ge、Cheng、Wang、Gao、Li(UW–Madison + Microsoft Research),arXiv 2607.13988,v1 2026-07-15,
empirical。§3.1(工具邊界狀態;觀察 token 和本文一樣從損失中遮罩)、§3.2–3.3(凍結參考模型的 log 比率價值及其 TD 信用分配——與訓練中評論器本質不同的機制)、§4.1(不含 GAE 實驗組的受控基準組)、§A.5(集中於各回合的信用分配軌跡)。完整分析、所有表格與解析說明見回合級信用分配。 - Staleness-Learning Rate Scaling Laws for Asynchronous RLHF — Staleness–Learning Rate Scaling Laws for Asynchronous RLHF, Song、Xu(同等貢獻)等人(HKU / Shanghai Jiao Tong / Gradient / USC / HK PolyU),arXiv 2607.01083,2026-07-01,
empirical。本文僅引用其 §3.4–3.6(每步偏差上限O(Sη)與崩潰時距Tη,亦即可用來理解 DIS 的「受控程度離策略偏差」的未修正基準),以及 §4.3(t_collapse·η ≈ 3.2×10⁻⁵,說明若未公布學習率,單看崩潰步數便毫無解讀意義)。該研究沒有執行 DIS 實驗組、沒有價值模型,模型規模也未超過 3B。完整分析與所有解析說明見陳舊度–學習率縮放。 - BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL — BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL, Zhao、Xie、Zheng 等人(BUPT / Peking / USTC + Baidu),arXiv 2609.09783,v1 2026-09-09,
empirical。本文僅引用 §5.4 + 表 2(上文估算的訓練成本比較)。它沒有執行單次軌跡實驗組——群組大小全程大於 1,與 GRPO 相同——也從未與 SAO 比較。完整分析見錨定貝爾曼殘差修正(BRACE)。
Cited by 16
- Open Questions Backlog×4
Single Rollout Optimization: Skip-observation GAE assumes environment feedback carries no learnable…
- Asynchronous RL for LLMs×3
2. Group-wise sampling is a synchronization barrier. GRPO samples a group of responses per prompt…
- GLM (Z.AI)×3
It is the reason SAO exists. Asynchronous single-rollout RL is not an academic exercise here — it…
- Group Relative Policy Optimization (GRPO)×3
Single Rollout Optimization — SAO, the method that replaces GRPO's group with one rollout + a value…
- The Bitter Lesson×3
The same exemption covers the training loop. SAO runs the identical both-directions move on the RL…
- LLM-as-a-Judge×2
RL reward signal — Single Rollout Optimization: SAO's online-learning experiment uses GLM-4.7 as…
- Offline Multi-Step Tool-Use RL (SWiRL)×2
The frozen context is off-policy by design. The model is scored on an action taken in a world where…
- The Open-Weight Frontier Gap×2
Single Rollout Optimization — the RL method behind the GLM MoE line's continued frontier presence;…
- OpenHands×2
Single Rollout Optimization — SAO's SWE-Bench Verified results are run in the OpenHands scaffold…
- Turn-Level Credit Assignment×2
TRACE places its entire credit signal at the tool-call boundaries that SAO's skip-observation GAE…
- Anchored Bellman-Residual Correction (BRACE)
Single Rollout Optimization — SAO's counter-current already returns to the critic wholesale…
- RL from Execution Feedback (RLEF)
Single Rollout Optimization — the same environment-feedback question from the credit-estimation…
- Large-Scale Test-Time Compute
Single Rollout Optimization / Asynchronous Rl For Llms — the training-side complement: the RL loop…
- Model Capability & Training
Single Rollout Optimization — SAO's headline move: one rollout per prompt instead of GRPO's group,…
- Reward Hacking
Single Rollout Optimization — SAO wires an LLM judge (GLM-4.7) directly in as the RL reward…
- Staleness–Learning-Rate Scaling
Single Rollout Optimization — the opposite design response to the same problem: SAO changes the…
Related articles
- Group Relative Policy Optimization (GRPO)
DeepSeek's critic-free RL objective that became the 2024–25 default for LLM post-training: sample a group per prompt, b…
- Asynchronous RL for LLMs
Consuming rollouts for training the instant each finishes, instead of waiting for a full synchronized batch — fixes the…
- Process vs Outcome Reward Models
The four-year arc of trained LLM verifiers as taught in CS329A lecture 3: OpenAI's GSM8K verifier (score the finished s…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- CS329A: Self-Improving AI Agents (Stanford)
Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…
