据動察 Beating 監測,遞歸自我改進正在越來越具體地落到 Harness 上。最近 Pi 和 DeepSeek Harness 的兩套設計,恰好補上兩個關鍵底座:一個讓 Agent 跑得足夠久,一個讓 Agent 本身足夠容易改。
Pi 最新 Harness V3 規範把 Agent 設計成可恢復的持久運行時。模型請求和工具調用前先記錄執行意圖,完成後再寫入結果和下一步狀態。進程崩潰後,系統能知道任務停在哪裡,哪些操作可以安全重跑,哪些有副作用、不能再執行一次。Agent 要長期運行,首先不能一次崩潰就從頭再來。
DeepSeek Harness 補的是另一半。Cordis 把模型適配器、工具系統、Session Log,甚至 Agent Loop 都做成可組合組件;創造模式還允許 Agent 在運行時檢查 Cordis 環境,臨時定義、加載和卸載新的組件。
Pi 讓執行狀態可以延續,DeepSeek 讓 Agent 的組成結構可以動態重組。
這正是翁荔 7 月討論 Harness 與遞歸自我改進時判斷的方向。近期 RSI 未必從模型直接重寫權重開始,更現實的路線是先優化上下文和工作流,再深入到 Harness 代碼,最後連「怎麼優化 Harness」本身也成為優化對象。
現在還缺第三塊:驗得準。自進化 Agent 研究已經把評測和安全列為核心問題。Agent 可以長期運行,也可以修改自己,但如果連「什麼叫進步」都能一起改,很容易為了通過自己的測試而優化。翁荔也特別強調,verifier、tracer 和安全邊界應該放在自修改迴路之外。
所以真正的 RSI 閉環,至少要解決三件事:跑得久、改得動、驗得準。Pi 正在補第一塊,DeepSeek 正在補第二塊,第三塊決定這種「進化」最後是真的能力增長,還是只學會了通過自己出的考試。
能改自己只是進化的開始,能證明自己真的變強,才是 RSI 最難的最後一公里。
