動察 Beating AI 快訊,Scale AI 推出 RSI Bench,專門測試 AI 能不能像研究員一樣,自己做 AI 研發。
AI 會直接拿到論文、程式碼和運算能力,然後自己想實驗、跑訓練、改方法,再看能不能把原來的 AI 做得更好。
首批測試用了 Claude Opus 5 和 GPT-5.6 Sol。兩款模型已經能自己跑實驗、調參數、迭代方案,部分任務確實能超過給定基線。
但現在的 AI 還不太會「發明」。讓它們挑戰最新研究時,大多數嘗試仍停留在論文已有方法和調參數上,很少提出真正的新思路。