動察 Beating AI 快訊,Anthropic 給 Claude Code 的官方 claude-api Skill 加了一套自動調優工作流。build-eval 先從真實對話、Bug 或人工案例裡做出測試集和評分方法,hillclimb 再讓 Claude Code 反覆修改系統 Prompt、工具說明、模型和推理強度。每次改完都重新跑測試,效果變好就保留,變差就回滾。
為了避免 Claude 只針對測試題優化,它不會拿所有樣本一起調。部分案例用於找問題和改配置,另留一批案例檢查修改能不能用在沒見過的問題上。如果前面的分數漲了,留出的測試結果沒有改善,這次修改就可能被判定為過擬合併撤回。
Anthropic 用 44 條客服工單演示了這套流程。Claude Code 先後清理 Prompt、補充業務規則、嘗試不同模型並降低推理強度。最終找到一套 Sonnet 5 低 effort 配置。在 14 條沒有參與調優的工單上,準確率從初始配置的 78.6% 提到 90.5%,成本降到約原來的五分之一。