据動察 Beating 監測,AI 模型評估公司 Vals AI 完成 4000 萬美元 A 輪融資,估值達到 4 億美元,由 a16z 領投。8VC、Pear VC、Bloomberg Beta 等舊股東繼續參投。
Vals 做的是大型模型第三方評估。現在許多模型發布時,成績仍由廠商自己測試、自己報告。Vals 則用程式設計、金融、法律、醫療等真實任務統一測試不同模型。官方稱,其結果已被 OpenAI、Anthropic、Google、Meta 和 xAI 的模型卡引用,今年收入也已經達到 2025 全年的 8 倍。
a16z 看中的就是這層「第三方裁判」價值。公開 Benchmark 越來越容易被刷分、混入訓練數據,甚至被廠商針對性優化,榜單高分未必等於真實好用。
這次 Vals 還全面開放 Vals Smith,可以直接把任意 GitHub 倉庫做成 Coding Benchmark。系統會從歷史 PR 中提取真實開發任務,再用隱藏測試檢查模型能不能完成。企業因此可以直接測試哪個模型最適合自己的程式庫,而不是只看公開榜單。