動察 Beating AI 快訊,騰訊混元聯合清華、北大推出 IWC-Bench,專門評測 AI 生成嘅網頁實際用起嚟點樣。
唔少網頁生成評測主要睇代碼或者截圖。頁面可能睇落好靚,代碼入面亦確實寫咗功能,但撳掣撳唔開、表單交唔到、轉個頁面就報錯,呢啲問題好難靠靜態檢查發現。
IWC-Bench 更像真人驗收。佢畀一個 Agent 真正打開網頁,點擊按鈕、輸入內容、切換頁面,再檢查邊啲功能實際跑過。最後分別評價三件事:頁面好唔好睇、操作順唔順、用戶要求嘅功能有冇做出嚟。
基準收錄 369 條真實用戶需求同 5088 條驗收標準,17 個模型一共生成咗 6273 個網頁應用。喺另外 197 組人工複核嘅對比中,IWC-Bench 有 168 組同人類選擇一致,一致率達到 85.3%。
結果亦說明,網頁「睇落唔錯」同「真係好用」唔係同一回事。GPT-5.6-Sol 嘅頁面美觀度最高,但易用性只排第六;具體到單個網頁,好睇基本唔能夠說明佢好唔好用,兩項相關係數只有 0.36。