header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Jev到底有沒有門檻?OpenJEV已經分成4派:不吐字容易,概率靠譜很難

動察 Beating AI 快訊,Jev 發布還不到一週,開源社區已經開始復刻這種「不寫答案、直接給機率」的模型。


它們都想做同一件事:省掉逐 token 生成,直接給出選項和機率。但具體怎麼做,已經分成了幾條完全不同的路線。


1. SemIf 最簡單,連模型都不用重新訓練。它直接拿現成的 Qwen,在模型準備回答 A、B、C 時截住,不讓它繼續往下寫,直接讀取每個選項的分數,再換成機率。


2. Simple Jev 也用現成大模型,但進一步省掉重複計算。同一段材料只讀一次,後面的多個問題共用這部分結果,再分別判斷答案。作者也明確說,它復刻的是 Jev 的使用方式,準確率、速度和機率校準都沒有做到等價。


3. Laya 乾脆不用會生成文字的大模型,換成更像傳統分類器的編碼模型。好處是小而快,短板也很明顯。一次從 77 個選項裡做選擇時,Laya 準確率只有 42.5%,Jev 是 87.0%。


4. Von 走的也是專用決策模型路線。它只有約 4 億參數,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一個能讀自然語言的新一代分類器。


5. Verdict 更小,只有約 1.5 億參數。作者重點處理了兩個問題:答錯了還報很高的置信度,以及把選項順序換一下,結果就跟著變。它更在意如何讓機率和判斷都穩定下來。


6. Kev 選擇保留大模型。它拿 Qwen 做底座,再加專門的決策結構,讓同一份輸入只讀一次,多個問題各自算機率。第三方此前逆向 Jev 時,也推測它可能用了類似設計。


Kev 自測中,拿訓練時沒見過的新題測試,8B 版準確率約 78%,Jev 約 86%。更明顯的差距在置信度,Kev 還有一些答錯的題會給出 90% 以上把握。


7. Nimble 重點放在訓練上。它用 Qwen3.5-9B,再準備一批「只改一個事實,正確答案就翻轉」的數據做後訓練。在 324 個沒參與訓練的測試樣本裡,Nimble 有 90.1% 選中了參考答案,Jev 是 93.2%。不過作者也提醒,目前還不能保證模型「報 90% 就真的有 90% 正確」。


8. OpenJev 走得最遠,直接換成 DiffusionGemma。它先把幾個答案位置留空,再像擴散模型補圖一樣一次填出來。在 RTX PRO 6000 上,單請求中位延遲約 94ms。


幾天下來,OpenJEV 已經分成四路:直接讀取現成模型的答案分數、訓練專用決策模型、把大模型改造成決策模型,以及用擴散模型直接填答案。


Jev 這條路線看起來很好抄。真正拉開差距的還是準確率、泛化和概率校準。模型敢報 90%,這個 90% 到底有多可信,才是最難的部分。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成