動察 Beating AI 快訊,蘋果開源了專門處理長文件的視覺語言模型 LensVLM-9B,模型基於 Qwen3.5-9B-Base 訓練。處理長文件時,它會先把整份文件壓成低清頁面快速掃一遍,定位到相關頁面後,再讀取其中的原始文字或高清圖片。
這樣就不用把全文都塞進模型上下文。論文測試一份 100 頁文件時,直接讀取全文需要 51,273 個 tokens,LensVLM 只用了 8,090 個。對應的 KV 快取從約 1.6GB 降到 253MB,減少 84.2%。
壓縮後準確率也沒有明顯下降。7 項文件問答測試中,直接讀取全文的平均準確率為 72.4%,LensVLM 在約 4.3 倍壓縮下仍有 68.9%。相比直接把文字縮成圖片讓模型識別,同樣約 5 倍壓縮時,準確率從 31.3% 提高到 68.9%。
不過,它目前會更慢。LensVLM 找到相關頁面後,還要再調用一次工具讀取原文,因此需要連續跑兩輪推理。論文測試中,一次回答約需 17 秒;如果不用這套壓縮方案,直接把整份文件作為文本輸入 Qwen3.5-9B,一次生成答案約需 8 秒。