据动察 Beating 监测,腾讯混元及 SSV 数字文化实验室联合中科院信工所等机构,正式推出首个覆盖「七体之变」的古文字感知评测基准 Chronicles-OCR。该基准包含 2800 张由专家交叉标注的图像,首次将甲骨文到草书等七种字体的识别难度统一量化。
研究团队评测了 28 个主流多模态大语言模型,结果显示它们在古早字体上几乎全军覆没。在跨时代字符检测任务中,GPT-5 和 Gemini 2.5 Pro 的核心指标接近 0,表现最强的模型也仅有 16.5。即使直接在图上画框免除定位步骤,最高准确率也只有 27.1%,其中 Gemini 3.1 Pro 在甲骨文上的准确率仅 14.0%。
这证实了现代模型严重依赖规整的现代版式先验。面对無約束、強噪聲的古代物理介质,模型的文本分割机制直接失效。字体分類結果進一步表明,模型往往是在識別載体紋理(如龜甲或青銅銹),而非真正的字符筆劃。
实验还揭示了一个反直觉的現象:開啟思考模式反而會導致古文字識別率下降。對照顯示,幾乎所有支持該模式的模型在開啟思考後表現退化。當底層視覺感知缺失時,思考鏈不僅無法紀錯,反而會變成幻覺放大器,輸出高自信的錯誤答案。