mt logoMyToken
ETH Gas
EN

Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%

Favoritecollect
Shareshare

PANews 7月29日消息,Kimi宣布开源多模态大模型视觉感知评测基准PerceptionBench,旨在将视觉感知能力拆解为10项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与3D、定位、比较、细粒度识别、上下文整合、OCR及幻觉识别等维度。该基准基于42个现有评测集中的模型失败案例构建,共包含3000道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。

评测结果显示,在16款前沿多模态大模型中,没有任何模型整体准确率超过60%。GPT-5.6-Sol以59.7%的准确率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)位列前五。报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍存在显著提升空间。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup