Kimi给AI做视力表,模型答错或因未看清

10分钟前

币界网报道:币界网消息,OneMillion_AI发文称,月之暗面发布了perceptionbench,旨在检查多模态模型是否真正看清图片。现有评测常将视觉、知识和推理混合,导致模型答错后难以判断是看错还是想错。perceptionbench收集了前沿模型在42个基准中的失败案例,并从中反推出计数、定位、文字识别、空间判断等10项基础视觉能力。团队据此制作了3000道题,每道题只测一项能力,回答时仅需看图,无需推理或外部知识。项目代码和数据集已开放。