视觉基准测试

开源项目

SWE-Vision：让大模型用代码“看见”世界，五大视觉基准刷新SOTA

多模态大模型在代码生成与理解方面取得了显著进展，但其在基础视觉任务上的表现却时常不尽如人意。针对这一短板，UniPat AI 提出了一个极简的视觉智能体框架——SWE-Vision。该框架的核心思想是让模型能够编写并执行 Python 代码，以此处理和验证自身的视觉判断。在五个主流视觉基准测试中，SWE-Vision 均取得了当前最优的性能。 01｜模型看得…

8小时前
32000