GPT-6 Astra家具组装纠错准确率达80%

IT时代网9月26日消息,Epoch AI于当地时间9月23日公布一组家具组装基准测试(FAB)结果,多模态AI在识别宜家家具组装错误方面取得明显进展,OpenAI最新的GPT-6 Astra以80%的准确率位居榜首,相比2025年底提升近三倍。

该测试用60张宜家家具组装过程照片评估AI模型的视觉与空间推理能力:测试人员选取三款宜家家具故意错误组装,拍摄不同阶段的照片,要求AI将照片与官方安装说明书比对,找出错误位置并说明具体问题。测试时AI不仅获得组装照片,还会同时获得官方PDF说明书、图片放大工具以及Python解释器,评分采用多阶段验证,只要正确定位错误步骤并大致说明问题即可得分。

排名上,Anthropic的Claude Fable 5.1和Claude Opus 5分别达到70%和61%;作为对照,2025年11月时的领先模型Claude Opus 4.5准确率仅为28%,前沿模型在约10个月内实现大幅提升。GPT-6 Astra完成单张照片分析的中位耗时约3分钟,是研究中速度最快的模型,比此前领先模型快约2至10倍,但距离真正意义上的实时识别仍有差距。

研究还分析了不同模型的错误倾向:谷歌Gemini和阿里Qwen系列几乎总是先假设存在错误再去找错误,早期Anthropic和OpenAI模型则经常完全找不到错误。开源权重模型中表现最好的Kimi K3相比国际前沿约落后7个月,这一差距比其在综合能力评估中的落后幅度更大,视觉推理仍是部分中国模型相对薄弱的方向。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END