谷歌Meta被指AI跑分作弊引回应

IT时代网9月8日消息,谷歌、Meta 这两年在 AI 大模型竞争中一度落伍,与 Anthropic 及 OpenAI 的差距一度拉大,但最新的 Gemini 3.8 Flash 与 Muse Spark 1.3 在第三方榜单上一度反超两家旗舰模型。知名分析机构 SemiAnalysis 日前发文,认为两家新模型存在过拟合,直白说就是针对榜单评测做了刷分。

对于跑分作弊的指控,谷歌方面暂无回应,Meta AI 业务主管 Alexandr Wang 率先反驳,称这一论点站不住脚,理由是 OpenAI 也一样:GPT-5.6 Sol 在难度较低的 TerminalBench 2.1 拿到 88.8%,在难度更高的 TerminalBench 4.0 也只有 37.3%。

这个反击颇为巧妙。SemiAnalysis 指控两家靠 TB 2.1 之类评测刷高分的证据,正是新基准 TB 4.0 下跑分大幅下滑;Wang 的回应则是不同难度基准分数本就不同,OpenAI 旗舰同样如此,问题出在测试项目——旧基准已饱和,新基准未饱和,就像考试变难了,不能说在简单卷子上拿高分就一定作弊。

他还不忘强调,Spark 1.3 当然不可能像 Astra 或 Fable5.1 那样强大,但性价比高得多,未来的大模型会更直接地与这两家旗舰竞争。

注:本文中包含AI辅助创作的内容。

编辑:林一舟

THE END