✕
即時經濟
2026-09-30 20:54:50

Google推旗舰模型Gemini 4 Argon 基准测试结果胜对手 惹「刷榜」质疑

Alphabet旗下Google推出新一款旗舰人工智能模型Gemini 4 Argon,称它为目前最先进的AI模型,主攻复杂、长时间工作流程,包括软件开发、网络安全任务。不过,据彭博报道,该模型在正面临公司内部,对其在程式码编写等关键领域表现的疑虑;并引述专家指Google或过度关注基准测试而「刷榜」(benchmaxxing)。

据报Gemini 4 Argon主打长时间软件工程、企业知识工作与网路安全防御等复杂任务。Google周三向一小群资讯安全合作伙伴公开该模型,并表示在经过额外测试后,将从付费用户开始扩大开放存取权。该公司指出,Gemini 4在多项基准测试中取得领先成绩,包括在衡量安全技能的测试中胜过OpenAI的Astra模型。

Google称目前最先进AI模型

据Google 公布的测试结果,Gemini 4 Argon在 DeepSWE v1.1 长周期软件工程测试取得 77.9%,高于 Claude Opus 5.5 的 74.2% 与 GPT-6 Astra 的 74.1%。Google称Gemini 4 Argon为目前最先进的AI模型,但目前尚未全面开放给一般使用者。

否认Gemini 4程式码编不佳

不过彭博引述Google内部人士指,虽然Gemini 4在广泛用于衡量模型效能的基准测试中表现优异,但当员工实际将其投入工作时,表现却大打折扣。知情人士表示,该模型在处理特定程式码编写任务时相当吃力。Google回应指,Gemini 4在程式码编写等领域表现不佳并不准确。有熟悉模型开发的Google员工表示亦否认模型在处理复杂、真实世界的程式码编写任务时面临困难。

刷榜:专注评测中取得高分

报道引述专家表示,Google可能受业界过度关注基准测试倾向的困扰,这种现象被称为「刷榜」(benchmaxxing),即工程师比起创造能良好完成工作的产品,更专注于取得高分。AI 实验室往往会这么做,因为客户经常透过基准测试分数来评价模型。两位熟悉该模型的人士表示,Gemini 4 似乎受到了这种做法的影响。

去年11月,Google推出Gemini 3大受好评,并被视为公司跟上OpenAI和Anthropic的转折点。Google在5月的 I/O 大会上宣布了名为Gemini 3.5 Pro的新改版,并承诺在次月发布该模型。但知情人士透露,该公司其后已放弃了3.5 Pro。