详细调试信息 - getPostsByCategory:
当前 cat_name: 即時經濟
传入的 cat_slugs: %e5%8d%b3%e6%99%82%e7%b6%93%e6%bf%9f
当前页码: 1
is_lifetime: false
时间条件: 即時新聞 - 3個月以內
查询结果:
找到文章数: 2504
最大页数: 251
当前返回文章ID数: 10
文章IDs: 7643422, 7643265, 7643257, 7643213, 7643195, 7643198, 7643178, 7643163, 7643059, 7642979
第1页第一篇文章日期: 2026-10-01
第1页最后一篇文章日期: 2026-09-30

Google推旗艦模型Gemini 4 Argon 基準測試結果勝對手 惹「刷榜」質疑

Alphabet旗下Google推出新一款旗艦人工智能模型Gemini 4 Argon,稱它為目前最先進的AI模型,主攻複雜、長時間工作流程,包括軟件開發、網絡安全任務。不過,據彭博報道,該模型在正面臨公司內部,對其在程式碼編寫等關鍵領域表現的疑慮;並引述專家指Google或過度關注基準測試而「刷榜」(benchmaxxing)。

據報Gemini 4 Argon主打長時間軟件工程、企業知識工作與網路安全防禦等複雜任務。Google周三向一小群資訊安全合作夥伴公開該模型,並表示在經過額外測試後,將從付費用戶開始擴大開放存取權。該公司指出,Gemini 4在多項基準測試中取得領先成績,包括在衡量安全技能的測試中勝過OpenAI的Astra模型。

Google稱目前最先進AI模型

據Google 公布的測試結果,Gemini 4 Argon在 DeepSWE v1.1 長周期軟件工程測試取得 77.9%,高於 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1%。Google稱Gemini 4 Argon為目前最先進的AI模型,但目前尚未全面開放給一般使用者。

否認Gemini 4程式碼編不佳

不過彭博引述Google內部人士指,雖然Gemini 4在廣泛用於衡量模型效能的基準測試中表現優異,但當員工實際將其投入工作時,表現卻大打折扣。知情人士表示,該模型在處理特定程式碼編寫任務時相當吃力。Google回應指,Gemini 4在程式碼編寫等領域表現不佳並不準確。有熟悉模型開發的Google員工表示亦否認模型在處理複雜、真實世界的程式碼編寫任務時面臨困難。

刷榜:專注評測中取得高分

報道引述專家表示,Google可能受業界過度關注基準測試傾向的困擾,這種現象被稱為「刷榜」(benchmaxxing),即工程師比起創造能良好完成工作的產品,更專注於取得高分。AI 實驗室往往會這麼做,因為客戶經常透過基準測試分數來評價模型。兩位熟悉該模型的人士表示,Gemini 4 似乎受到了這種做法的影響。

去年11月,Google推出Gemini 3大受好評,並被視為公司跟上OpenAI和Anthropic的轉折點。Google在5月的 I/O 大會上宣布了名為Gemini 3.5 Pro的新改版,並承諾在次月發布該模型。但知情人士透露,該公司其後已放棄了3.5 Pro。
 

---------------------------------------------

>>>星島網WhatsApp爆料熱線(416)6775679,爆料一經錄用,薄酬致意。

>>>立即瀏覽【生活百答】欄目:新移民抵埗攻略,老華僑也未必知道的事,移民、工作、居住、食玩買、交通、報稅、銀行、福利、生育、教育。
點擊以下6大平台 接收加拿大新聞及生活資訊

延伸閱讀

延伸閱讀

新世界向機管局交還11 SKIES 支付23億元

本港8月新批按揭貸額和宗數均跌逾28% 齊創近半年新低

Meta智能體Muse推出22日下載突破500萬 破ChatGPT紀錄

【買家須知】樓花買家悔約輸掉的不只是訂金 還有⋯⋯