看板 Stock作者 adamcha (生於安樂 死於憂患)標題 [新聞] Gemini 4 Pro疑偷跑 四大跑分全面領先時間 Fri Sep 18 14:22:11 2026
原文標題
谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable
原文連結:
https://news.cnyes.com/news/id/6609933
發布時間:
2026-09-18 12:00
記者署名: 鉅亨網新聞中心
原文內容:
Google(GOOGL-US)下一代旗艦模型Gemini 4 Pro疑似已「偷跑」上線。流出的基準測試顯
示,該模型在程式編碼、AI代理、推理及電腦操作等多項能力上,均領先OpenAI Astra與
Anthropic Fable 5.1,引發AI圈高度關注。
近日,AI模型競技場Arena出現一款名為「gemini-3.8-flash」的匿名模型,經多名開發
者實測後,被認為極可能是Gemini 4 Pro的早期版本。
Google上一次大幅更新Gemini Pro系列,已是7個月前推出的Gemini 3.1 Pro。Google執
行長皮查伊曾在Google I/O大會預告,Gemini 3.5 Pro將於6月上線,但最終未如期發布
。
匿名模型疑為Gemini 4 Pro
本月初更有消息指出,Google已取消Gemini 3.5 Pro,原因是模型進步幅度有限,表現甚
至不及Flash版本。相較之下,Gemini 4在預訓練階段的評估結果良好,後訓練工作也持
續推進。
如今,Arena突然出現同樣名為「gemini-3.8-flash」的模型,因Google早在9月初就已發
布Gemini 3.8 Flash,同名模型再度現身並不尋常。
多名開發者實際測試後發現,新模型的能力明顯高於既有版本,因此推測它可能是披著「
gemini-3.8-flash」外衣的Gemini 4 Pro首個檢查點版本。
四大測試全面領先
從網路流傳的基準測試圖來看,Gemini 4 Pro在多個項目取得領先。於評估AI代理編碼能
力的DeepSWE v1.1測試中,Gemini 4 Pro獲得約88%的成績,比Astra高出近2個百分點。
在衡量真實知識工作任務的GDPval-AA v2測試中,Gemini 4 Pro是唯一取得2,064分Elo評
級的模型;Terminal-bench 2.1終端編碼測試則拿下95.3%,同樣排名第一。
至於OSWorld-2.0電腦操作能力測試,Gemini 4 Pro獲得86.8%,超越Astra與Fable 5.1。
若相關數據屬實,Gemini 4 Pro不僅在編碼、AI代理及電腦操作方面展現競爭力,價格也
可能低於另外兩款模型。流傳資訊顯示,其每百萬Token輸入價格為2.25美元,輸出價格
為11.25美元。
另有AI研究員進入模型後端後發現,Gemini 4 Pro可能具備1,000萬Token輸入上限、25.6
萬Token輸出上限,以及跨對話永久記憶功能,並能在不使用API的情況下直接連網。
不過,上述規格目前仍未獲Google正式證實。
UI、3D與SVG能力躍進
除了跑分之外,Gemini 4 Pro的實際生成效果也引起討論。
有開發者僅花14分鐘,就利用該模型建立一個以素描、鉛筆及石墨質感為主題的創意展示
網頁,並將「滾動即筆觸」轉化為互動效果,隨著頁面向下滑動,畫面線條也會逐漸加深
。
另一項網頁設計測試則融合賽博龐克與復古未來主義風格,首屏加入3D網格、資料儀表板
及可互動的3D模型,顯示其在介面設計與視覺呈現上的能力有所提升。
在SVG及3D生成測試中,Gemini 4 Pro同樣展現進步。以「鵜鶘騎自行車」為例,模型一
次完成配色、日夜切換、車燈、解剖標註與踏頻控制等多項要求。開發者指出,新模型生
成速度快,對複雜指令的理解也更準確。
Gemini 4 Pro還在10分鐘內完成空中巴士H145直升機的3D模型,並生成像素風3D寶塔。另
一項3D飛行模擬測試中,其畫面效果也明顯優於既有的Gemini 3.8 Flash,進一步加深外
界對兩者並非同一模型的推測。
可直接生成互動遊戲
遊戲開發也是此次實測的重點。Gemini 4 Pro被指能直接產生具完整互動邏輯的小型遊戲
,包括從頁面架構到各模組設計的《Minecraft》風格作品,以及3D卡丁車競速遊戲,完
成度可與先前公布的Astra測試結果相比。
這些成果顯示,Gemini 4 Pro的能力已不只侷限於文字問答與程式碼生成,而是進一步延
伸至使用者介面、互動網頁、3D模型及遊戲開發等多模態應用。
Google押注遞迴式自我改進
Gemini 4 Pro能力快速提升的背後,也被外界與RSI(遞迴式自我改進)連結。Google
DeepMind首席策略長Jasjeet Sekhon上月在柏克萊一場活動中表示,RSI已成為AI巨額投
資邏輯的重要一環。若AI能持續參與並改善自身能力,模型進步速度可能進一步加快。
近期網路更流傳,Gemini 4之所以能提前完成預訓練,是因Google DeepMind已在訓練過
程中建立RSI閉環。Google日前公開的Dream-RSI研究,也聚焦於讓AI代理在探索過程中持
續改善搜尋策略,並從經驗中優化下一輪探索。
不過,Gemini 4 Pro目前的身分、測試成績、價格及技術規格,仍主要來自外流資料與開
發者實測,Google尚未正式公布。
面對OpenAI Astra及Anthropic Fable 5.1,這款匿名模型是否真是Google的新一代旗艦
,以及最終版本能否維持現有表現,仍有待官方揭曉。
心得/評論:
Gemini已經被笑好幾個月了 看起來這次有機會反超另外兩家
只不過前陣子說要放緩研發 現在看起來比較像商業競爭的手段而已
--
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 220.128.97.223 (臺灣)
※ 作者: adamcha 2026-09-18 14:22:11
※ 文章代碼(AID): #1ghDYMjB (Stock)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1789712534.A.B4B.html
推 as3366700: 從2.5pro開始每次出新東西都吹一遍,每次都被看破手5F 09/18 14:24
→ STi2011: 結果每一個都死命沖 每一個!6F 09/18 14:24
→ as3366700: 腳 這輩子就風光一次香蕉 吃了別人原本不重視圖像生7F 09/18 14:24
→ Flyroach: 剛出被說超猛→用的人變多→變智障10F 09/18 14:25
→ ZO20: 蒸餾完了?12F 09/18 14:25
推 loleea: 都在輪流超車13F 09/18 14:25
推 OGoTTe: 我都沒讀書(考100分)14F 09/18 14:26
→ as3366700: 其他家token爆了起碼乖乖承認然後關新訂閱或抬價15F 09/18 14:26
推 yinaser: 繼續限算力下就是北美豆包16F 09/18 14:26
→ kducky: 喔素喔尊嘟假嘟17F 09/18 14:26
→ as3366700: 這家騙一堆人進來之後偷偷把AI降智省token 噁心得要命 信任已經破產了18F 09/18 14:26
推 goshnash: 說回家都在玩,考試出來100分20F 09/18 14:27
推 jympin: 估狗軟很久了 要重返榮耀了沒21F 09/18 14:28
噓 chirex: 不是才說要暫緩腳步?22F 09/18 14:28
→ Weky: 軍備競賽沒人管根本無解 肯定出大事後大家才會收手23F 09/18 14:29
→ kivan00: 互抄算法沒什麼 能經過壓力測試還不降智才是真功夫24F 09/18 14:29
→ EQUP: 現在還看不出Open AI就是AI之王的人也就這樣了26F 09/18 14:29
推 trogtor: 我都在玩沒在看書準備考試 (考100分)27F 09/18 14:29
推 s114752: 乾 不是要放緩???29F 09/18 14:31
→ Juniorlin02: 現在還看不出來Google就是AI之王的人也就那樣了30F 09/18 14:31
推 QJP05l8: 三巨頭: (別人家的)AI發展必須暫緩31F 09/18 14:32
推 jcgood: 真的假的啦,糞G今年爛成這樣已經被丟掉了說,終於可以使用了嗎32F 09/18 14:32
→ u9596g12: 傻瓜龍要重返農藥了沒?
整天AI幻覺就G34F 09/18 14:32
推 kill780215: 跑分用(^.^) 實際用一天不到又開始降智( ^ ▽^ )36F 09/18 14:32
→ kivan00: 現在消費市場使用的大約還落後LAB裡的兩代37F 09/18 14:33
→ Juniorlin02: chrome、gmail、YT各種服務繼續用,然後邊嘴沒價值38F 09/18 14:33
→ u9596g12: G一開始超猛啊 沒人否認 但降智速度也是離譜39F 09/18 14:34
推 s881720: 訂閱一年快到了 推4出來騙續訂40F 09/18 14:34
→ jjjj222: 哪家好用就訂哪家, 誰管你跑幾分41F 09/18 14:34
推 uxy82: (你們)跑慢點45F 09/18 14:36
噓 gygygy0917: GEMINI 真的是失智AI 有夠難用一直亂回答= =46F 09/18 14:37
推 bikevts: 開放衝飛天,然後降智鑽地底49F 09/18 14:37
推 kullan: 美國豆包別說了50F 09/18 14:38
→ as3366700: 這家就是先觀望一個月 每次一堆人用就降智省成本53F 09/18 14:38
噓 tim92: 這麼大的藍海市場贏家全拿還信要一起走慢點58F 09/18 14:39
→ LoveSports: 我常常不小心繞過去 應該不是降智 是綁鎖鏈59F 09/18 14:39
推 Sianan: 遞迴式自我改進看起來很厲害60F 09/18 14:39
推 hosen: 鬼故事又來了,要升息就故意喊減速;只生一碼,新model來了62F 09/18 14:39
→ karta018: 新模型都剛開放前幾天最強,後面就越來越笨64F 09/18 14:40
推 A80211ab: 每次都說聰明 後來都比別人笨65F 09/18 14:40
→ LoveSports: Google闔家歡 鎖鏈一定是綁最多層的 不然賠死68F 09/18 14:40
→ lingsk: 我一直停留在它以前AI幻覺超嚴重的事實69F 09/18 14:41
→ Gundam77: 喊減速都第一個偷跑,小時候被騙,不要長大也被騙。考試都跟你說沒看書,大家放輕鬆,電動打通宵。71F 09/18 14:42
推 LoveSports: 沒看書是真的啦 神經多樣性大多有圖像記憶
不要再毀謗說沒看書是騙人的 我國中就是這樣被霸凌我前幾年考某種考試考榜首 只看一次沒做筆記
神經典型很難理解 可是這不是騙人76F 09/18 14:44
推 jaxjax: 有沒有記憶功能?84F 09/18 14:49
→ Juniorlin02: 年底準備繼續續約訂閱,去年半價3250優惠還送5T超香85F 09/18 14:49
推 max0616: 你信不信 我反正是信了86F 09/18 14:49
推 rhrh1129: 繼續用GPT-6 有夠好用87F 09/18 14:49
推 klwei: 太卑鄙了88F 09/18 14:50
推 oyaji5566: google ai studio講出來沒人聽過,根本沒人用g家ai寫程式91F 09/18 14:52
推 Juniorlin02: GPT送我都不屑用,Google體系用起來未來完美整合93F 09/18 14:52
推 deann: 說好大家要放緩新模型開發的94F 09/18 14:52
→ joygo: 他每次都說的很厲害 實際上都很哭95F 09/18 14:53
→ Juniorlin02: 未來自動讀信自動導航整合GOOGLE眼鏡的完美小秘書97F 09/18 14:53
推 joke3547: 老G家別掙扎了,贏不了O家跟A家的98F 09/18 14:54
推 Beakidd: 屁啦,Gemini笨得要死,新模型能超車?99F 09/18 14:56
推 vltw5v: 這幾家大廠就是互相領先 這樣很好啊 持續進步 沒對手就不會進步了244F 09/18 15:51
推 berton1: 輸了就是flash3.8.1,贏了就是pro4.0247F 09/18 15:52
推 RLH: 展示用的 給訂戶是另一回事248F 09/18 15:54
--