看板 Stock
作者 adamcha (生於安樂 死於憂患)
標題 [新聞] Gemini 4 Pro疑偷跑 四大跑分全面領先
時間 Fri Sep 18 14:22:11 2026



原文標題
谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable

原文連結:
https://news.cnyes.com/news/id/6609933

發布時間:
2026-09-18 12:00

記者署名:  鉅亨網新聞中心

原文內容:

Google(GOOGL-US)下一代旗艦模型Gemini 4 Pro疑似已「偷跑」上線。流出的基準測試顯
示,該模型在程式編碼、AI代理、推理及電腦操作等多項能力上,均領先OpenAI Astra與
Anthropic Fable 5.1,引發AI圈高度關注。


近日,AI模型競技場Arena出現一款名為「gemini-3.8-flash」的匿名模型,經多名開發
者實測後,被認為極可能是Gemini 4 Pro的早期版本。

Google上一次大幅更新Gemini Pro系列,已是7個月前推出的Gemini 3.1 Pro。Google執
行長皮查伊曾在Google I/O大會預告,Gemini 3.5 Pro將於6月上線,但最終未如期發布



匿名模型疑為Gemini 4 Pro

本月初更有消息指出,Google已取消Gemini 3.5 Pro,原因是模型進步幅度有限,表現甚
至不及Flash版本。相較之下,Gemini 4在預訓練階段的評估結果良好,後訓練工作也持
續推進。


如今,Arena突然出現同樣名為「gemini-3.8-flash」的模型,因Google早在9月初就已發
布Gemini 3.8 Flash,同名模型再度現身並不尋常。

多名開發者實際測試後發現,新模型的能力明顯高於既有版本,因此推測它可能是披著「
gemini-3.8-flash」外衣的Gemini 4 Pro首個檢查點版本。

四大測試全面領先

從網路流傳的基準測試圖來看,Gemini 4 Pro在多個項目取得領先。於評估AI代理編碼能
力的DeepSWE v1.1測試中,Gemini 4 Pro獲得約88%的成績,比Astra高出近2個百分點。

在衡量真實知識工作任務的GDPval-AA v2測試中,Gemini 4 Pro是唯一取得2,064分Elo評
級的模型;Terminal-bench 2.1終端編碼測試則拿下95.3%,同樣排名第一。


至於OSWorld-2.0電腦操作能力測試,Gemini 4 Pro獲得86.8%,超越Astra與Fable 5.1。

若相關數據屬實,Gemini 4 Pro不僅在編碼、AI代理及電腦操作方面展現競爭力,價格也
可能低於另外兩款模型。流傳資訊顯示,其每百萬Token輸入價格為2.25美元,輸出價格
為11.25美元。


另有AI研究員進入模型後端後發現,Gemini 4 Pro可能具備1,000萬Token輸入上限、25.6
萬Token輸出上限,以及跨對話永久記憶功能,並能在不使用API的情況下直接連網。

不過,上述規格目前仍未獲Google正式證實。

UI、3D與SVG能力躍進

除了跑分之外,Gemini 4 Pro的實際生成效果也引起討論。

有開發者僅花14分鐘,就利用該模型建立一個以素描、鉛筆及石墨質感為主題的創意展示
網頁,並將「滾動即筆觸」轉化為互動效果,隨著頁面向下滑動,畫面線條也會逐漸加深


另一項網頁設計測試則融合賽博龐克與復古未來主義風格,首屏加入3D網格、資料儀表板
及可互動的3D模型,顯示其在介面設計與視覺呈現上的能力有所提升。

在SVG及3D生成測試中,Gemini 4 Pro同樣展現進步。以「鵜鶘騎自行車」為例,模型一
次完成配色、日夜切換、車燈、解剖標註與踏頻控制等多項要求。開發者指出,新模型生
成速度快,對複雜指令的理解也更準確。


Gemini 4 Pro還在10分鐘內完成空中巴士H145直升機的3D模型,並生成像素風3D寶塔。另
一項3D飛行模擬測試中,其畫面效果也明顯優於既有的Gemini 3.8 Flash,進一步加深外
界對兩者並非同一模型的推測。


可直接生成互動遊戲

遊戲開發也是此次實測的重點。Gemini 4 Pro被指能直接產生具完整互動邏輯的小型遊戲
,包括從頁面架構到各模組設計的《Minecraft》風格作品,以及3D卡丁車競速遊戲,完
成度可與先前公布的Astra測試結果相比。


這些成果顯示,Gemini 4 Pro的能力已不只侷限於文字問答與程式碼生成,而是進一步延
伸至使用者介面、互動網頁、3D模型及遊戲開發等多模態應用。

Google押注遞迴式自我改進

Gemini 4 Pro能力快速提升的背後,也被外界與RSI(遞迴式自我改進)連結。Google
DeepMind首席策略長Jasjeet Sekhon上月在柏克萊一場活動中表示,RSI已成為AI巨額投
資邏輯的重要一環。若AI能持續參與並改善自身能力,模型進步速度可能進一步加快。

近期網路更流傳,Gemini 4之所以能提前完成預訓練,是因Google DeepMind已在訓練過
程中建立RSI閉環。Google日前公開的Dream-RSI研究,也聚焦於讓AI代理在探索過程中持
續改善搜尋策略,並從經驗中優化下一輪探索。


不過,Gemini 4 Pro目前的身分、測試成績、價格及技術規格,仍主要來自外流資料與開
發者實測,Google尚未正式公布。

面對OpenAI Astra及Anthropic Fable 5.1,這款匿名模型是否真是Google的新一代旗艦
,以及最終版本能否維持現有表現,仍有待官方揭曉。

心得/評論:

Gemini已經被笑好幾個月了  看起來這次有機會反超另外兩家

只不過前陣子說要放緩研發  現在看起來比較像商業競爭的手段而已

--
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 220.128.97.223 (臺灣)
※ 作者: adamcha 2026-09-18 14:22:11
※ 文章代碼(AID): #1ghDYMjB (Stock)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1789712534.A.B4B.html
cuteSquirrel: 說好的減速ㄋ?1F 09/18 14:22
wwrand23: 這垃圾還有人用嗎2F 09/18 14:23
cuteSquirrel: 你減速 我偷跑 珍香3F 09/18 14:23
STi2011: 三巨頭:慢一點4F 09/18 14:24
as3366700: 從2.5pro開始每次出新東西都吹一遍,每次都被看破手5F 09/18 14:24
STi2011: 結果每一個都死命沖 每一個!6F 09/18 14:24
as3366700: 腳 這輩子就風光一次香蕉 吃了別人原本不重視圖像生7F 09/18 14:24
laugh8562: 真會喇吧8F 09/18 14:24
as3366700: 成的福利而已9F 09/18 14:24
Flyroach: 剛出被說超猛→用的人變多→變智障10F 09/18 14:25
chang1248w: 跑分狗11F 09/18 14:25
ZO20: 蒸餾完了?12F 09/18 14:25
loleea: 都在輪流超車13F 09/18 14:25
OGoTTe: 我都沒讀書(考100分)14F 09/18 14:26
as3366700: 其他家token爆了起碼乖乖承認然後關新訂閱或抬價15F 09/18 14:26
yinaser: 繼續限算力下就是北美豆包16F 09/18 14:26
kducky: 喔素喔尊嘟假嘟17F 09/18 14:26
as3366700: 這家騙一堆人進來之後偷偷把AI降智省token 噁心得要命 信任已經破產了18F 09/18 14:26
goshnash: 說回家都在玩,考試出來100分20F 09/18 14:27
jympin: 估狗軟很久了 要重返榮耀了沒21F 09/18 14:28
chirex: 不是才說要暫緩腳步?22F 09/18 14:28
Weky: 軍備競賽沒人管根本無解  肯定出大事後大家才會收手23F 09/18 14:29
kivan00: 互抄算法沒什麼 能經過壓力測試還不降智才是真功夫24F 09/18 14:29
deepelves: 可是狗狗本來就不是三巨頭阿25F 09/18 14:29
EQUP: 現在還看不出Open AI就是AI之王的人也就這樣了26F 09/18 14:29
trogtor: 我都在玩沒在看書準備考試 (考100分)27F 09/18 14:29
Juniorlin02: 最近真的進步很多很棒28F 09/18 14:29
s114752: 乾 不是要放緩???29F 09/18 14:31
Juniorlin02: 現在還看不出來Google就是AI之王的人也就那樣了30F 09/18 14:31
QJP05l8: 三巨頭: (別人家的)AI發展必須暫緩31F 09/18 14:32
jcgood: 真的假的啦,糞G今年爛成這樣已經被丟掉了說,終於可以使用了嗎32F 09/18 14:32
u9596g12: 傻瓜龍要重返農藥了沒?
整天AI幻覺就G34F 09/18 14:32
kill780215: 跑分用(^.^) 實際用一天不到又開始降智( ^ ▽^ )36F 09/18 14:32
kivan00: 現在消費市場使用的大約還落後LAB裡的兩代37F 09/18 14:33
Juniorlin02: chrome、gmail、YT各種服務繼續用,然後邊嘴沒價值38F 09/18 14:33
u9596g12: G一開始超猛啊 沒人否認 但降智速度也是離譜39F 09/18 14:34
s881720: 訂閱一年快到了 推4出來騙續訂40F 09/18 14:34
jjjj222: 哪家好用就訂哪家, 誰管你跑幾分41F 09/18 14:34
fdkevin: 要重返農藥了嗎42F 09/18 14:34
Juniorlin02: 有影響代表一堆人搶著用,你先不要用品質就回來了43F 09/18 14:35
coolchife: 抓到了。你說的沒錯44F 09/18 14:35
uxy82: (你們)跑慢點45F 09/18 14:36
gygygy0917: GEMINI 真的是失智AI 有夠難用一直亂回答= =46F 09/18 14:37
unrealstars: 潘朵拉盒子打開後就停不下來惹,放緩個洨47F 09/18 14:37
rhythm7321: 終究還是美國豆包48F 09/18 14:37
bikevts: 開放衝飛天,然後降智鑽地底49F 09/18 14:37
kullan: 美國豆包別說了50F 09/18 14:38
karta018: 估狗想害人類滅亡嗎51F 09/18 14:38
LoveSports: 每一家都是出來沒多久就綁鎖鏈啊 安全至上52F 09/18 14:38
as3366700: 這家就是先觀望一個月 每次一堆人用就降智省成本53F 09/18 14:38
LoveSports: 所以要趁前幾個禮拜生成好東西54F 09/18 14:38
as3366700: 剛開始都假的55F 09/18 14:38
chinaeatshit: 嗄聊迷你ai56F 09/18 14:38
saladbread: 關不住,自己跑出來的57F 09/18 14:39
tim92: 這麼大的藍海市場贏家全拿還信要一起走慢點58F 09/18 14:39
LoveSports: 我常常不小心繞過去 應該不是降智 是綁鎖鏈59F 09/18 14:39
Sianan: 遞迴式自我改進看起來很厲害60F 09/18 14:39
sheep2009: 好了啦 傻龍61F 09/18 14:39
hosen: 鬼故事又來了,要升息就故意喊減速;只生一碼,新model來了62F 09/18 14:39
karta018: 新模型都剛開放前幾天最強,後面就越來越笨64F 09/18 14:40
A80211ab: 每次都說聰明  後來都比別人笨65F 09/18 14:40
fallinlove15: 三巨頭:大家一起放慢 好不好!66F 09/18 14:40
SecondRun: 米國豆包怎麼可能強67F 09/18 14:40
LoveSports: Google闔家歡 鎖鏈一定是綁最多層的 不然賠死68F 09/18 14:40
lingsk: 我一直停留在它以前AI幻覺超嚴重的事實69F 09/18 14:41
ake1234: 騙訂閱的時間到了70F 09/18 14:41
Gundam77: 喊減速都第一個偷跑,小時候被騙,不要長大也被騙。考試都跟你說沒看書,大家放輕鬆,電動打通宵。71F 09/18 14:42
asdasd4522: 減速就是她媽的在騙韭菜散戶73F 09/18 14:43
Gundam77: 誰信誰傻B。74F 09/18 14:43
a069275235: 彎道超車阿 拿模厲害75F 09/18 14:43
LoveSports: 沒看書是真的啦 神經多樣性大多有圖像記憶
不要再毀謗說沒看書是騙人的 我國中就是這樣被霸凌我前幾年考某種考試考榜首 只看一次沒做筆記
神經典型很難理解 可是這不是騙人76F 09/18 14:44
p95649564: 咕狗: 聽說你們要減速 準備超車80F 09/18 14:45
justiceyes: 你OK,我先跑81F 09/18 14:46
Juniorlin02: 有的人就是天資聰穎,看一次就100分,你怪我?82F 09/18 14:47
brain9453: 超糞83F 09/18 14:48
jaxjax: 有沒有記憶功能?84F 09/18 14:49
Juniorlin02: 年底準備繼續續約訂閱,去年半價3250優惠還送5T超香85F 09/18 14:49
max0616: 你信不信 我反正是信了86F 09/18 14:49
rhrh1129: 繼續用GPT-6 有夠好用87F 09/18 14:49
klwei: 太卑鄙了88F 09/18 14:50
mynumber55: 好了啊,是要騙幾次89F 09/18 14:51
g5637128: 彎道超車90F 09/18 14:51
oyaji5566: google ai studio講出來沒人聽過,根本沒人用g家ai寫程式91F 09/18 14:52
Juniorlin02: GPT送我都不屑用,Google體系用起來未來完美整合93F 09/18 14:52
deann: 說好大家要放緩新模型開發的94F 09/18 14:52
joygo: 他每次都說的很厲害 實際上都很哭95F 09/18 14:53
salamender: 可愛龍等等就變身了96F 09/18 14:53
Juniorlin02: 未來自動讀信自動導航整合GOOGLE眼鏡的完美小秘書97F 09/18 14:53
joke3547: 老G家別掙扎了,贏不了O家跟A家的98F 09/18 14:54
Beakidd: 屁啦,Gemini笨得要死,新模型能超車?99F 09/18 14:56
vltw5v: 這幾家大廠就是互相領先 這樣很好啊 持續進步 沒對手就不會進步了244F 09/18 15:51
[圖]
berton1: 輸了就是flash3.8.1,贏了就是pro4.0247F 09/18 15:52
RLH: 展示用的 給訂戶是另一回事248F 09/18 15:54

--
--
(adamcha.): [新聞] Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable - Stock板