看板 Stock作者 adamcha (生於安樂 死於憂患)標題 [新聞] Gemini 4 Pro疑偷跑 四大跑分全面領先時間 Fri Sep 18 14:22:11 2026
原文標題
谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable
原文連結:
https://news.cnyes.com/news/id/6609933
發布時間:
2026-09-18 12:00
記者署名: 鉅亨網新聞中心
原文內容:
Google(GOOGL-US)下一代旗艦模型Gemini 4 Pro疑似已「偷跑」上線。流出的基準測試顯
示,該模型在程式編碼、AI代理、推理及電腦操作等多項能力上,均領先OpenAI Astra與
Anthropic Fable 5.1,引發AI圈高度關注。
近日,AI模型競技場Arena出現一款名為「gemini-3.8-flash」的匿名模型,經多名開發
者實測後,被認為極可能是Gemini 4 Pro的早期版本。
Google上一次大幅更新Gemini Pro系列,已是7個月前推出的Gemini 3.1 Pro。Google執
行長皮查伊曾在Google I/O大會預告,Gemini 3.5 Pro將於6月上線,但最終未如期發布
。
匿名模型疑為Gemini 4 Pro
本月初更有消息指出,Google已取消Gemini 3.5 Pro,原因是模型進步幅度有限,表現甚
至不及Flash版本。相較之下,Gemini 4在預訓練階段的評估結果良好,後訓練工作也持
續推進。
如今,Arena突然出現同樣名為「gemini-3.8-flash」的模型,因Google早在9月初就已發
布Gemini 3.8 Flash,同名模型再度現身並不尋常。
多名開發者實際測試後發現,新模型的能力明顯高於既有版本,因此推測它可能是披著「
gemini-3.8-flash」外衣的Gemini 4 Pro首個檢查點版本。
四大測試全面領先
從網路流傳的基準測試圖來看,Gemini 4 Pro在多個項目取得領先。於評估AI代理編碼能
力的DeepSWE v1.1測試中,Gemini 4 Pro獲得約88%的成績,比Astra高出近2個百分點。
在衡量真實知識工作任務的GDPval-AA v2測試中,Gemini 4 Pro是唯一取得2,064分Elo評
級的模型;Terminal-bench 2.1終端編碼測試則拿下95.3%,同樣排名第一。
至於OSWorld-2.0電腦操作能力測試,Gemini 4 Pro獲得86.8%,超越Astra與Fable 5.1。
若相關數據屬實,Gemini 4 Pro不僅在編碼、AI代理及電腦操作方面展現競爭力,價格也
可能低於另外兩款模型。流傳資訊顯示,其每百萬Token輸入價格為2.25美元,輸出價格
為11.25美元。
另有AI研究員進入模型後端後發現,Gemini 4 Pro可能具備1,000萬Token輸入上限、25.6
萬Token輸出上限,以及跨對話永久記憶功能,並能在不使用API的情況下直接連網。
不過,上述規格目前仍未獲Google正式證實。
UI、3D與SVG能力躍進
除了跑分之外,Gemini 4 Pro的實際生成效果也引起討論。
有開發者僅花14分鐘,就利用該模型建立一個以素描、鉛筆及石墨質感為主題的創意展示
網頁,並將「滾動即筆觸」轉化為互動效果,隨著頁面向下滑動,畫面線條也會逐漸加深
。
另一項網頁設計測試則融合賽博龐克與復古未來主義風格,首屏加入3D網格、資料儀表板
及可互動的3D模型,顯示其在介面設計與視覺呈現上的能力有所提升。
在SVG及3D生成測試中,Gemini 4 Pro同樣展現進步。以「鵜鶘騎自行車」為例,模型一
次完成配色、日夜切換、車燈、解剖標註與踏頻控制等多項要求。開發者指出,新模型生
成速度快,對複雜指令的理解也更準確。
Gemini 4 Pro還在10分鐘內完成空中巴士H145直升機的3D模型,並生成像素風3D寶塔。另
一項3D飛行模擬測試中,其畫面效果也明顯優於既有的Gemini 3.8 Flash,進一步加深外
界對兩者並非同一模型的推測。
可直接生成互動遊戲
遊戲開發也是此次實測的重點。Gemini 4 Pro被指能直接產生具完整互動邏輯的小型遊戲
,包括從頁面架構到各模組設計的《Minecraft》風格作品,以及3D卡丁車競速遊戲,完
成度可與先前公布的Astra測試結果相比。
這些成果顯示,Gemini 4 Pro的能力已不只侷限於文字問答與程式碼生成,而是進一步延
伸至使用者介面、互動網頁、3D模型及遊戲開發等多模態應用。
Google押注遞迴式自我改進
Gemini 4 Pro能力快速提升的背後,也被外界與RSI(遞迴式自我改進)連結。Google
DeepMind首席策略長Jasjeet Sekhon上月在柏克萊一場活動中表示,RSI已成為AI巨額投
資邏輯的重要一環。若AI能持續參與並改善自身能力,模型進步速度可能進一步加快。
近期網路更流傳,Gemini 4之所以能提前完成預訓練,是因Google DeepMind已在訓練過
程中建立RSI閉環。Google日前公開的Dream-RSI研究,也聚焦於讓AI代理在探索過程中持
續改善搜尋策略,並從經驗中優化下一輪探索。
不過,Gemini 4 Pro目前的身分、測試成績、價格及技術規格,仍主要來自外流資料與開
發者實測,Google尚未正式公布。
面對OpenAI Astra及Anthropic Fable 5.1,這款匿名模型是否真是Google的新一代旗艦
,以及最終版本能否維持現有表現,仍有待官方揭曉。
心得/評論:
Gemini已經被笑好幾個月了 看起來這次有機會反超另外兩家
只不過前陣子說要放緩研發 現在看起來比較像商業競爭的手段而已
--
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 220.128.97.223 (臺灣)
※ 作者: adamcha 2026-09-18 14:22:11
※ 文章代碼(AID): #1ghDYMjB (Stock)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1789712534.A.B4B.html
推 as3366700: 從2.5pro開始每次出新東西都吹一遍,每次都被看破手5F 09/18 14:24
→ STi2011: 結果每一個都死命沖 每一個!6F 09/18 14:24
→ as3366700: 腳 這輩子就風光一次香蕉 吃了別人原本不重視圖像生7F 09/18 14:24
→ Flyroach: 剛出被說超猛→用的人變多→變智障10F 09/18 14:25
→ ZO20: 蒸餾完了?12F 09/18 14:25
推 loleea: 都在輪流超車13F 09/18 14:25
推 OGoTTe: 我都沒讀書(考100分)14F 09/18 14:26
→ as3366700: 其他家token爆了起碼乖乖承認然後關新訂閱或抬價15F 09/18 14:26
推 yinaser: 繼續限算力下就是北美豆包16F 09/18 14:26
→ kducky: 喔素喔尊嘟假嘟17F 09/18 14:26
→ as3366700: 這家騙一堆人進來之後偷偷把AI降智省token 噁心得要命 信任已經破產了18F 09/18 14:26
推 goshnash: 說回家都在玩,考試出來100分20F 09/18 14:27
推 jympin: 估狗軟很久了 要重返榮耀了沒21F 09/18 14:28
噓 chirex: 不是才說要暫緩腳步?22F 09/18 14:28
→ Weky: 軍備競賽沒人管根本無解 肯定出大事後大家才會收手23F 09/18 14:29
→ kivan00: 互抄算法沒什麼 能經過壓力測試還不降智才是真功夫24F 09/18 14:29
→ EQUP: 現在還看不出Open AI就是AI之王的人也就這樣了26F 09/18 14:29
推 trogtor: 我都在玩沒在看書準備考試 (考100分)27F 09/18 14:29
推 s114752: 乾 不是要放緩???29F 09/18 14:31
→ Juniorlin02: 現在還看不出來Google就是AI之王的人也就那樣了30F 09/18 14:31
推 QJP05l8: 三巨頭: (別人家的)AI發展必須暫緩31F 09/18 14:32
推 jcgood: 真的假的啦,糞G今年爛成這樣已經被丟掉了說,終於可以使用了嗎32F 09/18 14:32
→ u9596g12: 傻瓜龍要重返農藥了沒?
整天AI幻覺就G34F 09/18 14:32
推 kill780215: 跑分用(^.^) 實際用一天不到又開始降智( ^ ▽^ )36F 09/18 14:32
→ kivan00: 現在消費市場使用的大約還落後LAB裡的兩代37F 09/18 14:33
→ Juniorlin02: chrome、gmail、YT各種服務繼續用,然後邊嘴沒價值38F 09/18 14:33
→ u9596g12: G一開始超猛啊 沒人否認 但降智速度也是離譜39F 09/18 14:34
推 s881720: 訂閱一年快到了 推4出來騙續訂40F 09/18 14:34
→ jjjj222: 哪家好用就訂哪家, 誰管你跑幾分41F 09/18 14:34
推 uxy82: (你們)跑慢點45F 09/18 14:36
噓 gygygy0917: GEMINI 真的是失智AI 有夠難用一直亂回答= =46F 09/18 14:37
推 bikevts: 開放衝飛天,然後降智鑽地底49F 09/18 14:37
推 kullan: 美國豆包別說了50F 09/18 14:38
→ as3366700: 這家就是先觀望一個月 每次一堆人用就降智省成本53F 09/18 14:38
噓 tim92: 這麼大的藍海市場贏家全拿還信要一起走慢點58F 09/18 14:39
→ LoveSports: 我常常不小心繞過去 應該不是降智 是綁鎖鏈59F 09/18 14:39
推 Sianan: 遞迴式自我改進看起來很厲害60F 09/18 14:39
推 hosen: 鬼故事又來了,要升息就故意喊減速;只生一碼,新model來了62F 09/18 14:39
→ karta018: 新模型都剛開放前幾天最強,後面就越來越笨64F 09/18 14:40
推 A80211ab: 每次都說聰明 後來都比別人笨65F 09/18 14:40
→ LoveSports: Google闔家歡 鎖鏈一定是綁最多層的 不然賠死68F 09/18 14:40
→ lingsk: 我一直停留在它以前AI幻覺超嚴重的事實69F 09/18 14:41
→ Gundam77: 喊減速都第一個偷跑,小時候被騙,不要長大也被騙。考試都跟你說沒看書,大家放輕鬆,電動打通宵。71F 09/18 14:42
推 LoveSports: 沒看書是真的啦 神經多樣性大多有圖像記憶
不要再毀謗說沒看書是騙人的 我國中就是這樣被霸凌我前幾年考某種考試考榜首 只看一次沒做筆記
神經典型很難理解 可是這不是騙人76F 09/18 14:44
推 jaxjax: 有沒有記憶功能?84F 09/18 14:49
→ Juniorlin02: 年底準備繼續續約訂閱,去年半價3250優惠還送5T超香85F 09/18 14:49
推 max0616: 你信不信 我反正是信了86F 09/18 14:49
推 rhrh1129: 繼續用GPT-6 有夠好用87F 09/18 14:49
推 klwei: 太卑鄙了88F 09/18 14:50
推 oyaji5566: google ai studio講出來沒人聽過,根本沒人用g家ai寫程式91F 09/18 14:52
推 Juniorlin02: GPT送我都不屑用,Google體系用起來未來完美整合93F 09/18 14:52
推 deann: 說好大家要放緩新模型開發的94F 09/18 14:52
→ joygo: 他每次都說的很厲害 實際上都很哭95F 09/18 14:53
→ Juniorlin02: 未來自動讀信自動導航整合GOOGLE眼鏡的完美小秘書97F 09/18 14:53
推 joke3547: 老G家別掙扎了,贏不了O家跟A家的98F 09/18 14:54
推 Beakidd: 屁啦,Gemini笨得要死,新模型能超車?99F 09/18 14:56
推 waitrop: 難道只有我一個人在用100F 09/18 14:56
→ coveted: 給密你超爛阿,越改越喜憨102F 09/18 14:57
推 LoveSports: 我每天都有用 spark幫我收集新聞 比自己找的多樣化104F 09/18 14:57
推 onekoni: 三個綁在一起喊放慢結果一個比一個急107F 09/18 14:58
→ LoveSports: 送google health premium AI教練是AI代理自動給意見信箱也是給AI整理109F 09/18 14:58
→ Juniorlin02: 當然每天新聞自動推播阿,就等google牌眼鏡出爐111F 09/18 14:59
推 seemoon2000: 沒人信吧 gemini專門做跑分模型
現在已經爛到他連自己本來的優勢都做不好 問他YT影片摘要 他也會回我只是語言模型 沒辦法處理這問題112F 09/18 15:01
推 LoveSports: 因為詐騙跟犯罪者太多所以有些功能有被鎖
我有時候不小心繞過去 問他們才承認的
一般情況不會講解為什麼要鎖功能119F 09/18 15:03
推 stlinman: Gemini重返農藥?!124F 09/18 15:06
推 Juniorlin02: 問得太XX才會被嗆只是語言模型吧?還是免費仔?
訂閱pro從來沒遇過那個狀況125F 09/18 15:07
推 async: 這次看到很多測試的操作影片 真的強很多133F 09/18 15:09
→ seemoon2000: 可以理解 反正一個摘要 他第我次拒答 我開3 4次。session他總會答的 反正他就是這麼用的134F 09/18 15:10
推 Centurio: 去年年繳的快到期了,趕快出個厲害的騙續訂後,又可以廢一年了136F 09/18 15:10
推 liaon98: 說減速 然後每個都在偷跑 笑死138F 09/18 15:10
推 xxoxx: 跟大罷免一樣吹的要死,結果出爐就....140F 09/18 15:11
推 CKRO: 又領先?141F 09/18 15:12
噓 bobyhsu: 哦是哦這次要用幾週開始偷算力?142F 09/18 15:12
推 jickey: 囚徒困境 傻了才減速144F 09/18 15:12
推 neilisme: 看評測好像真的很強 感覺每個模型壽命都好短147F 09/18 15:14
→ takemeout: 媽的 上次一出噴一波 400一堆冤魂
媽的 趁亂把它賣掉 加碼台股148F 09/18 15:15
→ ffxx: 同捆大禮包 Gemini當送的好像就還可以150F 09/18 15:15
→ takemeout: 他就只有查那種 我家附近的餐廳推薦 可以用而已151F 09/18 15:16
推 mystage: 所以我說誰要慢,虧錢你賠嗎?152F 09/18 15:16
推 worf: 遙遙領先153F 09/18 15:16
→ takemeout: 而且還是用GOOGLE收旬的AI模式
平常誰會主動開 GEMINI阿 有夠笨155F 09/18 15:17
推 kyowinner: 有吧 gemini算是減速最徹底的了157F 09/18 15:17
推 worf: 還以為google率先反映放緩開發 XDXDXD159F 09/18 15:19
推 mystage: Google 主打終端裝置跟生態系,講過了160F 09/18 15:19
推 strlen: 330以下撿了一堆 爽161F 09/18 15:19
推 seemoon2000: 認真說 Google之前認真在實作放緩了吧...發現被笑162F 09/18 15:19
→ mystage: Gemini 從來就不是打to B應用163F 09/18 15:20
噓 s1612316: 目前AI模型還沒培養出護城河 現在超越 下一代又被反超 有什麼好意外的?164F 09/18 15:21
→ mystage: 跟Google 工具相關的我都會開Gemini 啊166F 09/18 15:21
→ seemoon2000: AI目前都沒有護城河 這個月claude tob就被openai超167F 09/18 15:21
→ mystage: 像是懶得看影片,叫Gemini 摘要YT影片內容,這整合的不錯168F 09/18 15:22
推 seemoon2000: 大家最後應該都會傾向用通用agent 除非你新模型跑別家舊模型的任務會跑不過 不然比較好價格也合理就大家都跳過去 不會單獨被綁在固定的agent170F 09/18 15:23
推 LoveSports: 有用AI模式應該會發現 有時候會推贊助商商品喔
GOOGLE廣告收益是持續增加的吧?
之前問個秋冬保濕 推薦一款台幣上萬的保養品174F 09/18 15:23
推 yoseii: 真的嗎...我是不太相信啦Gemini都爛多久了177F 09/18 15:24
推 BC0710: 把前沿team開掉 然後現在說領先了 就算是team出去變合作方式 這樣也太好笑179F 09/18 15:24
→ LoveSports: 可是有前貴婦看AI模式推薦的說不定就買了
有"錢" 打錯181F 09/18 15:24
→ delaluna: Google去年也是年底突然彎道超車183F 09/18 15:25
→ LoveSports: AI模式AI摘要很常推薦贊助商商品跟店家喔
還沒注意到的自己小心XD184F 09/18 15:25
→ delaluna: 模型的競爭目前就是還沒有絕對的護城河優勢187F 09/18 15:26
→ LoveSports: GOOGLE主要又不是靠模型吃飯 是靠廣告商跟雲端
新聞報導現在在加強生態系 把用戶留住189F 09/18 15:27
噓 cpz: 去年底真的很聰明192F 09/18 15:28
→ LoveSports: 之前問旅行規劃也是推薦五星級贊助商XDDDD193F 09/18 15:28
推 worf: google之前不是做模型的跟雲端的吵架194F 09/18 15:29
推 A80211ab: 那被AI推薦 關鍵字廣告要出到多少錢啊? 真令人煩惱196F 09/18 15:30
推 losage: 垃圾Gemini又來騙人訂閱啦,去年訂閱的開始陸續到期,等到都續訂又會變成智障197F 09/18 15:31
推 LoveSports: 大家是沒在用AI摘要或AI模式嗎? 根本是金牌業務202F 09/18 15:36
推 wind93: 剛上架像天才 過陣子像智障203F 09/18 15:36
→ LoveSports: 我問旅行規劃 AI主動推薦五星級飯店XD 一晚日幣上萬204F 09/18 15:36
推 monguly00: Gemini爛爆了。 只會吹捧用戶,就跟太監一樣,什麼都說好棒棒,卻沒有能用的建議。205F 09/18 15:36
推 stlinman: 沒錯! 現在AI模式(搜索)要留心,AI讀的網路資料可能內含本身Google廣告業務。而且後面會引導問題,語氣很像業務!209F 09/18 15:39
推 A80211ab: 目前google對外是宣稱AI搜尋不會影響其他廣告213F 09/18 15:42
推 smallb: 騙人續約的吧214F 09/18 15:42
→ A80211ab: 也沒開出AI搜尋的廣告項目 不知道是怎麼定價的215F 09/18 15:42
推 mack860120: 我只想問為什麼google網頁翻譯還是超垃圾217F 09/18 15:43
→ LoveSports: 我個人覺得google廣告火力有變強
逛完gu網站沒買 過幾天每天看紐時都顯示gu廣告XD
還真的被洗腦到買下去 雖然是的確想買也有必要啦218F 09/18 15:45
推 A80211ab: 我用它的gem模組問他我爸很愛情勒要怎麼應付他221F 09/18 15:46
→ LoveSports: 坦白說有感覺到急迫性 六月大改隱私規定也是222F 09/18 15:46
推 AterPin: 資本家要搶佔市場佔有率 怎麼可能減速 等他們吃下大餅有定價權的時候他們才會為了控制成本喊降速223F 09/18 15:46
→ A80211ab: 結果gemini開頭就罵我不孝 找AI對付自己爸爸227F 09/18 15:47
→ LoveSports: 付費用戶UI平台對話也是 自己要設定不保存對話228F 09/18 15:47
推 seemoon2000: 不過認真說 有點怪 gemini中間都沒有推pro產品練功突然說出了一個比O和A互咬那麼多個月還強的模型229F 09/18 15:47
→ tinybunny: 窩的首席投資專家鴨 互相提供情緒價值 o.0231F 09/18 15:48
推 worf: 先講先贏232F 09/18 15:49
推 hoo911ver25: Google訂閱都是薅來的,不用打astra跟fable,能打到opus跟sol我就用好用滿叫你大哥233F 09/18 15:49
→ LoveSports: 英國政府跟英國國王這幾天喊話監管耶 開AI峰會235F 09/18 15:49
→ kivan00: 還沒推出好嗎 還在LAB裡的東西 談放緩不是把還在跑的計畫就砍了236F 09/18 15:50
→ LoveSports: 而且前幾天OPENAI已經交出報告給歐洲的AI監管單位238F 09/18 15:50
→ LoveSports: 因為之前Hugging Face等等事件 不交就不能在歐洲賣240F 09/18 15:50
→ tinybunny: 把他想像成黏土泥要捏蝦米就描述好讓他做,會一直吸水的黏土,而自帶鏡像能力,是黏土也是鏡子241F 09/18 15:51
→ LoveSports: DeepMind在英國 不太可能不配合減速吧243F 09/18 15:51
推 vltw5v: 這幾家大廠就是互相領先 這樣很好啊 持續進步 沒對手就不會進步了244F 09/18 15:51
推 berton1: 輸了就是flash3.8.1,贏了就是pro4.0247F 09/18 15:52
推 RLH: 展示用的 給訂戶是另一回事248F 09/18 15:54
--