看板 Stock
作者 thinksilver (銀白色的沉思)
標題 [新聞] AI算力成本腰斬!AMD MI355X跑GLM 5.2
時間 Tue Jul  7 08:30:24 2026



原文標題:

AI算力成本腰斬!AMD MI355X跑GLM 5.2 成本僅輝達一半

原文連結:

https://reurl.cc/3yrRj0

 

發布時間:

2026-07-07 04:44

記者署名:

鉅亨網新聞中心

原文內容:

隨著 AI 推理需求爆炸性增長,算力成本成為企業落地的最大痛點。近期,推理優化公司
 Wafer 公布的一組數據引發了 AI 業界的高度關注:在AMD(AMD-US)MI355X
晶片上運行最新開源模型 GLM 5.2,不僅實現了高效能表現,其成本更僅為輝達
(NVDA-US) 旗艦 GPU B200 的一半。

這項結果顯示,AMD 正逐步縮小與輝達在 AI 推理市場的差距,也讓外界重
新審視 GPU 市場長期由 CUDA 生態建立的競爭優勢。

測試顯示,MI355X 在執行 GLM 5.2 時,單節點聚合吞吐量達每秒 2,626 個 token(
tok/s),單流吞吐量則達每秒 213 個 token。在效能方面,約可達到同級輝達旗艦
 B200 約八成水準,但部署成本卻不到 B200 的一半。


消息公布後,立即引發開發者社群高度關注,相關討論也迅速登上 Hacker News 熱門排
行榜。

Wafer 表示,這次部署並非依靠特殊硬體,而是透過一系列軟體最佳化完成,
包括模型量化、推理引擎選擇,以及多項相容性修正與效能調校,讓 AMD GPU 能充分發揮
推理能力。

量化技術兼顧效能與精準度

在模型最佳化方面,Wafer 使用 AMD 官方 Quark 工具,將模型權重由 BF16 量化為
 MXFP4,以降低運算資源需求。

根據測試結果,量化後模型在多項基準測試中的準確率僅有輕微變化,部分測試甚至較官
方量化版本更佳,代表壓縮模型後仍能維持相當程度的推理品質。

推理引擎方面,Wafer 比較了 vLLM、ATOM 與 sglang 三種方案後,最終選擇 sglang。
原因在於前兩者無法同時兼顧量化效益與長文本輸出品質,而 sglang 則能維持模型輸出
的穩定性,成為此次部署的主要推理平台。


修補細節 推理速度大幅提升

在完成模型量化後,Wafer 又針對推理流程持續優化。其中最大的挑戰來自 ROCm 平台對
投機解碼(Speculative Decoding)的支援不足。

團隊發現,共享專家層命名方式與 sglang 使用的命名規則不同,導致模型載入失敗,透
過修正命名後,單流吞吐量便大幅提升近三倍。

此外,另一項問題來自程式碼直接引用 CUDA 標頭檔,導致 ROCm 編譯失敗,Wafer 僅透
過加入編譯保護即可解決。之後再調整平行運算方式,以及手動指定適合 GLM 5.2 專家
層的 Kernel,最終將單節點聚合吞吐量提升至每秒 2,626 個 token。


測試採用接近實際生產環境的設定,包括 2 萬 token 輸入、1,000 token 輸出及 60%
快取命中率,首個 token 延遲控制在 2.22 秒內,整體成功率達 100%。

新創公司也能挑戰 GPU 巨頭

值得注意的是,完成這項成果的 Wafer 並非大型科技公司,而是一家僅獲得 400 萬美元
種子輪融資的新創企業,投資人包括 Fifty Years、Y Combinator、Liquid2,以及
 Google 首席科學家 Jeff Dean、OpenAI 共同創辦人 Wojciech Zaremba 與 Dropbox 共
同創辦人 Arash Ferdowsi 等知名人士。

Wafer 將自身定位為利用 AI 優化 AI 基礎設施的公司,並表示此次 GLM 5.2 的部分
 Kernel 調校、命名衝突排查與最佳化工作,都已大量導入 AI 輔助工程。

相較過去為了提升效能仍需自行開發客製化 Kernel,如今更多工作已轉向修補官方工具
鏈中的細節,代表 AMD 軟體生態正逐漸成熟。

AMD 軟體生態逐漸成熟

Wafer 指出,過去若每次模型發布都必須重新開發底層 Kernel,小型團隊幾乎無法跟上
市場節奏;如今官方工具鏈已能完成大部分工作,剩餘僅需修正相容性與最佳化細節,新
創公司便有機會快速完成部署,這也是 Wafer 能在模型發布後短時間內完成適配的重要
原因。


Wafer 認為,目前頂尖模型能否順利部署到 AMD 平台,愈來愈取決於官方軟體支援速度
,而非硬體本身,CUDA 長期建立的軟體優勢正逐步受到挑戰。

事實上,SemiAnalysis 今年稍早針對 GLM-5 的測試也得到類似結果。報告指出,在互動
式推理場景下,AMD MI355X 每百萬 token 推理成本約為 0.22 美元,低於輝達 B200 的
 0.30 美元,主要原因除了硬體整體擁有成本較低,也反映 AMD 軟體最佳化已有明顯進
展。


不過,目前 AMD 的優勢仍主要集中於單節點部署。在多節點、大規模分散式叢集以及跨
機專家並行等企業級應用方面,輝達仍保有明顯領先優勢。

若未來雲端業者能持續將 Wafer 的最佳化方式複製到更多開源模型,AI 推理成本仍有望
持續下降,也將進一步提升開源模型在市場上的競爭力。

心得/評論:

上次說花少少錢就能贏輝達的是不是deepseek?

不過最近AMD的股價走勢是蠻不錯的~相較於NVDA來說~

如果能降低成本有助於AI普及化其實也不是壞事,

果然NVDA的地位還是需要靠宿敵才能撼動?

想到90年代~ATI(Radeon)與NVDA(GeForce)的大戰

各位老顯卡玩家怎麼看呢?


--
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 163.17.149.199 (臺灣)
※ 作者: thinksilver 2026-07-07 08:30:24
※ 文章代碼(AID): #1gJ4Ya6Q (Stock)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1783384228.A.19A.html
※ 同主題文章:
[新聞] AI算力成本腰斬!AMD MI355X跑GLM 5.2
07-07 08:30 thinksilver.
xhs: 不太相信 因為amd顯卡跟屎一樣1F 07/07 08:31
benptt: 坐等教主開示2F 07/07 08:31
sing60905: AMD YES3F 07/07 08:32
s555666: 最後nvidia贏了,nvidia產量大,軟體支援度高,ati最後還是敗北了4F 07/07 08:32
aimlikenoob: 賣鏟子的:你們打一架前先買我的貨6F 07/07 08:32
bnn: 我感覺他是拿FP4打FP167F 07/07 08:33
s155260: 晶片是用GG的嗎8F 07/07 08:33
Utopiasphere: 演算法贏 但AMD顯卡跟輝達有得比嗎9F 07/07 08:33
youga: 嗯 看不懂10F 07/07 08:34
fallinlove15: 八成特定場景拿出來吹11F 07/07 08:34
ssarc: 輝達也可以委託他優化12F 07/07 08:34
e2204588: FP4 ...13F 07/07 08:34
livewater: 丸14F 07/07 08:34
apolloapollo: 結論就是AI is over 在吹啊15F 07/07 08:34
CKRO: 鬼故事16F 07/07 08:34
s555666: GPU本來就不是AI晶片的最佳解,ASIC才是AI特化晶片,但nvidia就靠著產量和支援拼出了王座17F 07/07 08:35
LipaCat5566: 擊落i皇之後下個是輝達嗎!?19F 07/07 08:36
livewater: 算力果然過剩20F 07/07 08:36
kausan: 推理大家馬都贏 不然哪有asic的事21F 07/07 08:36
keyneslan: 這樣AI要重新定價嗎 以前的半價搞定22F 07/07 08:36
dannpptt: 真假啦 別亂吹,這樣硬體股通通腰斬23F 07/07 08:37
pom820117: 話題性滿滿,實感還沒有24F 07/07 08:37
goodman5566: 左打英特爾 右打輝達 amd yes25F 07/07 08:37
abc12812: 相信黃董26F 07/07 08:37
eddy13: 等真的不會限縮算力時再跟我說27F 07/07 08:38
bcismylove: 糙灰搭鬼故事來了28F 07/07 08:39
mitchness: 等到你的產品會被走私再說29F 07/07 08:39
rahim03: 就算真的硬體股為什麼要腰斬?30F 07/07 08:39
s555666: 科技業不進則退,老黃想吃下AI還是得研發出更適合AI的晶片,不能老是靠cuda老本31F 07/07 08:40
rahim03: 長期來看推理成本本來就會越來越低33F 07/07 08:40
JoeyChen: 這是指推論端吧?34F 07/07 08:40
starport: 輝達完了 下去35F 07/07 08:41
ckpetercheng: amd早就屌打nv了36F 07/07 08:42
cowaksor: 算力過剩 台股2萬 台積50037F 07/07 08:42
Vvvahc: 引入標頭檔編譯失敗? 修正變數的命名才不會讓模型初始data載入失敗?   這是哪間的三流公司請工讀生來操作嗎?38F 07/07 08:43
mig: 蒜粒過剩41F 07/07 08:44
MorikonHase: 我不信42F 07/07 08:45
foolwind: 怎麼會腰斬 當然是大家搶更多的貨阿43F 07/07 08:46
a9564208: 聽起來就是老問題,沒有不一樣44F 07/07 08:47
energy100203: 鬼故事喔45F 07/07 08:47
gj942l41l4: …2026了還在跟B200比?46F 07/07 08:48
Robert0213: 天天上演鬼故事,不累嗎?47F 07/07 08:49
CTTSAI: 要相信黃董 馬上就懂48F 07/07 08:49
bensonla: 算力成本變低是好事49F 07/07 08:49
sdbb: 樓下LDPC50F 07/07 08:49
hunt0413: 教主都不分析了51F 07/07 08:51
salamender: 之前看人說amd可能再鱉一發大的52F 07/07 08:51
baan: 兩個都有量化?53F 07/07 08:51
pru5566: 算力過剩 台積腰斬54F 07/07 08:54
cct1121: 還早55F 07/07 08:54
davie11333: 樓下彥州56F 07/07 08:55
lusifa2007: 不信 N卡就是比A卡好57F 07/07 08:57
j0918jack: 力成表示58F 07/07 08:57
sing60905: 大家成本低起來不是更好嗎 對AI來說是好事59F 07/07 09:00
loking: 有競爭是好事60F 07/07 09:00
sing60905: 之前怕賺不到錢 現在成本驟降不是更好 爽賺61F 07/07 09:00
lnonai: 企業私有數據不上雲 AMD好用又便宜62F 07/07 09:01
guanting886: 如果包含output的token的成本壓在1M 0.2真的是吸引人 但SA沒講的話就是呼嚨人的ㄏㄏ63F 07/07 09:02
timetostudy: 要崩了65F 07/07 09:02
harrychen413: 天~崩~地~裂66F 07/07 09:03
alex00089: AI is over67F 07/07 09:03
birdjack: 現在說什麼新創公司做了三小都是騙投資用的
真的被踢爆的時候才說是有嚴苛限制條件68F 07/07 09:03
xboxandone: 操輝達了嗎70F 07/07 09:04
WenliYang: 開始囉~71F 07/07 09:04
jjack11: 專業掉驅動你行你上72F 07/07 09:06
bunjie: 出貨文?73F 07/07 09:07
jaceda: 鬼!74F 07/07 09:07
johnchiang: 還在顯卡...75F 07/07 09:08
BBKOX: NVIDIA 於 2024 年 3 月正式發表基於 Blackwell 架構的 B200 GPU,並於該年底正式上市76F 07/07 09:08
arm370x: 驅動現在有Ai都還沒修好 問題一大坨78F 07/07 09:08
henrylin8086: Linux上不會掉啦79F 07/07 09:09
lionel20002: NV就老AI死錢80F 07/07 09:10
sheep2009: 單卡效能就算了吧81F 07/07 09:10
saya2185: AMD 彎道超車82F 07/07 09:12
ntr203: amdeepseek83F 07/07 09:12
gladopo: 跟以前一樣,amd的卡在兩年後準備接近老黃,但新卡又要出惹84F 07/07 09:13
jorden: 真的假的 僅靠軟體就能優化86F 07/07 09:13
y80304: 這騙點閱率喔......87F 07/07 09:15
win8719: B200 現在是Rubin比B200快5倍以上88F 07/07 09:16
boykid: 開崩!!!89F 07/07 09:23
saladbread: 本是台南生,香煎何太急?90F 07/07 09:25
WWIII: 崩了91F 07/07 09:26
idernest: 完了92F 07/07 09:29
linleex: 不支援cuda沒用吧93F 07/07 09:29
ivanchang: 這則新聞很無言,只覺得NV技術領先AMD很多94F 07/07 09:31
furnaceh: 華西街又不會懂 能炒就贏了95F 07/07 09:32
xiaoyao: 這故事也編得太爛96F 07/07 09:33
ohyakmu: 要跑贏nivida很容易吧!我說股價97F 07/07 09:33
SkyFee: AMD很猛98F 07/07 09:33
Arctica: ㄟ唉伊死歐ver99F 07/07 09:36
fallinlove15: 如果使用場景設定的好 可以先暫存比較可能被調動的模塊達到加速的效果 這也是未來終端會推的做法
但這不是多難的技術 說要贏輝達就來亂的100F 07/07 09:36
exitingsoul: 嘗試各種節省算力、降低精度的原因,不就是算力不夠嗎?103F 07/07 09:37
fallinlove15: 總不可能每種應用都用全能型的啊 太貴
所以根本不用擔心過剩 同樣一百塊 你當然會希望能買到的東西性能越強越好
如果對比手機發展 過剩也是十幾年後的事了105F 07/07 09:38
alex00089: 沒有鯊手級應用109F 07/07 09:40
tomdavis: AMD 甘納賽~~~110F 07/07 09:40
s881720: AMD YES 蘇媽鑽石加大111F 07/07 09:40
Dia149: 過剩了112F 07/07 09:41
Lhmstu: 洗洗睡吧,想太多113F 07/07 09:42
strlen: 我也有蘇媽啦但請蘇媽救救貪狗卡蛙114F 07/07 09:46
herculus6502: 推理沒有問題115F 07/07 09:47
young000: 中國要弄新系統環境,AMD 鐵定有幫忙,CUDA 獨佔太貪了 XD116F 07/07 09:47
randystock: 不管誰贏都是要找GG代工118F 07/07 09:51
ojh: 股板高手3年前就提醒過gpu over了 果然準119F 07/07 09:53
create8: Amd yes!!120F 07/07 09:57
frank072304: 特定場景121F 07/07 09:58
aloness: 3c產品是隨時間越來越廉價的,各位願意花iphone17的錢買iphone7嗎122F 07/07 09:59
NankanAvenge: ASIC功能單一 不可能沒有完全沒有GPU 只是未來肯定會用ASIC取代大部分算力124F 07/07 10:00
jympin: 難怪大漲126F 07/07 10:05
mkmdog5566: 開源都是渣渣127F 07/07 10:06
crtzeng: 90年代的AMD沒有蘇媽,這次輸贏很難說128F 07/07 10:08
hensel: 推論買AMD的跟gb10也差不多價錢,支援度又沒nv好,是喜歡瞎忙嗎129F 07/07 10:08
hugi147: 好耶 我可以用便宜的高級模型了嗎?131F 07/07 10:09
MoneyDay5566: 龐氏騙局要破了132F 07/07 10:10
gpx369: 這兩家無論是誰贏都還是要跟GG下單133F 07/07 10:11
dynamo: 沒差,贏的都是GG134F 07/07 10:13
seemoon2000: 三小 這就家用設備放大的開源模型而已啊 實際上訓練大模型和使用雲端模型才是用GPU的大頭啊....135F 07/07 10:14
bndan: AI成本腰斬的部份 記憶體稅可以全拿去了 XD137F 07/07 10:15
hook99: 還是要買GG138F 07/07 10:16
leo255112: 老黃藥丸?139F 07/07 10:18
cms6384: 該噴了吧140F 07/07 10:18
jy760517: AMD yes!141F 07/07 10:20
centaurjr: 2026的AMD都能談軟體優化了XD142F 07/07 10:21
aadsl: 再買amd的顯卡我就是狗143F 07/07 10:21
z70126: 吞吐量......好澀喔144F 07/07 10:21
jetx2110: 等你好不容易追上來的時候,輝達又會出新的打趴你145F 07/07 10:21
ymlin0331: 穩了147F 07/07 10:21
dkfs789: CUDA>>>>>>>>>>>>>>>>>ROCm148F 07/07 10:22
jorden: 軟體優化完 然後都卡死在硬體 XDDDDDD149F 07/07 10:22
pkmfyw: 與其吹這個 倒不如研究省電40% 效能還能維持150F 07/07 10:24
jvor0719: 我不看了 長期投資151F 07/07 10:25
CLisOM: 既然運算單元成本降價那三星又能漲價了152F 07/07 10:26
piece1: 再買amd顯卡就剁掉..不能再同意更多了!153F 07/07 10:28
waitrop: 汪汪154F 07/07 10:29
rebel: Wow amd的PE已經到181了155F 07/07 10:31
miloisgood: 丸156F 07/07 10:33
lifeowner: 台灣智障:N卡的驅動值5000。157F 07/07 10:37
pmebigGG: 感覺很多人推論跟訓練分不清楚158F 07/07 10:43
seemoon2000: 在LLM模型情境ROCm甚至比Vulkan 還爛了 還跟cuda比159F 07/07 10:43
CJonQuil: 天下苦黃久矣160F 07/07 10:45
wuchanghan: 鬼故事來囉161F 07/07 10:46
jaricho: 一堆人美股買NVDA耶162F 07/07 10:47
luba2: 重返農藥?163F 07/07 10:51
sakeru: 反正我歐印AMD了  沒拆股不賣164F 07/07 10:52
ezorttc: 蘇媽遙遙領先165F 07/07 10:54
stosto: 哪天模型要打掉asic 也要重來了166F 07/07 10:55
KFC007: NV贏在CUDA,但AMD發現了繞過CUDA的方式
大廠最終都希望兩個鏟子廠廝殺這樣才能降低成本啊167F 07/07 10:56
xxxzxcvb: 只有單節點而已 多節點還在努力169F 07/07 11:00
jack1042: 一堆東西沒整合好 不覺得AMD有什麼優勢170F 07/07 11:00
x58420: amd Yes171F 07/07 11:01
ga278057: 一句不談cuda172F 07/07 11:03
Courtney: 不信~173F 07/07 11:03
ted1985: 老套路 捧A買N174F 07/07 11:03
ga278057: 怎麼不說轉譯跑cuda多少175F 07/07 11:03
spen2005: 只有用torch 的話rocm cuda沒什麼差176F 07/07 11:06
Haruna1998: 等落地再說吧 實驗室數據出來後實際都跟屎一樣177F 07/07 11:09
xxgogg: 腰斬還不塊陶嗎QAQ178F 07/07 11:17
foxher: 99 NVDA179F 07/07 11:18
hong414: 不用為了一堆遊戲搞驅動180F 07/07 11:19

--
--
(thinksilver.): [新聞] AI算力成本腰斬!AMD MI355X跑GLM 5.2 - Stock板