※ 本文轉寄自 ptt.cc 更新時間: 2026-08-06 07:12:21
看板 PC_Shopping
作者 標題 Re: [菜單] 80K 超輕度AI+遊戲機 -本地佈署LLM的需求
時間 Wed Aug 5 17:57:21 2026
※ 引述《doasgloria (青柳立夏)》之銘言:
: 已買/未買/已付訂金(元): 未買(預計在日本購買)
: 預算/用途:80K (約40萬日幣)
: 主要希望可以跑一些極輕度LLM LORA練習(3B 7B量化模型)
最近看很多人想玩本地LLM,稍微聊一下10萬預算顯卡怎麼組比較好
前提條件先設在部署 FP8 格式、體積較大的 27B 級稠密模型。基本上真要有
生產力的模型都大於這個起跑線,低於這個規模先不談。
無腦買5090一張就超過10萬了,然後也不能放進去,得買兩張
如果是搞色圖或色影,那還是NVIDIA 吧
便宜的綠廠垃圾佬方案是3080魔改套4090散熱器兩張共40GB,目前中國價格含券似乎
在3500一張上下。不過只保一年而且是中國國內
如果限定到台灣,可買到新品是:
比較正常(?)的方案,四張單槽 RTX5060Ti/16GB。中國那邊有人測試
四卡系統待機功耗低於 100W,滿載低於 600W;滿載時風扇約 40%~50%,GPU
溫度不到60C。
如果你是紅廠信徒,只想戰未來。替代方案:兩張 AMD R9700 32GB,合計64GB。
雙卡成本約10萬元。與4張16GB相比,雙卡架構在物理安裝、供電、線材、故障點
與系統管理方面都更簡單
雙卡成本約10萬元。與4張16GB相比,雙卡架構在物理安裝、供電、線材、故障點
與系統管理方面都更簡單
如果不重視CUDA生態對作圖作影片的優勢,R9700處理事務跟Coding還是可取的。
大概就是這樣,反正你不買我不買明天貴5000,要用就買吧
--
弟子「先生、処女を貴重だと思う男は多いです?」 孔明「..その通りだ 」
弟子「しかし逆に童貞は女に気持ち悪がられます? 」孔明「....確かに 」
弟子「おかしいじゃないですか、何故このような意識の違いが生まれるのですか 」
孔明「それは一度も侵入を許していない砦は頼もしく
一度も侵入に成功しない兵士は頼りないからだ! 」
原出:「孔明の罠だ!」(民明書房新刊)
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 36.229.90.181 (臺灣)
※ 作者: lordmi 2026-08-05 17:57:21
※ 文章代碼(AID): #1gSma5oC (PC_Shopping)
※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1785923845.A.C8C.html
推 : 更低買中國2080ti魔改2張22k搞定1F 114.34.209.162 台灣 08/05 18:05
→ : 剩下就這樣板子要能拆成X8+X8的
→ : 我弄一弄整機不到50k
→ : 剩下就這樣板子要能拆成X8+X8的
→ : 我弄一弄整機不到50k
推 : 中國他們網友都說店保=不保=送張哥4F 45.144.227.57 台灣 08/05 18:11
推 : 2張5080不知道可不可行,跑Qwen 35F 39.10.48.1 台灣 08/05 18:17
→ : .5 27B
→ : 我主機板最多裝兩張,再上去就不知
→ : 道怎麼裝了@@
→ : .5 27B
→ : 我主機板最多裝兩張,再上去就不知
→ : 道怎麼裝了@@
推 : 藍廠的B70有未來可以戰嗎9F 49.217.129.222 台灣 08/05 18:18
推 : 2張5080大概是2張2080ti魔改的5-6倍價10F 114.34.209.162 台灣 08/05 18:20
→ : 2張2080ti足夠跑27B的模型了
→ : 2張2080ti足夠跑27B的模型了
推 : 目前最便宜的方案就雙3090共48G 可以認12F 123.192.94.227 台灣 08/05 18:20
→ : 真開始跑些有用的東西 再上去就是看dgx
→ : spark跟mac了
→ : 真開始跑些有用的東西 再上去就是看dgx
→ : spark跟mac了
→ : 3090的價格炒到1張30k以上,還不保證15F 114.34.209.162 台灣 08/05 18:21
→ : 是不是礦卡。
→ : 要不然20k出頭的3080是真的可以
推 : 講錯3090
→ : 是不是礦卡。
→ : 要不然20k出頭的3080是真的可以
推 : 講錯3090
推 : b70看起來便宜,但滯銷代表還是貴19F 118.233.161.3 台灣 08/05 18:27
推 : 一般個人本地跑會選FP8的應該算少數吧,20F 114.137.19.103 台灣 08/05 18:32
→ : 選GGUF的Q4等級的應該比較多
→ : 選GGUF的Q4等級的應該比較多
推 : 3080 20g*2也不錯 40gb能跑的東西也不少22F 49.158.135.118 台灣 08/05 18:44
推 : 32G級別的就是看27b 35b這次qwen3.823F 223.137.118.232 台灣 08/05 18:53
→ : Q4量化"目前"的模型都是會大幅弱化
→ : tool calling的能力 但這塊剛好是本
→ : 地化AI最重要的技能 反而不是知識和
→ : 長鏈推理
→ : Q4量化"目前"的模型都是會大幅弱化
→ : tool calling的能力 但這塊剛好是本
→ : 地化AI最重要的技能 反而不是知識和
→ : 長鏈推理
推 : Q4量化tool calling能力是一坨,至少Q628F 123.192.94.227 台灣 08/05 20:41
→ : 才勉強能用,Q8才能真正發揮9成5實力
→ : 才勉強能用,Q8才能真正發揮9成5實力
推 : 可以改用混合架構? 像LM Studio新推出30F 65.211.18.190 美國 08/05 21:34
→ : 的Bionic軟體搭配Q4的模型,呼叫工具
→ : 這種工作給Bionic透過Python去做即可
→ : 至少這邊看它做Word Excel PDF這種文件
→ : 讀取+思考分析+產製文檔結果還不算太差
→ : 的Bionic軟體搭配Q4的模型,呼叫工具
→ : 這種工作給Bionic透過Python去做即可
→ : 至少這邊看它做Word Excel PDF這種文件
→ : 讀取+思考分析+產製文檔結果還不算太差
推 : Dense模型像Qwen 27B對Q4量化沒那麼敏感35F 220.134.116.61 台灣 08/05 21:38
→ : 真的有餘裕才往上看Q5 Q6 Q8可是VRAM高很
→ : 多。MoE模型像Qwen 35B-A3B用張6GB以上
→ : 真的有餘裕才往上看Q5 Q6 Q8可是VRAM高很
→ : 多。MoE模型像Qwen 35B-A3B用張6GB以上
推 : 謝謝38F 112.104.65.143 台灣 08/05 21:41
→ : 的顯卡都能跑到1x tg/s了,單張卡塞不進39F 220.134.116.61 台灣 08/05 21:41
→ : 27B的就35B-A3B或是Gemma4 12B/MoE玩玩就
→ : 好。不過MoE據社群說對量化程度比較敏感
→ : RAM大一點,把VRAM塞不下的用--n-cpu-moe
→ : 往RAM丟就好了,跑Q6 Q8都有可能,pp tg
→ : 27B的就35B-A3B或是Gemma4 12B/MoE玩玩就
→ : 好。不過MoE據社群說對量化程度比較敏感
→ : RAM大一點,把VRAM塞不下的用--n-cpu-moe
→ : 往RAM丟就好了,跑Q6 Q8都有可能,pp tg
推 : MoE在APEX量化 工具調用下滑比較少44F 82.140.187.28 立陶宛 08/05 21:44
→ : 也不會太差45F 220.134.116.61 台灣 08/05 21:45
→ : 其實色圖跟色影有板上的CUI大禮包在罩,用A46F 118.165.155.217 台灣 08/05 21:48
→ : MD反而俗又大碗,真的要跑LLM刷CODE寫作業
→ : ,那還得推薦NV才行(16GB起跳),蘇媽要扳回
→ : 一城等下一代看有沒有機會。
推 : 另外塞的資料如果沒有很肥,也能接受慢一截
→ : 的prefill速度(提示詞輸入後要等一下才反應
→ : ),MoE可以幫忙省不少VRAM,
→ : 只要VRAM比換算完大小的AxxB大(但是MB RAM
→ : 要夠大,塞剩下的模型),調整一下允許的上
→ : 下文長度後大多有 約10~2x T/S 的回應速度
→ : ,以個人小玩的程度來說堪用了
→ : MD反而俗又大碗,真的要跑LLM刷CODE寫作業
→ : ,那還得推薦NV才行(16GB起跳),蘇媽要扳回
→ : 一城等下一代看有沒有機會。
推 : 另外塞的資料如果沒有很肥,也能接受慢一截
→ : 的prefill速度(提示詞輸入後要等一下才反應
→ : ),MoE可以幫忙省不少VRAM,
→ : 只要VRAM比換算完大小的AxxB大(但是MB RAM
→ : 要夠大,塞剩下的模型),調整一下允許的上
→ : 下文長度後大多有 約10~2x T/S 的回應速度
→ : ,以個人小玩的程度來說堪用了
推 : 本地模型的話會建議直接蹲RTX Sparka嗎57F 61.70.104.17 台灣 08/05 22:48
推 : 之前7/24發的文用2張9060XT-16G跑27B58F 65.211.18.190 美國 08/05 23:00
→ : Dense模型,上下文開到128K,效能最差
→ : 的Ollama是13t/s,換LM Studio大概有
→ : 14~15t/s,作為AI文書助手來說尚可用
→ : 未來AMD卡能穩用Tensor Parallelism
→ : 的話應該會更快。
→ : Dense模型,上下文開到128K,效能最差
→ : 的Ollama是13t/s,換LM Studio大概有
→ : 14~15t/s,作為AI文書助手來說尚可用
→ : 未來AMD卡能穩用Tensor Parallelism
→ : 的話應該會更快。
推 : RTXspark 128G應該就是穩破20萬了64F 45.144.227.42 台灣 08/05 23:39
推 : 那麼哪裡買得到呢T_T。只能租雲端?65F 114.26.178.182 台灣 08/06 00:06
--
※ 看板: PC_Shopping 文章推薦值: 0 目前人氣: 0 累積人氣: 159
→
guest
回列表(←)
分享