AI 應用 Thinkstation 920 拿來跑 AI 大模型,造成記憶體連續損壞?

soothepain

full loading
已加入
9/17/03
訊息
23,745
互動分數
2,023
點數
113
網站
www.coolaler.com
一位 Reddit 網友 Future_Fuel_8425 最近分享了他的 AI 應用遭遇。原本他用 RTX 5070 Ti 的 16GB GDDR7 顯示記憶體跑 20B(200 億參數)的大語言模型還算游刃有餘,但為了處理更複雜的資料庫工作,他決定改跑 35B(350 億參數)的 Ornith-1.5-35B-A3B 模型。他所使用的是 Thinkstation 920 工作站,有 128GB DDR4 ECC 記憶體,顯卡記憶體塞不下,就另外使用主機記憶體來進行 Offload 分流卸載。

ThinkStation_P920.jpg


沒想到,模型才跑了 90 分鐘,系統就直接崩潰。他檢查發現,其中一隻 8GB DDR4 記憶體已經永久死亡。當時他以為只是運氣不好遇到不良品,拔掉壞掉的那隻後繼續開。結果連續跑了 8 到 9 天後,他翻開系統 Error Log 一看,發現第二隻 DDR4 記憶體也開始大量噴出錯誤訊息,眼看也要跟著報銷。

玩家本人堅稱這絕非溫度問題,並強調 CPU 與 GPU 溫度全程沒超過 80℃。但壞的可是記憶體阿,他從頭到尾都沒拿出記憶體的溫度監測數據。

實際上,AI 模型在進行矩陣運算與數據吞吐時,對系統記憶體進行的是長時間、高強度的連續讀寫,這對老舊的 DDR4 來說無疑是嚴刑拷打。在高負載下,缺乏主動散熱的記憶體顆粒溫度往往比 CPU 還恐怖。再加上老硬體歲月洗禮與機殼風道不佳,這兩隻 DDR4 大機率是被活活熱死加上高壓寫到壽終正寢。

再次證明,想搭上 AI 的時代列車,光靠老舊的硬體與我覺得不熱的意念,有可能就是直接壞掉,還是得買新的。
 
不太可能記憶體顆粒全壞....就算全壞只要有終身保固 拿去換一條就可以了 從來沒聽說過記憶體會被讀寫給操壞的 又不是SSD.....