一位 Reddit 網友 Future_Fuel_8425 最近分享了他的 AI 應用遭遇。原本他用 RTX 5070 Ti 的 16GB GDDR7 顯示記憶體跑 20B(200 億參數)的大語言模型還算游刃有餘,但為了處理更複雜的資料庫工作,他決定改跑 35B(350 億參數)的 Ornith-1.5-35B-A3B 模型。他所使用的是 Thinkstation 920 工作站,有 128GB DDR4 ECC 記憶體,顯卡記憶體塞不下,就另外使用主機記憶體來進行 Offload 分流卸載。

沒想到,模型才跑了 90 分鐘,系統就直接崩潰。他檢查發現,其中一隻 8GB DDR4 記憶體已經永久死亡。當時他以為只是運氣不好遇到不良品,拔掉壞掉的那隻後繼續開。結果連續跑了 8 到 9 天後,他翻開系統 Error Log 一看,發現第二隻 DDR4 記憶體也開始大量噴出錯誤訊息,眼看也要跟著報銷。
玩家本人堅稱這絕非溫度問題,並強調 CPU 與 GPU 溫度全程沒超過 80℃。但壞的可是記憶體阿,他從頭到尾都沒拿出記憶體的溫度監測數據。
實際上,AI 模型在進行矩陣運算與數據吞吐時,對系統記憶體進行的是長時間、高強度的連續讀寫,這對老舊的 DDR4 來說無疑是嚴刑拷打。在高負載下,缺乏主動散熱的記憶體顆粒溫度往往比 CPU 還恐怖。再加上老硬體歲月洗禮與機殼風道不佳,這兩隻 DDR4 大機率是被活活熱死加上高壓寫到壽終正寢。
再次證明,想搭上 AI 的時代列車,光靠老舊的硬體與我覺得不熱的意念,有可能就是直接壞掉,還是得買新的。

沒想到,模型才跑了 90 分鐘,系統就直接崩潰。他檢查發現,其中一隻 8GB DDR4 記憶體已經永久死亡。當時他以為只是運氣不好遇到不良品,拔掉壞掉的那隻後繼續開。結果連續跑了 8 到 9 天後,他翻開系統 Error Log 一看,發現第二隻 DDR4 記憶體也開始大量噴出錯誤訊息,眼看也要跟著報銷。
玩家本人堅稱這絕非溫度問題,並強調 CPU 與 GPU 溫度全程沒超過 80℃。但壞的可是記憶體阿,他從頭到尾都沒拿出記憶體的溫度監測數據。
實際上,AI 模型在進行矩陣運算與數據吞吐時,對系統記憶體進行的是長時間、高強度的連續讀寫,這對老舊的 DDR4 來說無疑是嚴刑拷打。在高負載下,缺乏主動散熱的記憶體顆粒溫度往往比 CPU 還恐怖。再加上老硬體歲月洗禮與機殼風道不佳,這兩隻 DDR4 大機率是被活活熱死加上高壓寫到壽終正寢。
再次證明,想搭上 AI 的時代列車,光靠老舊的硬體與我覺得不熱的意念,有可能就是直接壞掉,還是得買新的。









