GPUtw 說明文件

狀態與OOM

各執行個體狀態的意義、記憶體不足(OOM)的處理方式,以及當機或主機故障後的資料復原機制。

執行個體狀態

執行個體會經歷 DEPLOYING(主機準備中——拉取映像、掛載儲存、配置 GPU)、RUNNING(開始計費)、STOPPED(保留供重啟、不計費)、FAILED(部署未成功,或主機故障——見下方復原說明)與 TERMINATED(已刪除)。INSUFFICIENT_FUNDS 表示錢包餘額不足以支付下一小時;儲值後即可重新啟動。

記憶體不足(OOM)行為

當某個程序耗盡執行個體的 RAM 上限時,只有該程序會被終止——不是整個容器。您的 SSH 連線、Jupyter 伺服器與其他程序都會繼續執行,被終止的工作只是結束而已。若被終止的是主程序,容器會原地重啟:/workspace/vault 完全不受影響,先前容器在其他位置寫入的內容(已安裝的套件、/home/root)會在數秒內自動復原到 /workspace/.recovered/

Tip

長時間訓練的 checkpoint 仍建議存放在 /workspace/vault——那是合約上屬於您的儲存空間。

主機故障後的資料復原

若執行個體所在的主機斷電或故障,您的資料都會保留在該主機上——/workspace、已安裝的套件,以及您存放在容器內其他位置的檔案(例如 /training-data/opt、家目錄),僅排除 /proc 之類的執行期路徑。非 workspace 的復原檔案會位於復原資料夾的 rootfs/(或 layer/)子資料夾內。後續處理取決於停機時間長短:

  • 少於 24 小時: 主機恢復後,系統會自動在該主機上重新啟動您的執行個體,檔案會出現在 /workspace/.recovered——計費自執行個體啟動時恢復
  • 24 小時以上: 系統會將保留的檔案移至您的 Vault 中 recovered/<主機>-<日期>/ 資料夾,7 天內免收儲存費用;之後計入一般 Vault 用量
Info

已存放在 /vault 的檔案完全不受主機故障影響——Vault 儲存不在 GPU 主機上。

Warning

復原資料夾是有 7 天免費期的備援副本——請儘早檢視,保留需要的檔案並刪除其餘內容,以免產生儲存費用。