跳至主要內容

AI 訓練與推論

按日租用 GPU 做實驗,模型穩定後轉為月付推論;資料與檢查點放在物件儲存,不綁定單一機器。

挑戰

  • 01實驗階段算力需求波動大,長期包月容易閒置。
  • 02訓練資料與檢查點體積大,放在本機硬碟難以共享與回溯。
  • 03推論上線後需要穩定的成本與容量規劃。

參考架構

上線步驟

  1. 01

    按日租卡做實驗

    用 RTX 4090 或 L40S 按日方案跑微調與評估,數據集與檢查點放在物件儲存。

  2. 02

    固定評估流程

    把評估腳本與基準資料固定下來,每次訓練完自動比對,選出要上線的版本。

  3. 03

    轉為月付推論

    模型穩定後改用月付 GPU 或 AI 推論服務,成本與容量變得可預期。

  4. 04

    按流量擴容

    推論服務放在負載平衡後面,高峰時加開按日 GPU 補容量。

客戶怎麼用

一家做法律文書 AI 的新創團隊

之前
過去包月租了四張卡,實驗週以外大半時間閒置;檢查點存在本機硬碟,換機器就得重新上傳幾百 GB。
之後
改成實驗用按日、上線用月付,檢查點集中在物件儲存。同樣的訓練節奏下,GPU 支出明顯下降,換機器只要掛上同一個儲存桶。
  • −45%

    GPU 月支出

  • 分鐘級

    換機器恢復訓練

  • 2 週

    從實驗到上線

設計要點

按日與按月並用

NVIDIA RTX 4090、RTX 5090 與 L40S 提供按日方案,適合短期訓練;A100、H100 為月付,適合長期推論與大型模型。

選擇寧夏 GPU 大區

寧夏是 GPU 大區,GPU 與物件儲存放在同一地域可降低資料搬移成本;歐美用戶可選德州或慕尼黑。

不想管 GPU?

直接以 API 呼叫 AI 模型推論服務,不需要自行部署。