AI 訓練與推論
按日租用 GPU 做實驗,模型穩定後轉為月付推論;資料與檢查點放在物件儲存,不綁定單一機器。
挑戰
- 01實驗階段算力需求波動大,長期包月容易閒置。
- 02訓練資料與檢查點體積大,放在本機硬碟難以共享與回溯。
- 03推論上線後需要穩定的成本與容量規劃。
參考架構
上線步驟
- 01
按日租卡做實驗
用 RTX 4090 或 L40S 按日方案跑微調與評估,數據集與檢查點放在物件儲存。
- 02
固定評估流程
把評估腳本與基準資料固定下來,每次訓練完自動比對,選出要上線的版本。
- 03
轉為月付推論
模型穩定後改用月付 GPU 或 AI 推論服務,成本與容量變得可預期。
- 04
按流量擴容
推論服務放在負載平衡後面,高峰時加開按日 GPU 補容量。
客戶怎麼用
一家做法律文書 AI 的新創團隊
- 之前
- 過去包月租了四張卡,實驗週以外大半時間閒置;檢查點存在本機硬碟,換機器就得重新上傳幾百 GB。
- 之後
- 改成實驗用按日、上線用月付,檢查點集中在物件儲存。同樣的訓練節奏下,GPU 支出明顯下降,換機器只要掛上同一個儲存桶。
−45%
GPU 月支出
分鐘級
換機器恢復訓練
2 週
從實驗到上線
設計要點
按日與按月並用
NVIDIA RTX 4090、RTX 5090 與 L40S 提供按日方案,適合短期訓練;A100、H100 為月付,適合長期推論與大型模型。
選擇寧夏 GPU 大區
寧夏是 GPU 大區,GPU 與物件儲存放在同一地域可降低資料搬移成本;歐美用戶可選德州或慕尼黑。
不想管 GPU?
直接以 API 呼叫 AI 模型推論服務,不需要自行部署。