很多模型死在「实验阶段跑得通,上线却部署不了」。托管 ML 平台的价值,就是把这条路标准化——从数据准备到模型监控,每个阶段都有工具支撑,让模型从 Notebook 顺畅走向生产。
标准工作流的六个阶段
无论使用哪个云的 ML 平台,标准的 ML 工作流都包含以下六个阶段:
| 阶段 | 核心任务 | AWS SageMaker | GCP Vertex AI | Azure ML |
|---|---|---|---|---|
| 1. 数据准备 | 特征工程+特征存储 | Data Wrangler + Feature Store | BigQuery + Feature Store | Data Prep + 外部存储 |
| 2. 训练 | 模型训练(单机/分布式) | Training Jobs | Custom Training | Compute Cluster |
| 3. 调参 | 自动超参优化 | Automatic Model Tuning | Hyperparameter Tuning | HyperDrive |
| 4. 注册 | 模型版本管理 | Model Registry | Model Registry | Model Registry |
| 5. 部署 | 在线/批量推理 | Real-time + Batch + Serverless | Endpoints + Batch | Online + Batch |
| 6. 监控 | 数据漂移+性能 | Model Monitor | Model Monitoring | Monitor + Drift Detection |
各阶段详解
阶段 1 - 数据准备:特征工程是 ML 中最耗时的环节。特征存储(Feature Store)保证训练和推理使用一致的特征计算逻辑,避免「训练-推理偏差」。SageMaker Feature Store 和 Vertex AI Feature Store 都提供托管服务,Azure 需要自建或使用第三方。
阶段 2 - 训练:从托管 Notebook(免费,只付计算费)起步,规模化后切换到分布式训练任务。三家都支持 GPU 训练(A100 约 $3-4/小时)。SageMaker 支持模型并行训练大模型;Vertex AI 与 BigQuery 集成方便大数据训练;Azure ML 的 Compute Cluster 自动管理节点。
阶段 3 - 调参:自动超参优化(HPO)替代手工试错。三家都支持贝叶斯优化、随机搜索和网格搜索。Vertex AI 的 HPO 算法选择最丰富,Azure HyperDrive 与 Optuna 集成好,SageMaker 支持自适应超参优化。
阶段 4 - 注册:模型注册表管理模型版本、指标和审批流程。三家都支持模型审批(approve/reject)和模型组管理。关键是在注册时记录完整的模型血缘(数据版本→训练代码→超参→评估指标),便于复现。
阶段 5 - 部署:三家都支持实时端点(REST API)、批量推理和边缘部署。成本差异大——SageMaker 实时端点最贵(按实例规格计费),建议用 Serverless 推理(按请求计费)降低成本。Vertex AI 的端点支持流量拆分(A/B 测试)。Azure ML 支持 Blue-Green 部署。
阶段 6 - 监控:部署后监控数据漂移(特征分布变化)和模型性能退化。SageMaker Model Monitor 自动检测漂移并触发告警。Vertex AI Model Monitoring 类似。Azure ML 的数据漂移检测需要配置数据集和基线。发现漂移后应触发再训练管道。
成本估算实例
以一个中等规模 ML 项目为例(每周训练一次,日均 10万次推理):
| 环节 | AWS SageMaker | GCP Vertex AI | Azure ML |
|---|---|---|---|
| Notebook (月) | $50-100 | $50-100 | $50-100 |
| 训练 (月) | $200-500 (GPU) | $200-500 (GPU) | $200-500 (GPU) |
| HPO (月) | $100-300 | $100-300 | $100-300 |
| 实时端点 (月) | $200-600 | $150-400 | $150-400 |
| 监控 (月) | $50-100 | $30-80 | $30-80 |
| 总计 (月) | $600-1600 | $530-1380 | $530-1380 |
省钱技巧:1) 训练用 Spot/抢占式实例(降 60-80%);2) 推理用 Serverless 或批量端点替代实时端点(降 50-70%);3) Notebook 用完即停(自动关机脚本);4) 模型压缩(量化、蒸馏)减小推理实例规格。
常见问题
Q: 三个 ML 平台哪个最适合初学者? Vertex AI 上手最简单——AutoML 可以零代码训练模型,统一界面管理全流程。Azure ML 的 Designer 拖拽式建模也适合非编程用户。SageMaker 功能最多但学习曲线最陡。
Q: 实时端点和批量推理怎么选? 实时端点适合需要即时响应的场景(推荐、风控、搜索),但持续计费。批量推理适合非实时场景(日报、离线预测),按任务时长计费,成本可低 80%。如果推理频率 < 每分钟 1 次,优先用批量。