预训练视觉 API 提供物体检测、人脸分析、文字识别(OCR)、内容审核与视频分析能力,开箱即用,也支持自定义模型训练,广泛用于安防、零售、媒体与文档自动化。
计算机视觉 API 让你无需训练模型就能实现图像和视频的智能分析——物体检测、OCR 文字识别、人脸分析、内容审核等开箱即用。三大云的视觉服务各有优势领域。
| 对比维度 | Amazon Rekognition | Google Cloud Vision API | Azure AI Vision |
|---|---|---|---|
| OCR 精度 | 良好(支持多语言) | 业界领先(尤其手写体) | 优秀(Read API 强) |
| 人脸检测/分析 | 支持(表情、年龄、性别) | 支持(受限,隐私政策) | 支持(检测+验证+情绪) |
| 视频分析 | 强(人物追踪、活动检测) | 支持(标注、切片) | 支持(Video Indexer) |
| 内容审核 | 支持(图像+视频) | 支持(Safe Search) | 支持(Content Safety) |
| 自定义模型 | Custom Labels(托管训练) | AutoML Vision(自动训练) | Custom Vision(快速原型) |
| 空间分析 | 不支持 | 不支持 | 支持(人员计数、距离检测) |
| 定价(每千次) | $1.00-$1.75 | $1.50-$3.50 | $0.65-$1.50 |
Google Cloud Vision API 在多语言和手写体识别上精度最高。Azure Read API 在印刷体文档上表现优秀。Rekognition 适合中英文场景但复杂文档不如前两者。
Azure Custom Vision 最少需要 5 张图片/标签即可训练。Rekognition Custom Labels 建议至少 100 张。AutoML Vision 建议至少 100-500 张获得良好效果。数据越多精度越高。