首页 / AI 产品 / 计算机视觉
👁️

计算机视觉

图像与视频的智能识别分析。

预训练视觉 API 提供物体检测、人脸分析、文字识别(OCR)、内容审核与视频分析能力,开箱即用,也支持自定义模型训练,广泛用于安防、零售、媒体与文档自动化。

核心能力

  • 物体 / 场景 / 人脸检测与识别
  • OCR 文字提取与文档解析
  • 图像与视频内容审核
  • 支持自定义标签模型训练

三大云对应服务

AWS Amazon Rekognition
图像与视频分析一体
GCP Cloud Vision API
OCR 与标签识别精度高
Azure Azure AI Vision
含空间分析与自定义视觉

三大云计算机视觉核心对比

计算机视觉 API 让你无需训练模型就能实现图像和视频的智能分析——物体检测、OCR 文字识别、人脸分析、内容审核等开箱即用。三大云的视觉服务各有优势领域。

对比维度Amazon RekognitionGoogle Cloud Vision APIAzure AI Vision
OCR 精度良好(支持多语言)业界领先(尤其手写体)优秀(Read API 强)
人脸检测/分析支持(表情、年龄、性别)支持(受限,隐私政策)支持(检测+验证+情绪)
视频分析强(人物追踪、活动检测)支持(标注、切片)支持(Video Indexer)
内容审核支持(图像+视频)支持(Safe Search)支持(Content Safety)
自定义模型Custom Labels(托管训练)AutoML Vision(自动训练)Custom Vision(快速原型)
空间分析不支持不支持支持(人员计数、距离检测)
定价(每千次)$1.00-$1.75$1.50-$3.50$0.65-$1.50

选型建议

常见问题

Q: 哪个 OCR 精度最高?

Google Cloud Vision API 在多语言和手写体识别上精度最高。Azure Read API 在印刷体文档上表现优秀。Rekognition 适合中英文场景但复杂文档不如前两者。

Q: 自定义模型需要多少训练数据?

Azure Custom Vision 最少需要 5 张图片/标签即可训练。Rekognition Custom Labels 建议至少 100 张。AutoML Vision 建议至少 100-500 张获得良好效果。数据越多精度越高。

← 返回AI 产品列表 订阅产品动态