Hugging Face Blog·· 2022-03-16AI 评分27
使用 Hugging Face Transformers 和 AWS Inferentia 加速 BERT 推理
Accelerate BERT inference with Hugging Face Transformers and AWS Inferentia
AI 导读
本文教程指导用户通过 Hugging Face Transformers 和 AWS Inferentia 加速 BERT 文本分类推理。AWS 称 Inferentia 相比同代 GPU 实例推理成本降低 80%,吞吐量提升 2.3 倍。流程包括使用 AWS Neuron SDK 将模型转换为 Neuron 格式,并部署至 Amazon SageMaker 实时推理端点。
来源:Hugging Face Blog · huggingface.co