Hugging Face Blog·· 2023-12-05精选AI 评分76
Optimum-NVIDIA 库发布:通过一行代码和 FP8 量化实现 LLM 推理加速
Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code
AI 导读
Hugging Face 发布 Optimum-NVIDIA 推理库,支持在 NVIDIA 平台上通过修改一行代码启用 FP8 量化,实现最高 28 倍推理加速和 1200 tokens/s 的吞吐量。
推荐理由
提供了从 Transformers 迁移至 Optimum-NVIDIA 的代码对比,展示了 FP8 量化在降低首字延迟和提升吞吐量方面的具体收益。
来源:Hugging Face Blog · huggingface.co