跳到正文
Hugging Face Blog·· 2023-08-23精选AI 评分60

Hugging Face 在 Transformers 中整合 AutoGPTQ 实现大模型轻量化

Making LLMs lighter with AutoGPTQ and transformers

AI 导读

Hugging Face 官方宣布将 AutoGPTQ 库整合进 Transformers,支持使用 GPTQ 算法将模型量化为 8、4、3 或 2 位精度。4 位量化下准确率损失微乎其微,且小批量推理速度与 fp16 基准相当。

推荐理由

Hugging Face 官方将 AutoGPTQ 量化库整合进 Transformers,提供 4-bit 等低精度支持并展示在单卡 A100 上运行大模型的基准表现。

来源:Hugging Face Blog · huggingface.co