跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

24 条精选近 30 天 6 条共收录 172 条

更新

精选归档 · 第 2 页

8月3日周三第 21–24 条
  1. Hugging Face Blog60

    Hugging Face 发布 Private Hub,支持私有化部署机器学习开发环境

    Hugging Face 推出 Private Hub,允许企业在合规的私有环境中运行其完整的机器学习生态系统。该功能集成了 AutoTrain、Spaces 和 Inference API,支持模型微调、演示及推理部署,数据不出内网。更新显示,Private Hub 现已更名为 Enterprise Hub,不再提供本地部署,改为提供云端托管及混合云解决方案,并支持 SSO 等高级访问控制。

    推荐理由:介绍了私有化部署方案如何帮助企业加速模型全生命周期开发。

7月27日周三
  1. Hugging Face Blog65

    使用 XLA 加速 Hugging Face TensorFlow 文本生成

    Hugging Face 宣布通过 XLA 编译器显著加速 TensorFlow 文本生成,性能提升最高达 100 倍,在多数情况下比 PyTorch 快 9 倍。该方法通过在 tf.function 中启用 jit_compile 参数实现优化,并需对输入进行填充以固定张量维度,从而避免重复编译。

    推荐理由:展示了XLA编译将TensorFlow文本生成提速至百倍甚至超越PyTorch的方法,给出了可直接复用的优化步骤。

7月14日周四
  1. Hugging Face Blog62

    BLOOM 176B 模型训练技术揭秘:Megatron-DeepSpeed 与并行化实践

    BLOOM 项目团队发布 176B 参数模型训练技术总结,详细介绍了基于 384 块 A100 GPU 的硬件架构与软件配置。文章深度解析了 Megatron-DeepSpeed 框架中 3D 并行(DP、TP、PP)与 ZeRO 分片机制,阐述了 BF16 优化器在避免溢出及提高训练稳定性中的作用。通过记录 48 节点集群训练过程中遇到的故障与优化策略,为大规模分布式 LLM 训练提供工程参考。

    推荐理由:文章拆解了 Megatron-DeepSpeed 的 3D 并行机制与 BF16 优化策略,为大规模模型训练提供了工程参考。

5月10日周二