跳到正文

内容形态

教程实践 最新动态

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

41 条精选近 30 天 8 条共收录 296 条

更新

精选归档 · 第 2 页

1月2日周二第 21–40 条
  1. Hugging Face Blog76

    SDXL Dreambooth LoRA 高级训练实践指南:结合 Pivotal Tuning 与 Prodigy 优化器

    Hugging Face 团队发布了一份关于 SDXL Dreambooth LoRA 微调的最佳实践指南,整合了 Pivotal Tuning 技术和 Prodigy 优化器以显著提升训练效果。

    推荐理由:原文提供了一套结合 Pivotal Tuning 和 Prodigy 优化器的 SDXL LoRA 训练实践指南,并附带了可运行的训练脚本与推理方法。

12月20日周三
  1. Hugging Face Blog60

    使用推测解码实现 2 倍更快 Whisper 推理

    Hugging Face 演示了如何使用推测解码(Speculative Decoding)在保持模型输出不变的前提下,将 Whisper 语音转写推理速度提升约 2 倍。

    推荐理由:原文提供了数学保证输出不变的 2 倍加速原理和 Python 实操,读者可直接复用到现有语音转写流程。

12月11日周一
  1. Hugging Face Blog82

    MoE 混合专家架构全面解析

    Hugging Face 发布技术博客解析混合专家(MoE)模型,以 Mixtral 8x7B 为例拆解 MoE 的路由、稀疏性、训练稳定性和部署优化。文章详细讲解了 Gate 网络的路由逻辑、负载均衡损失,并指出 MoE 在推理时具有更高速度但需要高 VRAM 加载所有参数,微调容易过拟合但适合高频指令调优。

    推荐理由:结合 Mixtral 8x7B 的背景,拆解 MoE 的路由、稀疏性、训练稳定性和部署优化逻辑,是掌握大模型架构的实用材料。

10月27日周五
9月28日周四
  1. Hugging Face Blog70

    面向非工程人员的指南:训练一个 LLaMA 2 聊天机器人

    教程演示了如何使用 Hugging Face Spaces、AutoTrain 和 ChatUI 在不写代码的情况下,基于 LLaMA 2 7B 微调一个开源 LLM 并部署为可共享的聊天应用。

    推荐理由:教程面向零基础读者,演示了如何用 AutoTrain 和 Spaces 微调 LLaMA 2 并部署成聊天应用,适合想了解开源模型部署流程的读者。

9月18日周一
  1. Hugging Face Blog65

    3D Gaussian Splatting 技术原理与工程实践解读

    3D Gaussian Splatting 是一种利用高斯点替代三角形网格的实时光栅化技术,能够从少量图像中学习并渲染照片级真实感场景。该技术将 SfM 点云转化为可训练的高斯参数(位置、协方差、颜色、透明度),通过可微光栅化器进行前向渲染与梯度优化,并利用自动加密(分裂/克隆)和剪枝策略提升细节恢复质量。

    推荐理由:基于官方开源实现和 COLMAP 流程,拆解 3D Gaussian Splatting 的网格化训练过程及其在现有渲染管线中的适配限制。

9月15日周五
  1. Hugging Face Blog65

    Hugging Face 详解 LLM 生产环境优化策略

    Hugging Face 技术博客详细解析了 LLM 在生产环境中的优化方法,涵盖低精度量化、Flash Attention 及架构改进。

    推荐理由:文章系统展示了量化、Flash Attention 和架构优化在长上下文推理中的实际内存与速度收益,为工程落地提供直接参考。

8月23日周三
  1. Hugging Face Blog60

    Hugging Face 在 Transformers 中整合 AutoGPTQ 实现大模型轻量化

    Hugging Face 官方宣布将 AutoGPTQ 库整合进 Transformers,支持使用 GPTQ 算法将模型量化为 8、4、3 或 2 位精度。4 位量化下准确率损失微乎其微,且小批量推理速度与 fp16 基准相当。

    推荐理由:Hugging Face 官方将 AutoGPTQ 量化库整合进 Transformers,提供 4-bit 等低精度支持并展示在单卡 A100 上运行大模型的基准表现。

8月8日周二
  1. Hugging Face Blog82

    Hugging Face 教程:使用 DPO 微调 Llama 2

    Hugging Face 在 TRL 库中引入了 DPO(Direct Preference Optimization)功能,允许开发者跳过复杂的 RLHF 奖励模型构建环节,直接通过偏好数据微调大模型。教程展示了如何使用 QLoRA 技术对 Llama v2 7B 模型进行 SFT 和 DPO 两阶段训练,并提供了基于 Stack-Exchange 偏好数据集的完整代码示例与训练指标监控方法。

    推荐理由:教程结合官方库演示了如何用 DPO 替代复杂 RLHF 流程微调 Llama 2,提供了可直接运行的 QLoRA 训练代码。

7月27日周四
  1. Hugging Face Blog72

    Stable Diffusion XL 支持 Mac 端侧运行及 Core ML 高级量化

    Hugging Face 与 Apple 合作实现 Stable Diffusion XL 在 Apple Silicon Mac 上的本地运行,通过混合位调色(Mixed-Bit Palettization)技术将 UNet 模型压缩至等效 4.5 bit/参数,体积从 4.8 GB 降至 1.4 GB(减少71%)且生成质量优良。

    推荐理由:介绍了混合位调色量化技术,可将模型尺寸降低71%且保持质量,为本地化部署提供了实用方法。

4月5日周三
  1. Hugging Face Blog65

    StackLLaMA: 基于 RLHF 微调 LLaMA 模型的实战指南

    Hugging Face 团队开源了 StackLLaMA 模型及 RLHF 训练全流程实现,展示了如何通过监督微调(SFT)、奖励建模(RM)和强化学习(RLHF)让 7B 规模的 LLaMA 模型回答 Stack Exchange 问题。该流程支持使用 LoRA 和 8-bit 量化技术将模型部署在单块 80GB A100 GPU 上,降低了模型对齐训练的硬件门槛。

    推荐理由:原文提供了基于 LLaMA 模型进行 RLHF 训练的完整流水线实现与参数优化策略,适合需要降低模型对齐训练硬件门槛的开发者。

3月3日周五
  1. Hugging Face Blog77

    Diffusers 教程:使用 ControlNet 实现可控图像生成

    Hugging Face 发布教程,介绍如何在 Diffusers 中使用 ControlNet 实现可控图像生成。教程演示了利用 Canny 边缘、OpenPose 姿态及多条件组合控制 Stable Diffusion 生成结果的代码实现,并展示了如何通过启用 CPU 内存卸载及 xformers 加速将推理时间缩短至 V100 GPU 上的约 3 秒。

    推荐理由:原文提供了在 Diffusers 中结合 ControlNet 实现可控图像生成的具体代码示例与优化技巧。

2月15日周三
  1. Hugging Face Blog70

    BLIP-2 实现零样本图像到文本生成的指南

    Salesforce Research 的 BLIP-2 模型已集成至 Hugging Face Transformers,支持零样本图像描述、带提示的图像描述、视觉问答和聊天式提示。

    推荐理由:解释了BLIP-2如何用轻量级Q-Former桥接图像编码器和大语言模型,给出了零样本图像描述、问答和聊天式提示的完整代码流程。

1月26日周四
  1. Hugging Face Blog80

    Hugging Face 发布 diffusers 的 LoRA 微调支持

    Hugging Face 的 diffusers 库正式支持 LoRA(低秩适配)技术用于 Stable Diffusion 的微调。该方案通过冻结预训练模型权重并注入可训练层,显著降低了计算资源和显存需求,例如在 11 GB 显存的 2080 Ti 显卡上即可完成全量微调,且训练得到的权重文件仅约 3 MB,便于共享。

    推荐理由:原文给出了LoRA微调的完整实践指南,读者可以据此用更低成本训练和共享自定义模型。

12月14日周三
  1. Hugging Face Blog67

    Habana Gaudi2 vs Nvidia A100 80GB:模型训练与推理性能对比

    Habana Gaudi2在BERT预训练、Stable Diffusion推理和T5-3B微调上的吞吐或延迟比Nvidia A100 80GB快约1.8至2.84倍,且支持更大模型微调。测试通过Optimum Habana框架完成,单卡显存为96GB;A100使用fp16,Gaudi使用bf16或fp32。

    推荐理由:给出了Gaudi2与A100的逐项吞吐、延迟和参数量对比,读者可以据此判断硬件替代成本。

12月9日周五
  1. Hugging Face Blog63

    Hugging Face 详解 RLHF(基于人类反馈的强化学习)原理与开源实现

    RLHF 利用人类反馈直接优化大语言模型,使其对齐复杂的人类价值观。该流程包含预训练语言模型、收集数据并训练奖励模型、使用 PPO 强化学习微调语言模型三个核心步骤。Hugging Face 介绍了当前活跃的开源工具 TRL、TRLX 和 RL4LMs,并梳理了该领域的发展脉络、现存挑战及后续方向。

    推荐理由:将多模型协同训练的复杂机制拆解为三阶段并梳理开源工具,帮助读者建立对RLHF完整管线的实操理解。

11月7日周一
8月22日周一
7月27日周三
  1. Hugging Face Blog65

    使用 XLA 加速 Hugging Face TensorFlow 文本生成

    Hugging Face 宣布通过 XLA 编译器显著加速 TensorFlow 文本生成,性能提升最高达 100 倍,在多数情况下比 PyTorch 快 9 倍。该方法通过在 tf.function 中启用 jit_compile 参数实现优化,并需对输入进行填充以固定张量维度,从而避免重复编译。

    推荐理由:展示了XLA编译将TensorFlow文本生成提速至百倍甚至超越PyTorch的方法,给出了可直接复用的优化步骤。

12月8日周三
  1. Hugging Face Blog64

    Hugging Face 教程:从零开始训练 CodeParrot 代码生成模型

    Hugging Face 发布教程,介绍如何从零训练 110M 和 1.5B 参数的 GPT-2 模型 CodeParrot 以生成 Python 代码。该模型使用基于 180GB Python 代码清洗后的 50GB 数据集训练,并采用 🤗 Accelerate 库在 16 张 A100 GPU 上完成分布式训练。

    推荐理由:提供了训练 GPT-2 大模型的具体步骤,涵盖数据清洗、分词器设计和分布式训练,可复用于自研代码模型。