Hugging Face 教程:基于 StarCoder 微调个人代码助手
Hugging Face 发布教程,演示如何基于 bigcode/starcoder 微调个人代码助手 HugCoder,使用 Hugging Face GitHub 组织公开仓库作为训练数据。
推荐理由:原文完整展示了从 GitHub 仓库提取代码到 QLoRA 与全量微调 StarCoder 的流程,并提供了 1B 模型在本地 M1 芯片运行的可复现步骤。
公司与模型
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
72 条精选近 30 天 4 条共收录 390 条
Hugging Face 发布教程,演示如何基于 bigcode/starcoder 微调个人代码助手 HugCoder,使用 Hugging Face GitHub 组织公开仓库作为训练数据。
推荐理由:原文完整展示了从 GitHub 仓库提取代码到 QLoRA 与全量微调 StarCoder 的流程,并提供了 1B 模型在本地 M1 芯片运行的可复现步骤。
Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。
推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。
TRL 库新集成了 DDPOTrainer 类,用于将 Denoising Diffusion Policy Optimization (DDPO) 应用于 Stable Diffusion 模型,使其输出更符合人类审美等偏好。
推荐理由:通过 TRL 新集成的 DDPOTrainer,读者可以直接在本地用 RL 微调 Stable Diffusion,降低扩散模型对齐人类偏好的门槛。
Hugging Face 推出面向 PRO 订阅用户的 Inference API 服务,通过基于 text-generation-inference 的专属端点,为精选模型提供更高速率限制和更快的推理体验。
推荐理由:Hugging Face 将 Llama 3 和 Mixtral 等热门模型的 API 接入纳入付费订阅,并兼容 OpenAI 调用规范,便于用户直接替换现有代码。
3D Gaussian Splatting 是一种利用高斯点替代三角形网格的实时光栅化技术,能够从少量图像中学习并渲染照片级真实感场景。该技术将 SfM 点云转化为可训练的高斯参数(位置、协方差、颜色、透明度),通过可微光栅化器进行前向渲染与梯度优化,并利用自动加密(分裂/克隆)和剪枝策略提升细节恢复质量。
推荐理由:基于官方开源实现和 COLMAP 流程,拆解 3D Gaussian Splatting 的网格化训练过程及其在现有渲染管线中的适配限制。
Würstchen 是一款采用高度压缩隐空间的扩散图像生成模型,通过 42 倍空间压缩技术显著降低计算成本并提升生成速度。模型 v1 版本的训练成本仅 9,000 GPU 小时,较 Stable Diffusion 1.4 减少 16 倍,现已通过 Diffusers 库开放使用并支持 1024 至 1536 分辨率。
推荐理由:模型通过 42 倍空间压缩实现生成加速,其 9,000 GPU 小时训练成本大幅低于同类技术。
Hugging Face 正式发布 TII 开发的开源大语言模型 Falcon 180B,该模型拥有 1800 亿参数,使用了 3.5 万亿 tokens 进行预训练。
推荐理由:Falcon 180B 是当时最大的开源语言模型,在 Hugging Face 生态中提供了完整的部署和微调指南。
Hugging Face 发布 Code Llama 家族模型,提供 7B、13B 和 34B 参数版本及其 Python 特化与指令微调变体。基于 Llama 2 并经过 500B tokens 代码数据训练,支持 16k 上下文扩展至 100k。
推荐理由:展示了 Code Llama 在 Hugging Face 生态中的完整部署与微调路径,为工程师提供了可复用的生产级工具链。
Hugging Face 官方宣布将 AutoGPTQ 库整合进 Transformers,支持使用 GPTQ 算法将模型量化为 8、4、3 或 2 位精度。4 位量化下准确率损失微乎其微,且小批量推理速度与 fp16 基准相当。
推荐理由:Hugging Face 官方将 AutoGPTQ 量化库整合进 Transformers,提供 4-bit 等低精度支持并展示在单卡 A100 上运行大模型的基准表现。
Hugging Face 发布开源多模态模型 IDEFICS,该模型是对 DeepMind Flamingo 的开源复现,可处理图像和文本序列输入并生成文本输出。
推荐理由:该模型基于公开数据复现了专有视觉语言模型,并展示了红队测试与透明度实践。
Hugging Face 在 TRL 库中引入了 DPO(Direct Preference Optimization)功能,允许开发者跳过复杂的 RLHF 奖励模型构建环节,直接通过偏好数据微调大模型。教程展示了如何使用 QLoRA 技术对 Llama v2 7B 模型进行 SFT 和 DPO 两阶段训练,并提供了基于 Stack-Exchange 偏好数据集的完整代码示例与训练指标监控方法。
推荐理由:教程结合官方库演示了如何用 DPO 替代复杂 RLHF 流程微调 Llama 2,提供了可直接运行的 QLoRA 训练代码。
Hugging Face 官方发布博客,介绍结合了 RNN 与 Transformer 优势的 RWKV 架构,目前已集成至 transformers 库并支持多种模型规格。
推荐理由:介绍了 RWKV 架构如何融合 RNN 推理效率与 Transformer 长上下文优势,并展示了在 Hugging Face 上的完整使用示例。
Hugging Face 推出代码大语言模型 StarCoder,基座 StarCoderBase 在 The Stack 1.2 数据集上用 80+ 种语言、1 万亿 token 训练出 15B 参数模型,StarCoder 进一步在 35B Python token 上微调得到。
推荐理由:官方展示了模型在 HumanEval 等基准上超越同体量开源及闭源模型的成绩,并给出了多语言与辅助对话的应用潜力。
Hugging Face 官方发布 trl 与 peft 的集成更新,实现资源受限下的 LLM RLHF 微调。通过 8-bit 矩阵乘法和 LoRA 适配器降低显存占用,在 24GB 的 NVIDIA 4090 GPU 上成功微调 20B 参数量的 gpt-neox 模型,展示了消费级硬件参与大规模模型训练的可能性。
推荐理由:将 LoRA 与 8-bit 量化结合,让消费级 GPU 承担 20B 模型微调,为资源有限的团队降低 RLHF 落地门槛。
Hugging Face 发布教程,介绍如何在 Diffusers 中使用 ControlNet 实现可控图像生成。教程演示了利用 Canny 边缘、OpenPose 姿态及多条件组合控制 Stable Diffusion 生成结果的代码实现,并展示了如何通过启用 CPU 内存卸载及 xformers 加速将推理时间缩短至 V100 GPU 上的约 3 秒。
推荐理由:原文提供了在 Diffusers 中结合 ControlNet 实现可控图像生成的具体代码示例与优化技巧。
Salesforce Research 的 BLIP-2 模型已集成至 Hugging Face Transformers,支持零样本图像描述、带提示的图像描述、视觉问答和聊天式提示。
推荐理由:解释了BLIP-2如何用轻量级Q-Former桥接图像编码器和大语言模型,给出了零样本图像描述、问答和聊天式提示的完整代码流程。
Hugging Face 发布 PEFT 库,集成 LoRA 和 Prompt Tuning 等技术,与 Transformers 和 Accelerate 无缝结合。使用 LoRA 微调 bigscience/T0_3B 模型只需 11GB 显存,且模型权重仅 19MB 即可保存部署,性能接近全量微调。
推荐理由:官方开源了可插拔的轻量微调库,允许用 MB 级参数文件在消费级显卡上复现全量微调效果,改变了大模型适应下游任务的成本结构。
Hugging Face 在 Transformers 库中实现了微软研发的 SpeechT5 语音模型,支持 TTS、ASR 和语音转换。该模型利用统一的 Transformer 架构,通过在混合数据上预训练并结合不同的前馈层和反向网络来执行多项任务。
推荐理由:通过预训练统一模型架构,展示了语音与文本模态如何共享 Transformer 骨干实现多任务处理。
Hugging Face 的 diffusers 库正式支持 LoRA(低秩适配)技术用于 Stable Diffusion 的微调。该方案通过冻结预训练模型权重并注入可训练层,显著降低了计算资源和显存需求,例如在 11 GB 显存的 2080 Ti 显卡上即可完成全量微调,且训练得到的权重文件仅约 3 MB,便于共享。
推荐理由:原文给出了LoRA微调的完整实践指南,读者可以据此用更低成本训练和共享自定义模型。
Habana Gaudi2在BERT预训练、Stable Diffusion推理和T5-3B微调上的吞吐或延迟比Nvidia A100 80GB快约1.8至2.84倍,且支持更大模型微调。测试通过Optimum Habana框架完成,单卡显存为96GB;A100使用fp16,Gaudi使用bf16或fp32。
推荐理由:给出了Gaudi2与A100的逐项吞吐、延迟和参数量对比,读者可以据此判断硬件替代成本。