Hugging Face 发布 Optimum 的 PyTorch 量化后端 Quanto
Hugging Face 推出 PyTorch 量化后端 Quanto,作为 Optimum 的组件支持 int8、int4、int2 及 float8 权重与激活量化。
Hugging Face 推出 PyTorch 量化后端 Quanto,作为 Optimum 的组件支持 int8、int4、int2 及 float8 权重与激活量化。
Argilla 与 Hugging Face 启动“Data is Better Together”实验,通过社区协作构建偏好数据集。该实验在数天内吸引 350 名贡献者完成超过 11,000 条提示词评级,并发布包含 10,000 条提示词的 10k_prompts_ranked 数据集。双方正招募首批社区 cohort,提供 Argilla Space 支持及免费持久化存储资源。
Hugging Face 测试了提升 SDXL 推理速度与降低内存占用的优化方案。在 A100 GPU 上,结合 fp16、SDPA 及 torch.compile,推理时间从 72.2 秒缩短至 10.2 秒,内存占用从 28GB 降至 21.7GB。
Hugging Face 推出 @gradio/lite 库,利用 Pyodide 将 Gradio 应用直接运行在浏览器中,无需服务器基础设施。开发者可用 Python 编写应用,支持通过 micropip 安装 transformers_js_py 等依赖,并可在 Hugging Face Static Space 免费托管。
Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。
推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。
Hugging Face Diffusers 宣布支持通过 JAX 在 Google Cloud TPU v5e 上部署 Stable Diffusion XL,实现高性能且成本高效的推理。
本文演示如何利用 Hugging Face Inference API 部署 AI Comic Factory。
Hugging Face 发布第 5 期伦理与社会通讯,总结其团队向欧盟、英国和美国立法者提供 AI 价值观建议,并分享 CEO Clem 在美国国会的证词。通讯还列举了团队在媒体、TED 及 FAccT 会议上的演讲,并宣布将公平与偏见测试应用于多模态模型 IDEFICS。
TRL 库新集成了 DDPOTrainer 类,用于将 Denoising Diffusion Policy Optimization (DDPO) 应用于 Stable Diffusion 模型,使其输出更符合人类审美等偏好。
推荐理由:通过 TRL 新集成的 DDPOTrainer,读者可以直接在本地用 RL 微调 Stable Diffusion,降低扩散模型对齐人类偏好的门槛。
教程演示了如何使用 Hugging Face Spaces、AutoTrain 和 ChatUI 在不写代码的情况下,基于 LLaMA 2 7B 微调一个开源 LLM 并部署为可共享的聊天应用。
推荐理由:教程面向零基础读者,演示了如何用 AutoTrain 和 Spaces 微调 LLaMA 2 并部署成聊天应用,适合想了解开源模型部署流程的读者。
Hugging Face 梳理了包含 Llama 2 和 BLOOM 在内的开源大语言模型生态。Llama 2 是允许商用的开放获取模型,HuggingChat 提供最大检查点试用。BLOOM 是首个参数量超越 GPT-3 的开源模型,StarCoder 则针对 80 多种编程语言进行代码补全训练。
本教程展示了如何利用 Intel Sapphire Rapids CPU 上的 AMX 硬件加速器,在纯 CPU 集群上微调 Stable Diffusion 模型。该过程使用 textual inversion 技术,仅通过 5 张示例图像即可完成训练,无需 GPU 基础设施。
教程演示如何使用 Transformers.js 在浏览器中完全本地运行 ML 网页游戏 Doodle Dash。该游戏基于 Google Quick, Draw! 数据集微调了 5.6M 参数的 apple/mobilevit-small 模型,通过 Web Workers 实现每秒 60 次以上的实时推理预测。
Hugging Face 机器学习专家系列节目邀请到曾创立并联合领导 Google 伦理 AI 团队的 Margaret Mitchell 担任嘉宾。她分享了在微软开发 Seeing AI 应用时,因发现视觉模型对爆炸场景产生“美丽”等错误描述而觉醒伦理 AI 重要性的经历。
Hugging Face 推出为期 9 个月的 AI 研究驻留项目,参与者将与科学团队合作探索机器学习前沿技术并公开发表研究成果。该项目旨在推动 AI 领域的多样性与包容性,特别鼓励来自边缘化群体或致力于社会正向影响的研究者申请。申请需展示编程能力与数学基础,截止日期为 4 月 3 日,且仅接受全职参与。
Hugging Face 官方展示如何利用 datasets 库、sentence_transformers 和 faiss 构建图像搜索应用。该方案使用英国图书馆的书籍插图数据集,通过 datasets 的 ImageFolder 加载器读取图像,并借助 faiss 索引实现基于向量相似度的图像检索,超越了传统标签搜索。
本文教程指导用户通过 Hugging Face Transformers 和 AWS Inferentia 加速 BERT 文本分类推理。AWS 称 Inferentia 相比同代 GPU 实例推理成本降低 80%,吞吐量提升 2.3 倍。流程包括使用 AWS Neuron SDK 将模型转换为 Neuron 格式,并部署至 Amazon SageMaker 实时推理端点。
BERT 是由 Google AI Language 于 2018 年开发的自然语言处理模型,利用 Transformer 架构实现了双向文本理解。该模型通过 3.3 亿词的数据集训练,解决了情感分析等 11 类常见 NLP 任务。其衍生版本 DistilBERT 速度提升 60%,同时保持了 95% 以上的性能。
教程演示利用 Hugging Face datasets 和 transformers 库微调 Vision Transformer (ViT) 处理图像分类。使用 google/vit-base-patch16-224-in21k 模型及其配套的 ViTImageProcessor,通过加载 beans 数据集并应用标准化预处理,将图像转换为模型可接受的张量输入以完成微调流程。
Hugging Face 发布 Python 情感分析入门指南,展示如何用预训练模型实现自动化情感标记。教程提供 5 行代码示例,利用 `transformers` 库的 `pipeline` 函数调用 Hub 上超过 215 个公开模型,无需机器学习经验即可处理数据。
Hugging Face 在 huggingface_hub 中推出了增强搜索功能,新增 ModelSearchArguments 和 ModelFilter 类,支持在 Python 环境中通过程序化接口按任务、数据集、框架等条件检索模型与数据集。
EleutherAI GPT-Neo 结合 Hugging Face 加速推理 API 支持少样本学习,API 提供高达 100 倍推理加速。GPT-Neo (2.7B) 需 3-4 个示例即可实现良好泛化,相比 GPT-3 (175B) 在零样本任务上表现较弱。通过调节温度、最大新 token 数及结束序列等超参数,可控制生成结果,但需注意情感分析等场景可能出现的错误预测风险。