uniopen 如何通过定制 Amazon Nova 2 Lite 适应零售审核策略
uniopen 团队通过在 Amazon SageMaker AI 上进行监督微调及提示词优化,将 Amazon Nova 2 Lite 定制为符合其特定零售业务的审核模型。
uniopen 团队通过在 Amazon SageMaker AI 上进行监督微调及提示词优化,将 Amazon Nova 2 Lite 定制为符合其特定零售业务的审核模型。
NVIDIA DGX Spark 64GB 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发布,起价 4,999 美元,支持 DGX OS、CUDA-X AI 和 Ollama、vLLM、PyTorch 等本地 AI 软件栈。
Baseten 正式成为 Hugging Face Hub 支持的推理提供商,首批支持 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等开源 LLM 的对话与文本生成任务。PRO 用户每月可获得价值 $2 的推理积分,通过 HF 路由的请求按提供商标准 API 费率计费且无额外加价。
Public AI Inference Utility 正式成为 Hugging Face Hub 支持的 Inference Provider。该开源项目通过 vLLM 后端和全球负载均衡层,为 Swiss AI Initiative 等机构提供基于捐赠 GPU 时间的免费推理服务。
Hugging Face 团队在其 nanoVLM 仓库中从零实现了 KV Cache,使文本生成速度提升 38%。该优化通过缓存 Key 和 Value 矩阵,避免了自回归生成中的重复计算。
Hugging Face 博客提供框架用于计算单日 10 亿次以上分类或嵌入任务的推理成本。案例显示在 nvidia-L4 硬件上处理 10 亿次分类请求成本为 $253.82,嵌入为 $409.44,视觉嵌入高达 $44,496.51。通过调整 INFINITY_BATCH_SIZE 和 VUs 等参数并水平扩展 GPU 副本,可优化高吞吐量下的成本效率。
Hugging Face 开源基于 Rust 的 xet-core 和 hf_xet,将 Hugging Face Hub 模型与数据集仓库的上传下载速度提升 2 至 3 倍。方案通过引入 Block 和 Shard 聚合机制替代纯 Chunk 存储,减少内容寻址存储条目达 1000 倍,并优化了 3.5PB 量化 GGUF 模型文件的去重效率。
在 Google Cloud C4 实例(5 代 Xeon)上运行 Llama-3.2-3 模型和 UAE-Large-V1 嵌入模型,文本嵌入吞吐量较 N2 提升 10–24 倍,文本生成提升 2.3–3.6 倍。C4 每小时价格约为 N2 的 1.3 倍,在成本调整后嵌入和生成的总拥有成本优势分别为 7–19 倍和 1.7–2.9 倍。
GaLore 利用梯度低秩结构实现显存高效的大语言模型全参数训练,将优化器状态显存降低 82.5% 以上。该方法支持结合 8-bit 优化器,使 7B 参数模型能在 NVIDIA RTX 4090 等消费级 GPU 上完成训练。
Hugging Face 推出 PyTorch 量化后端 Quanto,作为 Optimum 的组件支持 int8、int4、int2 及 float8 权重与激活量化。
Hugging Face Diffusers 宣布支持通过 JAX 在 Google Cloud TPU v5e 上部署 Stable Diffusion XL,实现高性能且成本高效的推理。
本文教程指导用户通过 Hugging Face Transformers 和 AWS Inferentia 加速 BERT 文本分类推理。AWS 称 Inferentia 相比同代 GPU 实例推理成本降低 80%,吞吐量提升 2.3 倍。流程包括使用 AWS Neuron SDK 将模型转换为 Neuron 格式,并部署至 Amazon SageMaker 实时推理端点。
Hugging Face 在 huggingface_hub 中推出了增强搜索功能,新增 ModelSearchArguments 和 ModelFilter 类,支持在 Python 环境中通过程序化接口按任务、数据集、框架等条件检索模型与数据集。
Hugging Face Transformers 3.1 与 Ray Tune 集成,简化大语言模型超参数调优。实验显示,Population-based Training 在 BERT 上取得 78% 最佳验证准确率,优于网格搜索。用户仅需几行代码即可调用 Ray Tune 算法进行微调。