Amazon 发布开源决策模型 Strands Decider 2B
Amazon 发布基于 Qwen3.5-2B 架构的开源决策模型 Strands Decider 2B,该模型支持本地运行,输出带置信度评分的校准选择而非生成文本,旨在为代理工作流提供低延迟、低成本的决策步骤。
Amazon 发布基于 Qwen3.5-2B 架构的开源决策模型 Strands Decider 2B,该模型支持本地运行,输出带置信度评分的校准选择而非生成文本,旨在为代理工作流提供低延迟、低成本的决策步骤。
亚马逊 Strands Agents 团队开源了基于 Qwen3.5-2B 架构的决策模型 Strands Decider 2B,权重已在 Hugging Face 发布,支持本地 CPU 和 GPU 运行。该模型采用评分指针头部并微调躯干,在 JevBench 基准中位列 2B 级别第 3 名,在 NVIDIA GeForce RTX 3090 上的决策时延中位数为 153ms。
DeepSeek V4.1 Flash 在写作基准测试中平均耗时 43 秒且单脚本成本低于 1 美分,速度比 Fable 快 12 倍、便宜 250 倍。该模型骨干规模接近 V4 Flash 的两倍,全局 KV cache 体积缩小约四分之一。作者建议在需人工编辑的初稿场景使用默认推理设置以控制成本。
Mistral 发布 Mistral Small 4,将 Magistral、Pixtral、Devstral 与 Mistral Small 的指令、推理与多模态能力合并为单一模型,并以 Apache 2.0 开源。
推荐理由:原文明确给出架构、吞吐延迟优化和许可细节,读者可据此判断统一模型如何降低多模型切换成本。
Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。
推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。
GaLore 利用梯度低秩结构实现显存高效的大语言模型全参数训练,将优化器状态显存降低 82.5% 以上。该方法支持结合 8-bit 优化器,使 7B 参数模型能在 NVIDIA RTX 4090 等消费级 GPU 上完成训练。
Hugging Face 推出 PyTorch 量化后端 Quanto,作为 Optimum 的组件支持 int8、int4、int2 及 float8 权重与激活量化。
Hugging Face 在 huggingface_hub 中推出了增强搜索功能,新增 ModelSearchArguments 和 ModelFilter 类,支持在 Python 环境中通过程序化接口按任务、数据集、框架等条件检索模型与数据集。