亚马逊开源 Strands Decider 2B 决策模型,支持本地 CPU/GPU 部署
亚马逊 Strands Agents 团队开源了基于 Qwen3.5-2B 架构的决策模型 Strands Decider 2B,权重已在 Hugging Face 发布,支持本地 CPU 和 GPU 运行。该模型采用评分指针头部并微调躯干,在 JevBench 基准中位列 2B 级别第 3 名,在 NVIDIA GeForce RTX 3090 上的决策时延中位数为 153ms。
亚马逊 Strands Agents 团队开源了基于 Qwen3.5-2B 架构的决策模型 Strands Decider 2B,权重已在 Hugging Face 发布,支持本地 CPU 和 GPU 运行。该模型采用评分指针头部并微调躯干,在 JevBench 基准中位列 2B 级别第 3 名,在 NVIDIA GeForce RTX 3090 上的决策时延中位数为 153ms。
Cloudflare 发布面向 AI 智能体的两个决策模型 Clef 和 Clef-flash,可一次回答多个预定义问题并返回各选项概率,公司称 Agent 不再必须保留人工环节。
Black Forest Labs 发布 FLUX 3 Image,是 FLUX 3 多模态模型中负责生成和编辑图像的模块。该模型支持用户通过 bounding box 将图像元素按 0 到 1000 的网格布局后,让 FLUX 3 在保持各元素位置的前提下渲染整幅图像。
Jev 作为 System One 模型发布,提供比 LLM 快两个数量级的结构化输出,且无模型幻觉,现提供早期访问。Periodic Neon 在低成本下超越 GPT-6 Astra 和 Claude Fable 5.1,用于科学分析。Google 推出 Gemini 3.8 Live 和 3.5 Transcribe,用于实时语音应用。
SpaceXAI 发布 Grok 4.6,在 Artificial Analysis 榜单上超越 Kimi K3,并与 GPT-5.6 Sol 并列第三。该模型在 GDPVal-AA v2 和 AA-Briefcase 评测中得分领先于 Sol Max 和 Fable 5 Max,但 CursorBench v3.2 得分 69.9% 高于 Sol 的 67.2%。
Meta 发布开源多模态模型 Muse Glimmer,模型为 30B 参数,基于 Muse 蒸馏而来,采用 Apache 2.0 许可,专为本地智能体应用场景设计。
推荐理由:文章展示了Muse Glimmer在本地部署场景下的自优化演示,为隐私敏感应用提供了低成本运行方案。
Google 发布基于 Gemini 3.5 Flash 微调的网络安全模型 Gemini 3.5 Flash Cyber,用于高效发现、验证和修复代码漏洞。该模型通过限制政府及可信合作伙伴的试点计划访问,在 CyberGym 和 Chrome 生产环境等测试中展现了优于主线路基模型和更大模型的高效性能,已用于保护 Google 内部代码库。
推荐理由:官方发布了针对网络安全微调的轻量化模型,提供了在漏洞扫描任务中降低成本并提升覆盖率的实操架构。
Mistral 发布 Mistral Small 4,将 Magistral、Pixtral、Devstral 与 Mistral Small 的指令、推理与多模态能力合并为单一模型,并以 Apache 2.0 开源。
推荐理由:原文明确给出架构、吞吐延迟优化和许可细节,读者可据此判断统一模型如何降低多模型切换成本。
H Company 在 Hugging Face 上发布开源行动视觉语言模型 Holo1 家族和 WebClick 多模态定位基准。
推荐理由:开源Holo1行动VLM家族与Surfer-H代理给出可对比的成本和精度基准,读者可评估网页自动化的落地门槛。