SpaceXAI 发布 Grok 4.6,击败 Kimi K3 并并列 GPT-5.6 Sol 第三
SpaceXAI 发布 Grok 4.6,在 Artificial Analysis 榜单上超越 Kimi K3,并与 GPT-5.6 Sol 并列第三。该模型在 GDPVal-AA v2 和 AA-Briefcase 评测中得分领先于 Sol Max 和 Fable 5 Max,但 CursorBench v3.2 得分 69.9% 高于 Sol 的 67.2%。
SpaceXAI 发布 Grok 4.6,在 Artificial Analysis 榜单上超越 Kimi K3,并与 GPT-5.6 Sol 并列第三。该模型在 GDPVal-AA v2 和 AA-Briefcase 评测中得分领先于 Sol Max 和 Fable 5 Max,但 CursorBench v3.2 得分 69.9% 高于 Sol 的 67.2%。
Google 发布基于 Gemini 3.5 Flash 微调的网络安全模型 Gemini 3.5 Flash Cyber,用于高效发现、验证和修复代码漏洞。该模型通过限制政府及可信合作伙伴的试点计划访问,在 CyberGym 和 Chrome 生产环境等测试中展现了优于主线路基模型和更大模型的高效性能,已用于保护 Google 内部代码库。
推荐理由:官方发布了针对网络安全微调的轻量化模型,提供了在漏洞扫描任务中降低成本并提升覆盖率的实操架构。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。