Claude Code 新增 Mods 系统允许开发者重写内部逻辑
Anthropic 为 Claude Code 发布 Mods 系统,这是直接运行在工具内部的中间件,允许开发者通过 JavaScript 或 TypeScript 钩子改变其外观和工作流。
Anthropic 为 Claude Code 发布 Mods 系统,这是直接运行在工具内部的中间件,允许开发者通过 JavaScript 或 TypeScript 钩子改变其外观和工作流。
Google 发布了专为软件工程和企业知识工作设计的 Gemini 4 Argon 前沿模型,主打持续推理能力。该模型初期仅限受信任的网络防御者访问,将在分阶段安全测试后逐步扩大可用性。
Anthropic 将 Claude Cowork 和聊天合并为单一产品,并支持直接编辑和下载 PPT。OpenAI 在 ChatGPT 中推出由广告主赞助的智能体对话入口。Meta 发布 FLAT 多模态生成方法,Google 在 GKE 上线高并发 Agent Substrate 执行运行时。
Anthropic CEO Dario Amodei 提议通过独立评估者等措施放缓前沿 AI 能力开发。ARC Prize 发布 ARC-AGI-4,强调开源是科学创新 AI 的基础。Cursor 推出 Projects 功能,新用户合并 PR 数量提升 30%。
2026 年 AI 工程师面试重点考察端到端交付小型 AI 产品、量化评估效果及决策论证能力,单纯演示价值有限。推荐开源框架 Agent-Native,其让 UI 与 Agent 共享状态,应用可作为 MCP 服务器被 Claude 等智能体驱动,并支持 A2A 协议。
SpaceXAI 发布 Grok 4.6,在 Artificial Analysis 榜单上超越 Kimi K3,并与 GPT-5.6 Sol 并列第三。该模型在 GDPVal-AA v2 和 AA-Briefcase 评测中得分领先于 Sol Max 和 Fable 5 Max,但 CursorBench v3.2 得分 69.9% 高于 Sol 的 67.2%。
Google 发布基于 Gemini 3.5 Flash 微调的网络安全模型 Gemini 3.5 Flash Cyber,用于高效发现、验证和修复代码漏洞。该模型通过限制政府及可信合作伙伴的试点计划访问,在 CyberGym 和 Chrome 生产环境等测试中展现了优于主线路基模型和更大模型的高效性能,已用于保护 Google 内部代码库。
推荐理由:官方发布了针对网络安全微调的轻量化模型,提供了在漏洞扫描任务中降低成本并提升覆盖率的实操架构。
用户将 GPT 或 Claude API 指向低价服务时,面临钱包加密资产被盗、恶意代码注入及云凭据泄露风险。研究人员测试了 400 家此类服务,发现部分存在严重安全隐患,用户需警惕为节省成本而接入不可靠 API 的行为。
Claude Code 和 Codex 的核心用户不再通过编写提示词,而是设计让智能体自主检查状态、决定继续或停止的循环系统,以替代人工监控。循环工程不同于 cron 任务,包含让循环正常运行的 5 个构建模块。若忽视特定的 2 个陷阱,将导致 token 预算被大量消耗。
Mistral AI 基于开源助手 Vibe 构建自主 Agent,在 CI/CD 中并行生成 RSpec 测试。通过配置 AGENTS.md 和分类 Skills,该 Agent 结合 RuboCop 与 SimpleCov 验证代码,质量分数从 0.68 提升至 0.74。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。