Anthropic 签署 5170 亿美元算力协议,OpenAI 备战 DevDay 2026,Google TPU 推理外扩加速
Anthropic 过去 11 个月签署 5170 亿美元算力租赁协议,其中与 Nscale 达成 450 亿美元交易。OpenAI 计划在 DevDay 2026 发布托管智能体,集成高级模型与计算机使用能力。Google TPUv7 Ironwood 每美元性能优于 Nvidia B200/B300 达 50%,加速外部推理工作负载迁移。
Anthropic 过去 11 个月签署 5170 亿美元算力租赁协议,其中与 Nscale 达成 450 亿美元交易。OpenAI 计划在 DevDay 2026 发布托管智能体,集成高级模型与计算机使用能力。Google TPUv7 Ironwood 每美元性能优于 Nvidia B200/B300 达 50%,加速外部推理工作负载迁移。
Claude 利用 Lean 在 11 天内生成了首个完整的费马大定理计算机验证证明,涉及 1300 万行代码并验证了 29,500 个中间定理。OpenAI 计划于 2028 年 3 月开发自动化 AI 研究员以提升研究效率。Z1 效率芯片在文章中被提及但无详细参数。
2026 年 AI 工程师面试重点考察端到端交付小型 AI 产品、量化评估效果及决策论证能力,单纯演示价值有限。推荐开源框架 Agent-Native,其让 UI 与 Agent 共享状态,应用可作为 MCP 服务器被 Claude 等智能体驱动,并支持 A2A 协议。
Hugging Face 提出 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 模型压缩至 60B 参数并量化为 MXFP4 格式。该 4-bit 模型在 9 项基准测试中的 7 项上,性能超越同架构的 bfloat16 全精度版本。
皮尤研究中心(Pew Research)研究显示,ChatGPT 发布以来约有 1/3 的网页显示由 AI 撰写或编辑的迹象。截至 2026 年,.com 网页中 AI 关联内容占比达 9.4%,远高于 .edu 的 1% 和 .gov 的 0.8%。这种分布不均源于商业出版商利用 AI 提升产能的经济动机,而公共机构受限于流程与激励不足。
Apollo、BlackRock 等六大机构签署备忘录,建立 500 亿美元资金池为 Nvidia 客户提供融资。Jensen Huang 表示 Nvidia 可兜底高达 125 亿美元的风险,通过将 GPU 转化为可抵押资产来维持硬件出货。
SpaceXAI 发布 Grok 4.6,在 Artificial Analysis 榜单上超越 Kimi K3,并与 GPT-5.6 Sol 并列第三。该模型在 GDPVal-AA v2 和 AA-Briefcase 评测中得分领先于 Sol Max 和 Fable 5 Max,但 CursorBench v3.2 得分 69.9% 高于 Sol 的 67.2%。
Meta 发布开源多模态模型 Muse Glimmer,模型为 30B 参数,基于 Muse 蒸馏而来,采用 Apache 2.0 许可,专为本地智能体应用场景设计。
推荐理由:文章展示了Muse Glimmer在本地部署场景下的自优化演示,为隐私敏感应用提供了低成本运行方案。
Baseten 正式成为 Hugging Face Hub 支持的推理提供商,首批支持 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等开源 LLM 的对话与文本生成任务。PRO 用户每月可获得价值 $2 的推理积分,通过 HF 路由的请求按提供商标准 API 费率计费且无额外加价。
学习AI工程应围绕五个核心决策展开:是否使用LLM、系统架构选型(提示词/RAG/微调/智能体)、数据接入与人工介入点、成功标准及评估、以及失败处理机制。作者建议通过阅读基础资料、构建小型系统并加入评估数据集与追踪功能来积累经验,利用评估与反馈转化工程判断力。相关学习路径已整理为免费的公开GitHub路线图,并附带可定制课程大纲的提示词。
创作者使用 AI Agent 团队将单条 YouTube 视频的制作周期从两至三天压缩至五小时,工作量降低 90%。该流程将研究设计为可探索方向的 Agent,写作则设为受约束的工作流以保持一致性。创作者保留了选题方向、观点塑造与最终事实核查环节在人工控制范围内,其余执行步骤由自动化流水线完成。
Google 发布基于 Gemini 3.5 Flash 微调的网络安全模型 Gemini 3.5 Flash Cyber,用于高效发现、验证和修复代码漏洞。该模型通过限制政府及可信合作伙伴的试点计划访问,在 CyberGym 和 Chrome 生产环境等测试中展现了优于主线路基模型和更大模型的高效性能,已用于保护 Google 内部代码库。
推荐理由:官方发布了针对网络安全微调的轻量化模型,提供了在漏洞扫描任务中降低成本并提升覆盖率的实操架构。
Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。
作者在 AI Engineer 世界博览会的主题演讲中展示了一款基于纯文件和引用的 AI 研究操作系统,旨在解决 Agent 难以复用长期记忆的问题。该系统通过三层结构(原始源、索引、维基)将 Obsidian 或 GitHub 等来源转化为可查询和检查的记忆,无需向量数据库或知识图谱。
Microsoft 确认 MAI-Thinking-1 预训练未使用第三方 LLM 生成的合成数据,且避免了第三方模型蒸馏。微软还过滤了收集源中的 AI 生成内容,并排除了 Hugging Face 作为爬取目标,以确保模型血缘清晰。
Hugging Face 提出 MosaicLeaks 基准,评测深研智能体在处理混合本地与网页信息时的隐私泄露风险。测试显示常规训练加剧了信息泄露,而新提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时将答案/全信息泄露率从 34.0% 降至 9.9%。
作者把约 10000 条 Obsidian 笔记、文档、视频、仓库和链接变成可查询的文件式研究 wiki,让 AI agent 能调用、更新和复用。核心思路是:一次性 agent 靠上下文,研究 OS 构建记忆;需要整理来源、索引重点、保留出处、在正确时机加载正确上下文。
用户将 GPT 或 Claude API 指向低价服务时,面临钱包加密资产被盗、恶意代码注入及云凭据泄露风险。研究人员测试了 400 家此类服务,发现部分存在严重安全隐患,用户需警惕为节省成本而接入不可靠 API 的行为。
Claude Code 和 Codex 的核心用户不再通过编写提示词,而是设计让智能体自主检查状态、决定继续或停止的循环系统,以替代人工监控。循环工程不同于 cron 任务,包含让循环正常运行的 5 个构建模块。若忽视特定的 2 个陷阱,将导致 token 预算被大量消耗。
AI 图像生成并非通过搜索数据库拼接,而是基于两大核心路径:从噪声中雕刻,或像写句子般逐块构建。Midjourney、ChatGPT、FLUX 等主流工具均属于其中一类。
Hugging Face 团队通过构建基于 Gemma 4 E2B 的浏览器助手示例,分享了在 Chrome 扩展 Manifest V3 中集成 Transformers.js 的实践经验。
推荐理由:文章拆解了 Manifest V3 约束下使用 Transformers.js 的架构细节,读者可复用其后台推理与消息通信设计。
QIMMA 整合 14 个基准的 52,000 多个样本,成为首个包含代码评估的阿拉伯语 LLM 排行榜。该开源平台通过自动化与人工双重验证流程剔除低质数据,确保 99% 内容本土化。其评估体系覆盖文化、科学、法律及编程等领域,公开样本输出以提升评测可复现性。
Hugging Face 讨论前沿模型 Mythos 及其嵌入系统在发现、修复软件漏洞中的表现,指出网络安全是涉及漏洞检测、验证、协调和补丁传播的速度竞赛。作者认为开放代码和工具能为防御方提供结构化优势,并建议采用基于开放组件的半自主 AI Agent,在组织自己的控制范围内运行以辅助安全防御。
Hugging Face 提供了 Skill 和测试框架,用于协助将 transformers 中的语言模型移植到 mlx-lm,实现模型几乎即时可用。该 Skill 作为辅助工具而非自动化流程,支持贡献者处理脚手架搭建及架构校验,同时为审查者生成符合代码规范的高质量 PR 及可复现测试证据。
Mistral 发布 Mistral Small 4,将 Magistral、Pixtral、Devstral 与 Mistral Small 的指令、推理与多模态能力合并为单一模型,并以 Apache 2.0 开源。
推荐理由:原文明确给出架构、吞吐延迟优化和许可细节,读者可据此判断统一模型如何降低多模型切换成本。
Mistral AI 基于开源助手 Vibe 构建自主 Agent,在 CI/CD 中并行生成 RSpec 测试。通过配置 AGENTS.md 和分类 Skills,该 Agent 结合 RuboCop 与 SimpleCov 验证代码,质量分数从 0.68 提升至 0.74。
Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。
推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。
Public AI Inference Utility 正式成为 Hugging Face Hub 支持的 Inference Provider。该开源项目通过 vLLM 后端和全球负载均衡层,为 Swiss AI Initiative 等机构提供基于捐赠 GPU 时间的免费推理服务。
Hugging Face 宣布在 Gradio 中支持通过单一参数实现生成内容的可视化水印。开发者可为图像和视频添加水印,或直接嵌入包含元数据的 QR 码。文本生成界面也支持自定义水印,确保用户复制 AI 回复时自动附带来源归属信息。
Sentence Transformers 提供了一套用于微调稀疏嵌入模型的完整流程,涵盖模型、数据集、损失函数及评估器等组件。该库生成的 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 模型成本低,特别适合混合搜索或检索重排场景。
Hugging Face 团队在其 nanoVLM 仓库中从零实现了 KV Cache,使文本生成速度提升 38%。该优化通过缓存 Key 和 Value 矩阵,避免了自回归生成中的重复计算。
H Company 在 Hugging Face 上发布开源行动视觉语言模型 Holo1 家族和 WebClick 多模态定位基准。
推荐理由:开源Holo1行动VLM家族与Surfer-H代理给出可对比的成本和精度基准,读者可评估网页自动化的落地门槛。
Mistral AI 宣布在 La Plateforme 上开放旗下旗舰及专用模型的定制能力,支持通过 base prompt、few-shot prompting 或 fine-tuning 微调,并可接入自带数据集。
推荐理由:Mistral 在自家平台同时开放模型定制、智能体与稳定版 SDK,为开发者把前沿模型接入应用提供更完整的路径。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。
推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。
Mistral AI 在 Project Numina 项目中发布数学推理模型 Mathstral,基于 Mistral 7B 构建。该模型在 MATH 基准测试中得分为 56.6%,MMLU 得分为 63.47%。Mathstral 已在 HuggingFace 开放权重,支持通过 mistral-inference 使用。
GaLore 利用梯度低秩结构实现显存高效的大语言模型全参数训练,将优化器状态显存降低 82.5% 以上。该方法支持结合 8-bit 优化器,使 7B 参数模型能在 NVIDIA RTX 4090 等消费级 GPU 上完成训练。
Hugging Face 与 NVIDIA 联合推出 Train on DGX Cloud 服务,允许 Enterprise Hub 用户通过无代码界面在 Hugging Face Hub 上微调 Llama、Mistral 等模型。该服务提供 NVIDIA H100 GPU 算力,按小时计费为 $8.25,支持 1 至 8 块实例配置,训练后的模型将自动上传至私有仓库。
Hugging Face 推出 PyTorch 量化后端 Quanto,作为 Optimum 的组件支持 int8、int4、int2 及 float8 权重与激活量化。
Argilla 与 Hugging Face 启动“Data is Better Together”实验,通过社区协作构建偏好数据集。该实验在数天内吸引 350 名贡献者完成超过 11,000 条提示词评级,并发布包含 10,000 条提示词的 10k_prompts_ranked 数据集。双方正招募首批社区 cohort,提供 Argilla Space 支持及免费持久化存储资源。