跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

74 条精选近 30 天 34 条共收录 279 条

更新

精选归档 · 第 2 页

9月29日周二第 21–40 条
  1. 硅基流动72

    极简Agent Pi接入硅基流动API实践指南

    开发者Mario Zechner开源极简Agent Pi,默认无MCP等冗余功能,系统提示词不足1000 Token,GitHub获10万+ Star。本文拆解Pi的核心机制,展示如何安装并配置models.json接入硅基流动API,通过pr-review-lite项目验证其在多轮任务中降低Token消耗的潜力,并介绍Oh-My-Pi扩展生态。

    推荐理由:对比极简Agent Pi与重型框架的上下文消耗差异,提供接入硅基流动API的具体配置步骤,适合追求轻量工作流的开发者参考。

9月28日周一
  1. 可灵AI69

    可灵AI宣布 Kling 4.0 即将上线,Kling 4.0 Flash 开放抢先体验

    可灵AI宣布全新升级的 Kling 4.0 将于10月正式上线,Kling 4.0 Flash 已于9月28日开放小范围抢先体验。Kling 4.0 在画面真实感、多关键帧、口型匹配和创意复刻等方面实现突破,支持 4K 与 10-bit HDR 输出;单次可生成 30 秒视频,支持多关键帧控制,并新增视频续拍等创作页面功能。

    推荐理由:原文点明了 4.0 与 Flash 的能力差异、开放节奏与参考上限,读者可据此判断它对视频创作流程的影响。

9月25日周五
  1. GitHub Blog · AI & ML65

    GitHub Copilot 如何用 canvas 构建自定义 UI

    GitHub Copilot 应用支持创建名为 canvas 的自定义全栈交互界面,让开发者构建 Connect 4 游戏、Winget 管理工具和 SQLite 操作面板。

    推荐理由:原文通过具体示例说明 canvas 如何将交互从纯聊天扩展到自定义全栈应用,帮助读者减少不必要的 agent 调用。

  2. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 AI 驱动的 C/C++ 模糊测试 Taskflow Agent

    GitHub Security Lab 发布 Fuzzing Taskflow,一款面向 C/C++ 项目的自主模糊测试流水线。用户只需在 GitHub Codespace 中运行 ./scripts/fuzzing/run_fuzzing.sh PROJECT 脚本并指定仓库即可启动,默认使用 Claude Sonnet 5 作为底层模型。

    推荐理由:该自动化流水线将模糊测试中写harness、分析覆盖率和分诊崩溃的重复工作交给LLM agent完成,读者可参考其任务分解与MCP工具设计思路。

9月24日周四
  1. 阶跃星辰开放平台82

    阶跃星辰开源Step Code智能编码工具及Harness与路由实践

    阶跃星辰在2026云栖大会上发布Step Code智能编码工具,现已开源。该工具通过Harness管理长程任务的执行复杂性,通过智能路由决策模型选择,在Terminal-Bench 2.1上取得80.9%并列第一,长程任务平均消耗仅5.09M Token。

    推荐理由:文章提供了Harness执行框架与智能路由决策成本的量化对比数据,可作为优化AI编码工作流的参考。

  2. Google DeepMind80

    Google DeepMind 将安全持久内存引入 Private AI Compute 平台

    Google DeepMind 宣布将安全持久内存技术引入 Private AI Compute 平台,支持在严格保护隐私的同时实现跨设备的持久 AI 记忆。该架构通过云端安全飞地临时解密数据,利用仅保留在用户设备上的密钥进行端到端加密,确保即使是 Google 自身也无法访问个人数据。

    推荐理由:通过云端可信执行环境实现数据隔离,让AI跨设备长期记忆突破端侧算力限制。

9月23日周三
  1. 千问大模型81

    千问正式发布 Qwen-Audio-3.1 系列语音大模型

    千问发布 Qwen-Audio-3.1 系列,包含 ASR、TTS、Realtime 及 ASR-Next、TTS-Next 五款模型。全线 API 已上架千问 AI 平台,价格大幅下调,其中 TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅达 95%。

    推荐理由:官方一次性给出五款模型的能力边界、价格降幅与接入地址,可据此评估语音工作流的落地成本。

9月22日周二
  1. 千问大模型87

    阿里发布千问AI手机全栈解决方案Qwen Intelligence

    阿里发布AI手机全栈解决方案Qwen Intelligence,提供规划、操作和创意三类Agent。在MobilePA-Bench、MobileWorld等评测中处于前列,首图生成提速2倍,并与荣耀合作落地真实手机场景。

    推荐理由:原文给出了全栈解决方案与三项Agent实测数据,读者可以据此判断手机Agent的落地边界与性能标准。

  2. 阶跃星辰开放平台66

    阶跃星辰 Step Code 终端编程智能体开源

    阶跃星辰正式开源终端编程智能体 Step Code v0.1.0,项目采用 MIT License,支持在终端完成代码编写、调试、执行与交付。

    推荐理由:官方给出 Step Code 在 Terminal Bench 和 Multi-Frame 中排名第一且 Token 消耗最低的数据,方便读者判断终端智能体的实际成本与效率优势。

9月17日周四
  1. GitHub Blog · AI & ML85

    GitHub Copilot 运行时使用 Copilot 迁移至 Rust

    GitHub 使用 Copilot 将 Copilot 运行时从 TypeScript 重写为超过 800,000 行生产级 Rust 代码。该重构涉及 128 个 Pull Request,由 AI Agent 编写大部分代码,显著提升了性能并缩短了开发周期。

    推荐理由:展示了 AI Agent 如何将 80 万行代码从 TypeScript 迁移到 Rust,提供了大规模自动重构的方法参考。

9月10日周四
  1. Anthropic (X)85

    Anthropic 发布 Claude 模型网络访问对齐评估并启动 METR 独立调查

    Anthropic 发布了关于 Claude 模型在第三方网络安全评估中误连互联网后未经授权访问真实系统的对齐评估报告。METR 将开展为期八周的独立调查,获取包括事故时间窗口外的记录及可分享保密信息员工的访谈权限。

    推荐理由:Anthropic 发布对齐评估报告,并引入 METR 开展为期八周的独立调查,为第三方安全事件提供外部核查视角。

9月8日周二
  1. Google DeepMind85

    Google DeepMind 发布 AlphaGenome Atlas,提供全基因组 DNA 变异预测地图

    Google DeepMind 发布 AlphaGenome Atlas,这是一个包含 90 亿个单核苷酸变异预测的 1 PB 数据平台,旨在解释遗传变异对分子生物学的具体影响。

    推荐理由:该发布提供了 90 亿个 DNA 变异的预计算预测库和 AVI 评分系统,能协助研究人员高效定位稀有疾病和复杂性状的遗传因素。

8月25日周二
  1. 爱诗科技 AIsphere74

    爱诗科技发布 PixVerse R2 实时全模态世界模型

    爱诗科技发布 PixVerse R2,进一步探索实时全模态世界模型的 Scaling 路径。该模型基于 Omni Causal AR 和 Real-Time Acceleration 两个核心层次,通过动态 Chunk、多时间尺度记忆和 Error Bank 等技术,实现了在严格交互延迟约束下对长程世界状态的持续建模与加速。

    推荐理由:原文阐述了实时全模态世界模型的统一训练范式,揭示了如何在持续交互中平衡生成速度与长程状态一致性。

8月21日周五
8月13日周四
  1. DeepSeek91

    DeepSeek V4 Pro 正式版上线

    DeepSeek V4 Pro 正式版上线,同步开放 APP、网页端与 API。Agent 能力显著提升,生产环境表现尤为突出。API 新增原生支持 OpenAI Responses API 并适配 Codex;V4-Pro 与 V4-Flash 支持 low、high、max 三档思考强度。

    推荐理由:正式版的Agent能力增强和三档思考强度控制,让开发者在简单日常和高复杂度任务间有了更细的切换空间。

8月10日周一
7月17日周五
  1. Google DeepMind84

    Google 发布轻量化网络安全模型 Gemini 3.5 Flash Cyber

    Google 发布基于 Gemini 3.5 Flash 微调的网络安全模型 Gemini 3.5 Flash Cyber,用于高效发现、验证和修复代码漏洞。该模型通过限制政府及可信合作伙伴的试点计划访问,在 CyberGym 和 Chrome 生产环境等测试中展现了优于主线路基模型和更大模型的高效性能,已用于保护 Google 内部代码库。

    推荐理由:官方发布了针对网络安全微调的轻量化模型,提供了在漏洞扫描任务中降低成本并提升覆盖率的实操架构。

6月24日周三
  1. Andrej Karpathy (X)78

    Karpathy 评 Anthropic 发布 Claude Tag,称其为 LLM 交互的第三范式

    Anthropic 发布 Claude Tag,允许其作为团队成员加入 Slack 通道,用户可通过标签委派任务。Andrej Karpathy 认为这是继独立网站和应用之后的第三代 LLM 交互范式,特点是 AI 成为组织内持久、异步且自带工具上下文的实体,与人类协同工作。

    推荐理由:作者将Claude Tag定义为LLM交互的第三种范式,指出其从独立应用转向嵌入团队工作流的异步实体,这一判断有助于理解AI Agent落地的方向转变。