Google Gemini Live 推出 Guided Vision 功能
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
Shopify 推出新网站构建工具 Canvas,允许商家通过与 AI 智能体 Sidekick 对话来设置商店。Canvas 在实时渲染真实代码的同时,支持查看整站效果、测试交互动画及多屏显示。目前产品仅限桌面端使用,且不包含第三方主题支持和应用扩展等高级功能。
华为官网显示,因业务调整,小艺帮帮忙智能体将不再支持 HarmonyOS 7.0 后续新增设备。原 HarmonyOS 6.0 支持设备上的智能体及个人技能、定时计划任务在升级后仍可继续使用,但不支持该功能的设备无法通过数据克隆迁移相关功能。
Anthropic 为 Claude Code 发布 Mods 系统,这是直接运行在工具内部的中间件,允许开发者通过 JavaScript 或 TypeScript 钩子改变其外观和工作流。
AI 音乐生成器 Suno 新增 Speech 功能,用户输入文本并描述风格后,模型将生成带匹配背景音乐的单轨语音音频。Suno 产品负责人 Jack Brody 表示该功能经过小范围测试,适用于诗歌、冥想等场景,但目前仍存在口音不准确等 Bug。Suno 未披露模型训练细节,而该平台正因版权侵权指控被主要唱片公司起诉,且慕尼黑法院近期驳回了其对使用受版权保护数据的合理使用抗辩。
ds4 是由 antirez 发布的本地推理引擎,支持在 M5 Max 和 DGX Spark 等高显存设备上运行 DeepSeek V4、GLM 5.x 及 Qwen3.8 等模型。该引擎采用 2-bit 非对称量化压缩路由专家,并提供 CLI、本地 API 及原生 Agent 接口,支持将 KV 缓存持久化至 SSD 以加速恢复会话。
推荐理由:提供了非通用引擎的窄化路径,展示了在特定高配硬件上运行前沿开源模型的量化细节与接口规范。
OpenAI 新发布的智能体平台 Dots 以拟人化角色提供云端虚拟环境操作能力,作者基于不同任务实测了该平台。虽然 Dots 在处理日常个人事务时常遇到网站安全验证拦截或执行偏差,但在连接本地电脑后能高效完成网站更新和视频剪辑等任务。作者认为 Dots 更像是面向企业或专业工作流的智能体工具,其定位与更侧重个人消费的同类竞品有明显差异。
NVIDIA DGX Spark 64GB 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发布,起价 4,999 美元,支持 DGX OS、CUDA-X AI 和 Ollama、vLLM、PyTorch 等本地 AI 软件栈。
Suno 推出 AI 语音生成功能,支持生成带背景音乐的旁白和有声内容。该功能目前已在网页和移动端平台公测,包含简易和高级模式,可自定义性别、语音风格,最长支持 8 分钟时长。
Pi 1.0和Pi Durable登上HN首页。Pi 1.0更新包括Codemode(原生支持MCP、Jev及图像模型)、虚拟模型扩展支持、延迟工具加载、Anthropic模型缓存预热、会话中系统消息支持、新TUI主题及默认全屏模式。
OpenAI 发布 GPT-6 Astra 驱动的自主智能体 Dots,以及性价比接近 Astra 智能的 GPT-6.1 Sol。Dots 可独立运行并集成 4000+ 应用,GPT-6.1 Sol 通过 API 提供更具成本效益的专业任务解决方案。
腾讯将应用宝团队开发的个人 Agent Marvis 升级为AI管家,日活跃用户较5月上线时增长近四倍。新版功能聚焦电脑系统管理,可检查电池健康、调整开机启动项,并将本地知识库算力门槛降至4核8GB。Marvis采用端侧模型建立授权资料索引,按需调用云端模型,计划10月推出支持NAS存储的定制版本。
Anthropic 将 Claude Cowork 和聊天合并为单一产品,并支持直接编辑和下载 PPT。OpenAI 在 ChatGPT 中推出由广告主赞助的智能体对话入口。Meta 发布 FLAT 多模态生成方法,Google 在 GKE 上线高并发 Agent Substrate 执行运行时。
Baseten 正式成为 Hugging Face Hub 支持的推理提供商,首批支持 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等开源 LLM 的对话与文本生成任务。PRO 用户每月可获得价值 $2 的推理积分,通过 HF 路由的请求按提供商标准 API 费率计费且无额外加价。
Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。
推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。
Public AI Inference Utility 正式成为 Hugging Face Hub 支持的 Inference Provider。该开源项目通过 vLLM 后端和全球负载均衡层,为 Swiss AI Initiative 等机构提供基于捐赠 GPU 时间的免费推理服务。
Hugging Face 宣布在 Gradio 中支持通过单一参数实现生成内容的可视化水印。开发者可为图像和视频添加水印,或直接嵌入包含元数据的 QR 码。文本生成界面也支持自定义水印,确保用户复制 AI 回复时自动附带来源归属信息。
Mistral AI 宣布在 La Plateforme 上开放旗下旗舰及专用模型的定制能力,支持通过 base prompt、few-shot prompting 或 fine-tuning 微调,并可接入自带数据集。
推荐理由:Mistral 在自家平台同时开放模型定制、智能体与稳定版 SDK,为开发者把前沿模型接入应用提供更完整的路径。
Hugging Face 与 NVIDIA 联合推出 Train on DGX Cloud 服务,允许 Enterprise Hub 用户通过无代码界面在 Hugging Face Hub 上微调 Llama、Mistral 等模型。该服务提供 NVIDIA H100 GPU 算力,按小时计费为 $8.25,支持 1 至 8 块实例配置,训练后的模型将自动上传至私有仓库。
Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。
推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。
TRL 库新集成了 DDPOTrainer 类,用于将 Denoising Diffusion Policy Optimization (DDPO) 应用于 Stable Diffusion 模型,使其输出更符合人类审美等偏好。
推荐理由:通过 TRL 新集成的 DDPOTrainer,读者可以直接在本地用 RL 微调 Stable Diffusion,降低扩散模型对齐人类偏好的门槛。
Hugging Face 在 huggingface_hub 中推出了增强搜索功能,新增 ModelSearchArguments 和 ModelFilter 类,支持在 Python 环境中通过程序化接口按任务、数据集、框架等条件检索模型与数据集。