Google Gemini Live 推出 Guided Vision 功能
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
Shopify 推出新网站构建工具 Canvas,允许商家通过与 AI 智能体 Sidekick 对话来设置商店。Canvas 在实时渲染真实代码的同时,支持查看整站效果、测试交互动画及多屏显示。目前产品仅限桌面端使用,且不包含第三方主题支持和应用扩展等高级功能。
华为官网显示,因业务调整,小艺帮帮忙智能体将不再支持 HarmonyOS 7.0 后续新增设备。原 HarmonyOS 6.0 支持设备上的智能体及个人技能、定时计划任务在升级后仍可继续使用,但不支持该功能的设备无法通过数据克隆迁移相关功能。
明基(BenQ)宣布推出两款面向室内高尔夫运动的投影仪设备 AK900ST 和 AK800ST。这两款产品支持 4K UHD 分辨率、亮度可达 6000 ANSI 流明,并支持高尔夫模式 2.0。
Anthropic 为 Claude Code 发布 Mods 系统,这是直接运行在工具内部的中间件,允许开发者通过 JavaScript 或 TypeScript 钩子改变其外观和工作流。
AI 音乐生成器 Suno 新增 Speech 功能,用户输入文本并描述风格后,模型将生成带匹配背景音乐的单轨语音音频。Suno 产品负责人 Jack Brody 表示该功能经过小范围测试,适用于诗歌、冥想等场景,但目前仍存在口音不准确等 Bug。Suno 未披露模型训练细节,而该平台正因版权侵权指控被主要唱片公司起诉,且慕尼黑法院近期驳回了其对使用受版权保护数据的合理使用抗辩。
ds4 是由 antirez 发布的本地推理引擎,支持在 M5 Max 和 DGX Spark 等高显存设备上运行 DeepSeek V4、GLM 5.x 及 Qwen3.8 等模型。该引擎采用 2-bit 非对称量化压缩路由专家,并提供 CLI、本地 API 及原生 Agent 接口,支持将 KV 缓存持久化至 SSD 以加速恢复会话。
推荐理由:提供了非通用引擎的窄化路径,展示了在特定高配硬件上运行前沿开源模型的量化细节与接口规范。
OpenAI 新发布的智能体平台 Dots 以拟人化角色提供云端虚拟环境操作能力,作者基于不同任务实测了该平台。虽然 Dots 在处理日常个人事务时常遇到网站安全验证拦截或执行偏差,但在连接本地电脑后能高效完成网站更新和视频剪辑等任务。作者认为 Dots 更像是面向企业或专业工作流的智能体工具,其定位与更侧重个人消费的同类竞品有明显差异。
NVIDIA DGX Spark 64GB 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发布,起价 4,999 美元,支持 DGX OS、CUDA-X AI 和 Ollama、vLLM、PyTorch 等本地 AI 软件栈。
Suno 推出 AI 语音生成功能,支持生成带背景音乐的旁白和有声内容。该功能目前已在网页和移动端平台公测,包含简易和高级模式,可自定义性别、语音风格,最长支持 8 分钟时长。
Microsoft AI 发布实时转录模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型 MAI-Voice-2.1,其中转录模型在 100 毫秒内返回初步结果并支持 60 种语言。MAI-Voice-2.1-Flash 版本延迟 150 毫秒,每百万字符费用降至 15 美元,且两款语音模型仅需数秒音频即可克隆声音。
OpenAI 发布 GPT-6 Astra 驱动的自主智能体 Dots,以及性价比接近 Astra 智能的 GPT-6.1 Sol。Dots 可独立运行并集成 4000+ 应用,GPT-6.1 Sol 通过 API 提供更具成本效益的专业任务解决方案。
腾讯将应用宝团队开发的个人 Agent Marvis 升级为AI管家,日活跃用户较5月上线时增长近四倍。新版功能聚焦电脑系统管理,可检查电池健康、调整开机启动项,并将本地知识库算力门槛降至4核8GB。Marvis采用端侧模型建立授权资料索引,按需调用云端模型,计划10月推出支持NAS存储的定制版本。
Anthropic 发布 Claude Sonnet 5.5,显著增强编码、长程任务及图像理解性能。新模型输出速度比 Sonnet 5 快 30% 以上,且在 token 定价相同的情况下通过减少 token 使用量使单任务成本最高降低 30%。
Baseten 正式成为 Hugging Face Hub 支持的推理提供商,首批支持 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等开源 LLM 的对话与文本生成任务。PRO 用户每月可获得价值 $2 的推理积分,通过 HF 路由的请求按提供商标准 API 费率计费且无额外加价。
Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。
推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。
Public AI Inference Utility 正式成为 Hugging Face Hub 支持的 Inference Provider。该开源项目通过 vLLM 后端和全球负载均衡层,为 Swiss AI Initiative 等机构提供基于捐赠 GPU 时间的免费推理服务。
Hugging Face 宣布在 Gradio 中支持通过单一参数实现生成内容的可视化水印。开发者可为图像和视频添加水印,或直接嵌入包含元数据的 QR 码。文本生成界面也支持自定义水印,确保用户复制 AI 回复时自动附带来源归属信息。
Mistral AI 宣布在 La Plateforme 上开放旗下旗舰及专用模型的定制能力,支持通过 base prompt、few-shot prompting 或 fine-tuning 微调,并可接入自带数据集。
推荐理由:Mistral 在自家平台同时开放模型定制、智能体与稳定版 SDK,为开发者把前沿模型接入应用提供更完整的路径。
GaLore 利用梯度低秩结构实现显存高效的大语言模型全参数训练,将优化器状态显存降低 82.5% 以上。该方法支持结合 8-bit 优化器,使 7B 参数模型能在 NVIDIA RTX 4090 等消费级 GPU 上完成训练。
Hugging Face 与 NVIDIA 联合推出 Train on DGX Cloud 服务,允许 Enterprise Hub 用户通过无代码界面在 Hugging Face Hub 上微调 Llama、Mistral 等模型。该服务提供 NVIDIA H100 GPU 算力,按小时计费为 $8.25,支持 1 至 8 块实例配置,训练后的模型将自动上传至私有仓库。
Hugging Face 推出 PyTorch 量化后端 Quanto,作为 Optimum 的组件支持 int8、int4、int2 及 float8 权重与激活量化。