Google Gemini Live 推出 Guided Vision 功能
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
AI 音乐生成器 Suno 新增 Speech 功能,用户输入文本并描述风格后,模型将生成带匹配背景音乐的单轨语音音频。Suno 产品负责人 Jack Brody 表示该功能经过小范围测试,适用于诗歌、冥想等场景,但目前仍存在口音不准确等 Bug。Suno 未披露模型训练细节,而该平台正因版权侵权指控被主要唱片公司起诉,且慕尼黑法院近期驳回了其对使用受版权保护数据的合理使用抗辩。
Suno 推出 AI 语音生成功能,支持生成带背景音乐的旁白和有声内容。该功能目前已在网页和移动端平台公测,包含简易和高级模式,可自定义性别、语音风格,最长支持 8 分钟时长。
Microsoft AI 发布实时转录模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型 MAI-Voice-2.1,其中转录模型在 100 毫秒内返回初步结果并支持 60 种语言。MAI-Voice-2.1-Flash 版本延迟 150 毫秒,每百万字符费用降至 15 美元,且两款语音模型仅需数秒音频即可克隆声音。
Jev 作为 System One 模型发布,提供比 LLM 快两个数量级的结构化输出,且无模型幻觉,现提供早期访问。Periodic Neon 在低成本下超越 GPT-6 Astra 和 Claude Fable 5.1,用于科学分析。Google 推出 Gemini 3.8 Live 和 3.5 Transcribe,用于实时语音应用。