Google 的音频模型进展:从 TTS、Live 到 Lyria、Translate、Transcribe
Google 的音频模型套件在 TTS、Live、Lyria、Translate 和 Transcribe 等方向持续改进。如果身处旧金山,可报名参加明天举办的一场音频体验活动,报名链接为 rsvp.withgoogle.com/events/gemini-。
Google 的音频模型套件在 TTS、Live、Lyria、Translate 和 Transcribe 等方向持续改进。如果身处旧金山,可报名参加明天举办的一场音频体验活动,报名链接为 rsvp.withgoogle.com/events/gemini-。
Google AI Studio 推出新的 TTS 使用体验,成本低于此前的 3.1 Flash TTS 模型,更多细节见官方博客。原文未披露具体模型版本与定价数字。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS 语音模型,官方称其为新的 SOTA 文本转语音模型。该模型提供新的音色设计体验、2000+ 生产可用音色、声音复刻与 100 种语言支持,声音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 上线,支持用 30 秒音频复刻音色、用一句话从提示词设计新音色,并可逐句指定风格、<laugh>、<sigh>、|backchannels| 和双人场景。
Google AI 宣布即日起推送两款 TTS 模型,开发者可在 Google AI Studio 和 Gemini API 中使用,消费者端 Gemini 3.8 Flash TTS 进入 Gemini Notebook、Gemini 3.8 Flash-Lite TTS 进入 Google Vids。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音模型,支持 100+ 种语言的自定义语音,另有 2,000+ 个现成音色可选。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 用于设计带不同口音和特征的独特音色,Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可选用用户创建的风格或官方生产级音色库。
Google DeepMind 宣布 Gemini 语音生成可逐句微调,控制节奏、情绪以及笑声、停顿等提示。所有生成音频均嵌入 SynthID 水印,可被可靠识别为 AI 生成。开发者可通过 Google AI Studio 使用 Gemini API 开始构建。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。
NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。
NVIDIA 发布 Nemotron 3 Diarization 模型,可在多人同时说话、声音重叠时追踪谁在何时发言,最多支持 8 位说话人,参数量为 100M。该模型已在 Hugging Face 上线。
Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 结果中位列 12 个系统之首,错误率 14.72%,比第二名低约 24%。榜单同时给出了一段四人对话的对比示例。
ElevenLabs 的 Scribe v2 Medical 已通过 ElevenAPI 开放使用,价格为每小时 0.22 美元起,并随用量规模增加而降低。该模型定位医疗场景的语音转写。
ElevenLabs 的 Scribe v2 Medical 现已面向签署 BAA 并启用 Zero Retention Mode 的企业客户满足 HIPAA 合规要求。该模式确保音频与转写文本在每次请求完成的瞬间即被删除。
ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。
千问办公发布Agent硬件品牌QwenNote,首款产品QwenNote A2售价1199元,自带4G网卡和GPS,无需连手机即可使用。作者实测长按AI键发语音即可调用Agent做总结、写PPT和网页,背后接入云栖大会发布的Qwen-Audio-3.1-Realtime,并已与钉钉打通。
阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款覆盖理解、生成、交互与创作。
2026云栖大会首日,阿里公布大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数;Qwen3.8-Max在人类零参与下自主迭代超1个月、完成33轮有效迭代,并在平头哥新款GPU上自主优化Qwen3.8-Flash推理框架,单实例推理吞吐量提升96%。
Google 的 Gemini 3.8 Flash-Lite TTS 与 Gemini 3.8 Flash TTS 已在 AI Gateway 上线,均支持 100 多种语言的语音生成、长篇旁白、语调控制和双人对话。
Sam Altman 发帖澄清自己此前说的是 VOICE 而非 video,并为造成的误解致歉。该帖获得 1352 次点赞和 239342 次浏览。
ElevenLabs 的 Scribe v2 Medical 现已通过 ElevenAPI 开放使用,定价从每小时 $0.22 起,并随用量规模增加而降低。
ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。
阿里千问办公发布 QwenNote 硬件产品线,包含带三轴云台、以手机为头的桌面机器人 Eva 和随身助理 A2,前者靠人脸与声纹识别用户,无需唤醒词即可直接对话并打断。
网易有道推出语音产品"叭哥说",把语音从"转文字"推进到"转意图",用户先说完整段内容再由系统整理成可用文本,PC 端已上线并承诺语音输入场景终身免费。同期升级的 Hi Echo 转向个性化口语学习系统,并已与启元机器人合作进入机器人场景。
a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。
ElevenLabs 在 ElevenCreative 中上线 Studio 4.0,用户可通过 elevenlabs.io/studio 试用。该消息由 ElevenLabs 官方账号发布,未披露模型参数、价格或可用性等更多细节。
ElevenLabs 发布 Studio 4.0,支持团队协作编辑:用户可对单个片段或素材直接发表评论,反馈集中留存而不再散落在多个独立讨论线程中。
ElevenLabs 在 ElevenCreative 中推出 Studio 4.0,其 AI 原生视频编辑器迎来一次重要升级。用户可以在项目内生成视频、图像、语音、音乐和音效,并在同一处完成剪辑、加字幕和导出。
NotebookLM 的 Live Chat 已在移动端向全部 Ultra 用户 100% 开放,可与笔记本进行实时语音对话,覆盖约 100 种语言。该功能由最新音频模型驱动,用户可就自己的资料提问并获取分步指导,几乎全程无需动手。
Fish Audio S2.1 Pro 现已上线 Runway。Runway 称这是其迄今最大规模的一次模型更新,同期引入的还有 MiniMax H3 Max、Cartesia Sonic 3.6 以及 Flux Video upscaler 和 edit,与 Runway 自有及其他前沿实验室的模型一同提供。
小米 AI 硬创团队开源了四件 AI 硬件探索作品:AI 记忆配饰 DayoTag 采用无服务端本地记录并支持扩展 Skill;哈基米 PetAgent 把 Agent 运行状态同步到桌面摆件。
iRTE2026 实时智能大会将于 10 月 23 日至 24 日在北京悠唐皇冠假日酒店举行,并设置“企业级客服智能体专场”,邀请声网、冠客科技、美团、阿里、MiniMax 等企业探讨客服智能体从“能对话”迈向“能办事、能转化、能增长”。
在心情愉悦、环境舒适时打开 GPT live 讨论,模糊的想法能更快收敛成型。这条来自 AI 产品黄叔的个人技巧帖认为,好的外部环境配合 GPT 的实时语音对话,有助于把还没想清楚的点子快速聚焦。帖文未披露所用模型版本或具体产品形态。
快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。
阿里 Qwen 发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在忠实度、流畅度和简洁度上有所提升,并将 60 种语言的平均延迟(LAAL)从 2.8s 降至 2.3s。
夸克网盘 Skill 可在线提取视频逐字稿,88VIP 用户可无限使用,支持多路同时转写,平均不到 1 分钟完成 30 分钟音视频转写,后续可用 DeepSeek API 润色。此前作者用本地 FunASR 转写太吃电脑资源,也曾改用 GrokBot 云端处理。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称这是其目前最先进的实时对话音频模型。Google Labs 的实验项目 Dreambeans 转为正式可用,可为用户每日精选个性化故事集;同属 Labs 的 CC 从个人生产力工具扩展为共享智能体,用于帮助家庭协调事务、日程和日常任务。
Grok Voice API 现已上线 Transcribe 2.0,批处理定价 $0.10/小时,流式定价 $0.20/小时。详细内容见 xAI 官方博客。
Atlassian 在 Loom 中使用 Transcribe 2.0,发现它捕捉用户指令时更准确。用户可以用 Loom 口述变更需求,再直接导出到 Cursor 编写代码。