Gemini 3.5 Transcribe 发布:面向精准实时转写的语音转文本模型
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,主打精准、智能的实时转写。官方同时放出了详细介绍链接,未披露参数量、benchmark 分数或开放方式等细节。
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,主打精准、智能的实时转写。官方同时放出了详细介绍链接,未披露参数量、benchmark 分数或开放方式等细节。
Gemini App for macOS 新增 Gemini 3.5 Transcribe,可用语音和屏幕上下文完成更多任务。该功能支持总结本地文件、规划与研究,并用自然语言创建图像。
Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。
一段新生成的 AI 音乐曲目演示展示了明显的人声清晰度提升,作者称虽不完美,但已远好于前几代模型。该曲目发布于 Twitter,附带视频演示,用于展示人声表现。
Google 发布 Lyria 3.5,并集成进 Gemini。作者在预览阶段试用后表示其生成音乐的方式相当易用,提供 24 个可直接使用的模板、对歌词的完整控制以及 17 种风格。
Sundar Pichai 宣布新的 Gemini 语音能力正在推送,用户可以通过对话搜索 Gmail 收件箱、在 Keep 中整理想法与任务,并创建新的 Docs。该功能面向 Google AI 订阅用户开放,他特别提到 Docs Live 会很有帮助,并附上演示视频与博客链接。
Fish Audio 在 X 上发布了一条完整对话链接,指向一段 YouTube 视频(youtube.com/watch?v=82l4A-…)。该帖互动量为 0 条回复、0 次转发、3 个点赞、610 次浏览,由 xgo.ing 提供支持。
MAI-Transcribe-2 语音转录模型发布,速度比 GPT-Transcribe 快 10 倍、比 Gemini 3.5 快 5 倍。该模型在 Artificial Analysis 准确率-延迟帕累托前沿排名第一,定价为市场最低。
ChatGPT 正在提升措辞表达能力,官方账号以"Words are hard ok 😭 ChatGPT is getting better at saying them"宣布这一改进。该帖附带一段视频演示,获 5375 点赞、152 次转发,浏览量约 68.6 万。
Fish Audio S2.1 Pro 通过 @slng_ai 在欧洲和澳大利亚上线,支持 83 种语言并部署区域内 GPU 基础设施。该服务主打更贴近用户的低延迟与企业级管控,官方称其为生产级语音 AI 所需的能力。
Fish Audio 宣布 Android 版本上线,回应此前用户对 Android 端的询问。该产品支持 200 万+ 音色、80+ 语言,可用开放式标签控制情感,并支持用 5 秒音频完成声音克隆。
有人询问是否有人将蓝牙戒指配置为触发 @WisprFlow 语音转写。该帖获 38 条回复、25325 次浏览。
Gemini 现已集成到 Waymo 车内,坐在座位上按下屏幕上的 Gemini 图标即可用语音免手控调节座舱,或了解周边环境信息。Gemini 完全独立于 Waymo Driver 运行,在你主动使用前始终保持不活跃状态。
Fish Audio 在 iOS 版之后上线 Android 版语音工作室,把桌面端完整功能搬到手机。该应用提供 200 万以上声音、80 多种语言的多说话人对话,支持用开放式标签直接控制情绪,以及克隆自己的声音或凭一句提示词设计声音。
Google 发布两款面向转写和语音识别的新模型 Gemini 3.5 Transcribe 与 Gemini 3.5 Transcribe Live。前者用于转写已录制音频,支持说话人归属和词级时间戳;后者用于构建实时语音应用。
Google 本周发布 Gemini 3.5 Transcribe,官方称其为目前最精准的语音转文字模型,主打智能转录。同时发布 Gemini Omni 1.1 Flash,为视频生成与编辑带来更多创作能力和控制选项。
Google Gemini 宣布 Gemini Live 已在全球范围内免费提供。官方说明指出,各项集成功能的可用性、兼容性和年龄限制因地区而异,部分场景可能需要完成设置或订阅;具体使用方式可在其博客中查看。
Google Gemini App 宣布 Gemini Live 推出生产力升级,引入智能体能力,用户可以通过语音完成更多操作。现在用户可以与 Gemini 对话,收听 Daily Brief、处理收件箱邮件,或从 Spark 获取帮助。
Antigravity CLI 新增语音模式,运行 /voice 或按 F5 即可直接与智能体对话。该功能已在最新版本 Antigravity CLI 中发布,团队表示仍在快速迭代。
Google 发布 Gemini 3.5 Transcribe,官方称这是其最精准的语音转文字模型,支持 85 种以上语言,具备智能纠错和自定义词表功能。Ammaar Reshi 用该模型开发了一个类似 Wispr Flow 的应用,演示与开源代码已公布。Patrick Loeber 转发了这一消息并强调该项目已开源。
Google Gemini 官方宣布 Gemini Live 已在全球范围内免费开放。各集成的可用性、兼容性和年龄限制存在差异,部分功能可能需要设置或订阅,官方同时介绍了 Gemini Live 中将语音转为操作的新生产力功能。
Google 发布一款新模型,该模型已在 Google 多项产品体验中投入使用,并成为其 Gemini Audio 产品组合的又一关键组成。相关内容发布在 Google 官方博客。
Google 发布 Gemini 3.5 Transcribe 语音转文本模型,支持智能转写、函数调用和实时流式传输,转写更精确(WER 更低)。该模型还支持自定义词表、多说话人识别,并覆盖超过 85 种语言。
Google 推出两款 Gemini 转录模型:Gemini 3.5 Transcribe 用于转录录音,支持说话人归属和词级时间戳;Gemini 3.5 Transcribe Live 用于构建实时语音应用。
Gemini 3.5 Transcribe 是一款能理解代码库的语音转文字模型,可过滤口语中的停顿犹豫,并基于活跃上下文精确还原技术术语、文件名和代码变量。该模型通过 visual biasing 为开发者复杂工作流引入屏幕感知的深度上下文,演示场景为在 Antigravity 中构建。
Google 发布 Gemini 3.5 Transcribe,可让应用理解用户语音与意图,并支持多说话人场景。该模型开箱即可自动检测 85 种以上语言,并提供针对专业术语的自定义词表适配。API 现已在 Google AI Studio 和 Gemini Enterprise 上线,也可在 macOS 的 Gemini 应用或 Android 的 Rambler 中试用。
Google DeepMind 更新语音识别能力,可自动检测并转写 85+ 种语言的语音,在嘈杂环境下也能更准确理解复杂电话号码、邮编和订单 ID。新版本还能去除填充词、自动格式化文本,并通过自定义词表识别特定人名和产品名。该功能已在 macOS 版 Gemini App 和 Android 版 Gboard 上线,开发者可在 Google AI Studio 和 Antigravity 中构建。
Google DeepMind 发布 Gemini 3.5 Transcribe,定位为面向精准、智能转写的最新语音转文本模型。官方称其可实现精确且智能的转录,具体参数、支持的语种与上线方式尚未在公告中披露。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为迄今最精确的语音转文本模型,可将原始音频直接转为准确、格式化的文本。
Fish Audio 发布 iOS 版,将桌面端完整语音工作室搬到移动端。用户可浏览 200 万+ 声音、用 80+ 语言制作多说话人对话、通过开放式标签直接控制情绪,还能克隆自己的声音或凭单条提示词设计音色。
Fish Audio 的 iOS 应用已在 App Store 上线,可通过 apps.apple.com 链接下载。该消息由 Fish Audio 官方账号发布。
哈佛商学院在其面向创业者和早期初创公司的 HBS Foundry 项目中,用 HeyGen 的 LiveAvatar 为教授构建交互式 AI 分身,创始人可随时与它们练习路演、销售通话和董事会会议。据《纽约时报》报道,这门 699 美元的课程已在 100+ 所大学上线。HeyGen 表示这正体现其定位:放大人类专业知识,而非取代它。
LiveKit 与 xAI 合作,让开发者可在 LiveKit 中调用 Grok Voice 模型构建语音智能体,全链路支持 ZDR。示例患者接诊智能体采用 Grok STT → Grok 4.3 → Grok TTS 级联,通过 LiveKit Inference 在单个 AgentSession 中传入三个模型字符串,无需单独 API key 和计费。
Latent.Space 与 @realbasilchatha 合作推出新的 Forward Deployed Engineering 播客栏目。
Gemini macOS 应用新增语音输入能力,可在任意窗口内直接听写、总结文件和改写文案。该功能由 Gemini 应用提供,适用于 macOS 平台。
京东科技蔡欣彤独立开发了端到端智能播客平台 Smart Podcast Platform,用户上传视频或音频后,由 AI 自动完成内容理解、音色设计、语音合成与专业混音,全程无需人工干预。
xAI 发布 Grok Voice Think Fast 2.0,可通过 API 或在其 Agent Builder 中使用。用户可前往 console.x.ai 构建、调优并部署语音智能体,更多信息见 x.ai/news 相关页面。
Starlink 正使用 Grok Voice 每天处理超过 15,000 通客户支持与销售来电,Grok 可诊断硬件问题并安排换货,每周通过语音与聊天完成超 3,000 笔订单。
xAI 宣布 Grok Voice Think Fast 2.0 在 Artificial Analysis Speech-to-Speech Index 上排名第一。该指数衡量语音智能体能否对听到的语音进行推理、解决真实客户问题,并通过智能体工具正确完成任务。
Mistral 宣布与 HUMAIN 达成战略合作,覆盖 AI 基础设施、先进模型开发以及在沙特及周边地区的 AI 解决方案部署。双方将共同开发本地化前沿 AI 模型,初期聚焦网络安全、语音,以及在阿拉伯语上表现强劲的模型。