Gemini Live 新增智能体能力,支持语音处理邮件与 Daily Brief
Google Gemini App 宣布 Gemini Live 推出生产力升级,引入智能体能力,用户可以通过语音完成更多操作。现在用户可以与 Gemini 对话,收听 Daily Brief、处理收件箱邮件,或从 Spark 获取帮助。
Google Gemini App 宣布 Gemini Live 推出生产力升级,引入智能体能力,用户可以通过语音完成更多操作。现在用户可以与 Gemini 对话,收听 Daily Brief、处理收件箱邮件,或从 Spark 获取帮助。
Google Flow 迎来升级:Gemini App 中新增场景延展(Extend scenes)功能,面向所有 Google AI Plus、Pro 和 Ultra 订阅用户全球滚动推出。用户可直接在 Google AI Studio 中构建,并在 Gemini Enterprise Agent Platform 上部署。
Google 的 Gemini 模型现已可在 Replicate 上试用,官方给出的体验入口为 replicate.com/google/gemini-…。该消息由 Replicate 官方账号发布,未披露具体模型版本、参数规模或价格信息。
Replicate 上线 Google DeepMind 的 Gemini Omni 1.1 Flash,官方称其为最新的多模态视频生成与编辑模型。该更新支持场景延长、指定镜头首尾帧、添加视频输入参考、最高 4K 放大以及用 360p 快速验证想法。
Anthropic、AWS、Google、Microsoft、OpenAI、Oracle 等 100 多家机构联署公开信,呼吁全球加大网络防御力度。信中主张以全球性行动应对网络安全威胁,联署方覆盖主要云厂商与 AI 公司。
Google DeepMind 的播客现可在 YouTube、Spotify 和 Apple Podcasts 收听,也可在常用播客平台找到。官方同步放出了三个平台的跳转链接,方便听众直接订阅。
Google DeepMind 研究副总裁 Zoubin Ghahramani 与 Fryrsquared 对谈,探讨为何让系统具备"自我怀疑"与概率思维,能带来更安全可靠的现实决策。内容从天气预报、机器人等场景切入,涵盖不确定性的作用、正确性与置信度的区别、AI 中的贝叶斯思维及面向 AGI 的未来研究。
Google Omni 从首次发布到将用户喜爱的 Veo 功能融入 Omni 模型,经历了大量工作。团队表示未来 Omni 版本还有更多内容正在打磨,并继续征求反馈。
Google 发布 Gemini Omni Flash 1.1,这是对其 anything in, anything out 世界模型的更新。新版本支持 360p 草稿与 4K 上采样、延长时最多 10 秒视频上下文、以 10 秒为单位递增的视频延展,以及视频参考功能。
Google AI Studio 推出 Gemini Omni 1.1 Flash,为开发者带来一组新的创意控制与生成式视频能力:可延长场景以支持更长叙事、指定首帧和末帧、以 360p 更高效地草稿视频,并可放大到 4K 分辨率,还支持在多模态输入中加入视频参考。该模型现可通过 Gemini API 和 AI Studio 使用。
Google Flow 即将加入场景延展(scene extension)功能。Gemini App 中的场景扩展正向所有 Google AI Plus、Pro 和 Ultra 订阅用户全球推送,同时支持在 Google AI Studio 中直接构建,并可部署到 Gemini Enterprise Agent Platform。
Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供生成式视频的创作控制能力,通过 Gemini API 和 Google AI Studio 使用。
Google DeepMind 正在试点前沿 AI 的双盲评估,为行业首创。该方法构建安全环境,测试提示词与模型权重均不公开,使外部对模型的安全与性能评估保持私密、稳健且可信。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,推出全球首个面向专有前沿 AI 模型的双盲评测,将外部评测限制在密码学环境中,避免模型提前接触测试题目。该试点用 Gemini Flash Lite 在隐私保护环境下测试机密基准,目标是应对基准污染导致的分数虚高,提升评测可信度。
Google 发布 Gemini 3.5 Transcribe,官方称这是其最精准的语音转文字模型,支持 85 种以上语言,具备智能纠错和自定义词表功能。Ammaar Reshi 用该模型开发了一个类似 Wispr Flow 的应用,演示与开源代码已公布。Patrick Loeber 转发了这一消息并强调该项目已开源。
Logan Kilpatrick 表示相关评论与 Ox Alpha 模型无关,只是时间点不巧,评论实际围绕 3.7 Flash 的发布,并称这是其迄今增长最快的模型发布。
GDM 表示正高度专注于确保 AI 造福人类,并为客户交付实用产品。该表态由 @rsdgpt 发出,未披露具体产品、模型或时间表。
Google Gemini 官方宣布 Gemini Live 已在全球范围内免费开放。各集成的可用性、兼容性和年龄限制存在差异,部分功能可能需要设置或订阅,官方同时介绍了 Gemini Live 中将语音转为操作的新生产力功能。
Gemini Live 推出 Personal Intelligence,可记住用户此前聊过且对自己重要的内容,并跨历史对话与 Gmail、Google Photos、Search、YouTube 等 Google 应用串联信息,让用户不必从头开始对话。用户可自行选择连接哪些 Google 应用、管理 Gemini 从过去聊天中学习的方式,并设置自己的指令。
Google Gemini 宣布 Gemini Live 从对话扩展到替用户处理复杂任务,新增 Daily Brief、Gemini Spark、Personal Intelligence 以及 Gmail 收件箱管理等功能。用户可以通过对话梳理日程并委派待办事项。
Google 发布一款新模型,该模型已在 Google 多项产品体验中投入使用,并成为其 Gemini Audio 产品组合的又一关键组成。相关内容发布在 Google 官方博客。
Google 发布 Gemini 3.5 Transcribe 语音转文本模型,支持智能转写、函数调用和实时流式传输,转写更精确(WER 更低)。该模型还支持自定义词表、多说话人识别,并覆盖超过 85 种语言。
Google 发布了一篇新博客文章,链接指向 blog.google 的 innovation-and 页面。原文未披露文章的具体主题与技术细节。
Google 推出两款 Gemini 转录模型:Gemini 3.5 Transcribe 用于转录录音,支持说话人归属和词级时间戳;Gemini 3.5 Transcribe Live 用于构建实时语音应用。
Gemini 的新能力已可在 macOS 版 Gemini App 和 Android 的 Gboard 中试用,开发者可通过 Gemini API、Google AI Studio、Antigravity 以及 Gemini Enterprise Agent Platform(公开预览)进行构建。
Google 发布转录模型 Gemini 3.5 Transcribe,支持 85+ 种语言的语境感知语音转文字,可自动过滤填充词并格式化非结构化语音。该模型还能结合屏幕上下文执行语音指令,把杂乱的语音输入和本地文件转成邮件草稿。
Google AI Developers 发布 Gemini 3.5 Transcribe,一款号称能理解代码库的语音转文字模型。官方演示中,该模型可过滤口语中的犹豫停顿,并针对当前上下文精确还原技术术语、文件名和代码变量;它通过视觉偏置为复杂开发者工作流引入屏幕感知上下文,演示场景为在 Antigravity 中构建。
Google 发布 Gemini 3.5 Transcribe,可让应用理解用户语音与意图,并支持多说话人场景。该模型开箱即可自动检测 85 种以上语言,并提供针对专业术语的自定义词表适配。API 现已在 Google AI Studio 和 Gemini Enterprise 上线,也可在 macOS 的 Gemini 应用或 Android 的 Rambler 中试用。
Google DeepMind 更新语音识别能力,可自动检测并转写 85+ 种语言的语音,在嘈杂环境下也能更准确理解复杂电话号码、邮编和订单 ID。新版本还能去除填充词、自动格式化文本,并通过自定义词表识别特定人名和产品名。该功能已在 macOS 版 Gemini App 和 Android 版 Gboard 上线,开发者可在 Google AI Studio 和 Antigravity 中构建。
Google DeepMind 发布 Gemini 3.5 Transcribe,定位为面向精准、智能转写的最新语音转文本模型。官方称其可实现精确且智能的转录,具体参数、支持的语种与上线方式尚未在公告中披露。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为迄今最精确的语音转文本模型,可将原始音频直接转为准确、格式化的文本。
为符合 EU AI Act 等新法规,Anthropic 将在所有未来的 Claude 模型中嵌入不可见水印,并最终覆盖较旧的模型。文本生成方面,Claude 采用 Google 的 SynthID 方法,通过种子生成器引导词汇选择形成统计模式,再由评分 API 检测;图像方面则嵌入 C2PA 元数据。
Latent.Space 与 @realbasilchatha 合作推出新的 Forward Deployed Engineering 播客栏目。
Gemini macOS 应用新增语音输入能力,可在任意窗口内直接听写、总结文件和改写文案。该功能由 Gemini 应用提供,适用于 macOS 平台。
Google 面向符合条件的大学生推出 Gemini 免费一年订阅:美国学生可免费获得 1 年 Google AI Pro,140 多个国家的学生可免费获得 1 年 Google AI Plus。配套学习工具包括 study notebooks、互动测验和新的学生中心,Google 将于 8 月 28 日太平洋时间上午 11:30 在 Gemini Discord 举办直播活动进行讲解。
Sundar Pichai 在访谈中预测,三年后任何内容都能在任意模态间转换,届时回看今天的 AI 会像看翻盖手机一样原始。他举例 YouTube 片段变成博客、通讯不用录音就成播客,消费者选格式、创作者只提供创意与人格。他认为这会终结"内容更多"策略,让创作者转向质量,而 YouTube 新政策针对的是低质内容而非 AI 本身。
Google AI 官方账号发布一条推文,附带指向 x.com 文章的链接(x.com/i/article/2092…)。该推文获得 379 次点赞、40 次转发、29 条回复,浏览量 83426 次。
Weaviate 联合 Google DeepMind 的 Gemini Embedding 2 推出原生多模态 RAG,文本、图像、音频、视频可嵌入同一共享向量空间,一次查询即可检索 PDF 页面、音频片段或视频中的对应片段,跳过了转录、OCR、字幕等文本转换步骤。
Gemma 4 家族还带有 MTP drafters,采用专门的投机解码架构,最高可实现 3 倍提速。相关细节来自 Google 的一篇博客文章,另有 Leonie 整理的投机解码学习笔记可供参考。