Google 发布 Gemini 3.5 Live Translate,实时处理原始音频翻译
Google AI Developers 介绍 Gemini 3.5 Live Translate,它不再逐句翻译文本,而是实时处理原始音频,从而消除延迟并保留说话者自然语音的细节。推文同时展示了开发者基于它构建多语言应用的情况。
Google AI Developers 介绍 Gemini 3.5 Live Translate,它不再逐句翻译文本,而是实时处理原始音频,从而消除延迟并保留说话者自然语音的细节。推文同时展示了开发者基于它构建多语言应用的情况。
播客「自习室 STUDY ROOM」请来 Bot Auto 创始人、图森联合创始人侯晓迪,围绕 Google DeepMind 创始人 Demis Hassabis 的人生拆解智能问题,串联国际象棋、游戏设计、神经科学与 AI 的身份转换。节目一次性讲清深蓝、AlphaGo 与 AlphaZero 的区别、ChatGPT 开启新时代、LLM 涌现能力的来源,以及 AI 竞赛像淘金热的现状。
Demis Hassabis 在 X 上发布一篇长文,帖子获得 23785 点赞、5115 次转发、1816 条回复,浏览量达 15846651 次。
Epoch AI 估算,向免费聊天机器人发送 100 词提示词生成回复约耗 0.6 Wh 电,比微波炉运行 10 秒还少。AI 目前仅占美国年用电量的百分之几,低于空调(12%)和照明(8%),但数据中心电力需求大约每年翻一番。
NotebookLM 近期上线多项功能:从 Google Drive 上传的源文件在改动后会自动同步,笔记本可置顶到首页方便访问,Slide Deck 支持重新排序或删除幻灯片,以上三项目前仅限网页端。移动端则支持分享指定 artifacts、下载 slide decks 和搜索笔记本。官方预告还有更大更新正在酝酿。
Google DeepMind 在印度启动 ATL Saathi 实时试点,这是一款由 Gemini 驱动的 Web 应用,为每所 Tinkering Lab 的教育者提供 24/7 备课与培训助手。
Ethan Mollick 指出 ChatGPT Work(及 Cowork)错失了知识工作者的机会,并用 Google NotebookLM 处理同样 70+ 份文件的同一问题作对比,认为 NotebookLM 更聚焦流程与来源而非只给结果。
Google AI Studio 现已支持直接导入 GitHub 仓库,可将整个 repo 带入上下文窗口进行开发。此举让开发者无需手动复制代码,即可在 AI Studio 中基于完整仓库上下文构建。
Sam Altman 宣布 GPT-5.6 sol 将于周四发布,并附上"happy building"。该推文获得 391 个赞、32 条回复、4 次转发和 64095 次浏览,引发外界讨论 Google 此时相对 OpenAI 的领先之处。
NotebookLM 的 Short Video Overviews 已在移动端和网页端面向所有英语用户正式上线。官方同时向用户征集使用反馈和后续功能建议。
Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。
Sundar Pichai 在 7 月 4 日发文,称无论怎么拼写,250 年的美国创新、独创精神与好奇心都值得庆祝,并祝愿大家度过一个快乐安全的独立日。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将世界领先的研究实验室与 A24 深度结合,帮助艺术家开发新工作流与技术。双方将跨多个项目展开长期研发协作,让 Google DeepMind 的创新直接嵌入创作过程,并由此获得艺术家的反馈与指导。此外,Google 已对 A24 进行投资。
Sundar Pichai 在 X 上转发了一支用 Google Workspace 的 Docs、Gmail、Calendar 等功能重新演绎美国建国历程的创意作品,并调侃说"真正把历史写进了版本历史里"。
Poe 宣布 Claude Fable 5 和 Gemini Omni Flash 现已上线该平台。Fable 5 是 Anthropic 最强大的模型,短暂下线后重新向公众开放;Gemini Omni Flash 支持对话式视频创作与编辑,官方将其比作 Nano Banana 的视频版,借助世界理解实现真实运动与一致性编辑。
Poe 平台上线 Anthropic 的 Sonnet 5 与 Google 的 Nano Banana 2 Lite。Sonnet 5 被称为 Anthropic 迄今最具智能体能力的模型,具备 Opus 级编码与推理能力,成本更低。Nano Banana 2 Lite 是 Google 最快、最具性价比的图像模型,约 4 秒生成清晰一致的图像。
NotebookLM 宣布 Short Video Overviews(短视频概览)已正式面向网页端全部用户开放,支持英文。该功能可把复杂资料转成 60 秒竖屏视频,此前已向 Google AI Ultra 和 Pro 订阅用户在移动端与网页端推出。
Google DeepMind 的 Nano Banana 2 Lite 已在 Replicate 平台上线,可通过 replicate.com/google/nano-ba 试用。该推文仅给出名称和试用入口,未披露具体能力或参数细节。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
官方给出两款新模型的价格、延迟与定位差异,读者可据此判断图像到视频链式工作流的成本与适用边界。
NotebookLM 推出 Short Video Overviews,可将复杂资料转成 60 秒竖屏视频,深入讲解任意概念。该功能正向 Google AI Ultra 和 Pro 订阅用户推送,覆盖移动端与网页端,免费用户后续开放。
《晚点聊》「具身季报 26Q2」邀请 Alphaist 创始合伙人陈哲盘点本季具身智能 TOP 5 进展:人形机器人马拉松、Figure AI 连续 200 小时直播、中国高自由度灵巧手亮相 ICRA、英伟达 Cosmos 3 世界模型从生成视频转向直接生成动作,以及 π0.7 与 Gen-1 的模型进展。节目还讨论 OpenAI Robotics 团队官宣、世界模型创投热与具身落地节奏。
Google DeepMind 将 computer use 作为内置工具引入 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供,现整合进主 Flash 模型。
Qdrant 于 6 月 11 日在旧金山 The Midway 举办首届美国 Vector Space Day,350 余名开发者参会,设 Agent 与记忆、搜索与检索、边缘与机器人三个分轨。
NotebookLM 的闪卡功能现已支持完全自定义,用户可编辑问题、调整答案并新增卡片,自建学习工具集。自定义卡片还能分享给朋友、同学等人。
牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。
Gemini 3.5 Flash 输出文本高频循环的问题已完成根因定位与缓解,新的模型版本已导出上线。相关团队重置了所有用户的 Gemini 周配额,用户可在 Antigravity 中试用。
John Jumper 宣布在近 9 年后离开 Google DeepMind,并加入 Anthropic。Demis Hassabis 回应称双方合作 9 年,AlphaFold 的成果展示了 AI 在科学与医学领域的可能性。
Google 同事 Norm Jouppi、Sridhar Lakshmanamurthy、Cliff Young 和 David Patterson 撰写的论文将发表于 2026 年 7/8 月《IEEE Micro》,题为 "Google's Training Supercomputers from TPU v2 to Ironwood"。
Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。
Google DeepMind 联手英国政府、Google Cloud 与 Faculty,在 Barnet、Camden、Dorset 三地试点一款基于 Gemini 的 AI 规划原型工具,目标是把住户规划申请的处理时间削减 50%。
NotebookLM 宣布升级版体验已 100% 面向全球 Google AI Ultra 订阅者全量开放。此次升级由 Gemini 3.5 与 Antigravity 驱动,聊天体验更完善,可更清晰地看到 AI 的思考过程,每个 notebook 还配有安全云计算机和 100 多个精选软件技能。
Google DeepMind 推出 AI Control Roadmap,一套用于管理和保障内部部署 AI 智能体安全的框架,采用"纵深防御"思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。
Google 与 UCSD 正在探索"手机集群计算",把每年被淘汰的、仍可用的数亿部旧手机重新用于云端算力。这种做法无需再开采原材料,并利用制造这些设备时已产生的隐含碳,从而直接降低计算的碳足迹。
谷歌 Antigravity 发布新版本,最受期待的功能是更完善的模型配额仪表盘(即将登陆 IDE)。仪表盘现以百分比显示每小时和每周配额上限,方便用户随时掌握剩余用量。官方同时为所有用户重置了 Gemini 配额。
Sundar Pichai 在 X 上发布了一条指向 blog.google 公司新闻页面的链接,未附额外说明。该帖获得约 200 次点赞、51 条回复和 26 次转发。
苹果在 WWDC26 上宣布 Siri 的 AI 升级将接入谷歌 Gemini 而非 OpenAI,同时 iPhone 17 Pro 塞进了史无前例的 20B 端侧模型,并采用苹果自研 MoE 架构、未让谷歌插手。Siri 还新增摄像头入口与全局上下文能力,Xcode 模拟器已支持双倍宽度,被指为折叠屏硬件铺路。这很可能是库克以 CEO 身份主持的最后一场 WWDC,九月后由硬件负责人特努斯接任。
Google Gemma 发布实验性开源模型 DiffusionGemma,采用 Apache 2.0 许可,探索一种快速文本生成方式,从逐 token 顺序生成转向同时生成整块文本。Demis Hassabis 称其速度是其他 Gemma 4 模型的 4 倍。
Epoch AI 的数据显示,自 2024 年 8 月 SpaceXAI 的 Colossus 1 上线以来,按算力容量计算的最大 AI 数据中心纪录每 7 个月翻倍。
Google DeepMind 于 6 月 10 日发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次性生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。