Claude 接入 Google Docs、Sheets 和 Slides,付费计划开放 Beta
10月6日,Anthropic 宣布 Claude 接入 Google Docs、Sheets 和 Slides,向 Pro、Max、Team 和 Enterprise 全部付费计划开放公开 Beta。
10月6日,Anthropic 宣布 Claude 接入 Google Docs、Sheets 和 Slides,向 Pro、Max、Team 和 Enterprise 全部付费计划开放公开 Beta。
OpenAI在GitHub发布openai/math仓库,公开722份数学手稿、归为372组成果,覆盖数论、代数几何、组合数学等方向,全部来自一个未公开的内部模型。作者称这些成果平均每个花费约3小时ChatGPT Pro级思考算力,其中包含将准黎曼猜想推进到7/8、复数域矩阵乘法指数降到2.25等说法,同时记录了25位菲尔兹奖得主联名信等数学界的质疑与争议。
梳理OpenAI一次性公开722份数学手稿所引发的学界反应与争议,并讨论AI科研中评审环节的瓶颈。
Google 发布 Developer Knowledge API 与 MCP Server 公开预览,为 AI 助手和智能体平台提供机器可读的官方文档检索方式,覆盖 Firebase、Google Cloud、Android 等文档源。开发者可用该官方 MCP server 将工具直接接入 Google 文档语料,使 AI 生成的代码与建议基于实时权威上下文。
Google DeepMind 宣布 SynthID Detector 现已向所有人开放,可检测在线内容是否由 GoogleAI 或其行业伙伴的工具生成,伙伴包括 OpenAI、NVIDIA、Kakao,Apple 即将加入。NVIDIA 表示其 build.nvidia.com 上由 Cosmos 生成的内容已使用 SynthID 加水印,任何人都可将内容上传至检测器,确认是否来自其模型。
Google NanoBanana 2.1 已上线 Recraft Studio,拼写能力明显改善,海报、标签和信息图中的文字能按输入原样呈现。用户现可在 Recraft Studio 中试用。
a16z 第七版消费级 AI 应用报告显示,只有 4.5% 的美国消费者为 ChatGPT、Gemini 或 Claude 付过个人订阅费,近一半人用过 AI 但每天使用的只有四分之一。
Google Cloud 在 Next '26 上宣布 Ultra Low Latency(ULL)Solution 正式可用,并同步推出全新 U4 机器家族。
Demis Hassabis 表示 AI 最重要的应用方向是改善医学与人类健康,并对与 CZI 及 Virtual Biology Initiative 的合作感到兴奋。该合作的具体内容与形式未在文中披露。
美国国防部下属 CDAO 管理的 Tradewinds 计划允许企业提交不超过五分钟的视频介绍 AI 产品,通过评审后进入 Tradewinds Solutions Marketplace 并获得免竞争状态,从而加快采购流程,官方称部分案例可在不到一周内完成授标。
Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。
Google Labs 正在开发名为 Playground 的 AI 游戏创作平台,用户可通过简单的文本提示词构建浏览器游戏。该项目目前处于实验阶段。
Google 发布博文,介绍如何识别 AI 生成内容,引导用户前往 blog.google 查看相关方法。该内容由 Google AI 官方账号分享。
Google 在 synthid.com 开放 SynthID 水印验证入口,任何人可上传图像、视频或音频文件检查是否由 AI 生成,覆盖 Google 自身及 OpenAI、NVIDIA、Kakao 等合作方内容,Apple 也将支持。
Google DeepMind 推出 SynthID Detector,可快速识别视频、音频和图像中的 SynthID 水印,即使经过添加滤镜等编辑仍能识别。用户也可使用 Google Chrome、Google Search 和 Gemini App 中已有的 AI 识别功能。
Google DeepMind 宣布 SynthID Detector 现已向所有人开放,可用于检测在线内容是否由 Google AI 或行业伙伴的工具生成。可检测范围包括 OpenAI、NVIDIA、Kakao 的工具,Apple 即将加入,试用入口为 synthid.com。
Google 周二上线新网站,任何人都可以借此验证一张图片、一段视频或一段音频是否由 AI 生成。该网站围绕 Google 的 SynthID 水印技术,面向图像、视频和音频三类媒体提供检测入口。
Qdrant 提前拿到 Google EmbeddingGemma 2 并测试其 Matryoshka 兼容嵌入在 Qdrant 中可压缩到何种程度。通过更短向量、量化与重打分组合,向量内存占用降低约 77 倍,同时保留基线 94.5% 的检索质量。Google 在 EmbeddingGemma 2 发布公告中也提到了这项工作。
Eli Lilly 和 Novo Nordisk 称,服用其 GLP-1 减肥药的患者在追踪 DNA 与关键蛋白变化的分子“衰老时钟”上衰老更慢,但这一结果的解读仍存疑问。
Xreal 公布 Android XR 平台混合现实眼镜 Aura 起售价 1,279 美元,比 Meta VR Glasses 的 1,299 美元便宜 20 美元,且今年内出货,Meta 的要到明年年初。
Google 推出一款通过文本提示词生成视频游戏的平台,合作方为游戏工具开发商 Unity。该消息出自 FT 报道摘要,正文未提供平台名称、开放时间或具体能力等细节。
Aadit Sheth 指出 Instinct、Muse、Hark、Dots、Grok Bot 等智能体产品都在做同样的东西,定价也清一色是免费、$20/mo、$100/mo,他认为最终只会有一两个赢家,且大概率出自已经获得用户信任的大型科技公司 Google 或 Apple。
2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。
Personal Agent 被质疑是伪需求,但大厂仍在争抢,视频围绕 Muse、JEV 一个月估值涨 50 倍、给 Agent 配电脑的难点展开讨论。谷歌被指收紧免费策略,Google Spark 被比作超市里带锁的购物车,大模型进入基建化与低毛利时代,比拼谁能把 Token 成本压到最低并实现变现。
Nano Banana 2.1 展示了一组图像生成效果:一只完全倒满的红酒杯,以及一个指针停在 3:30 的时钟。该内容由 Philipp Schmid 发布,互动数据显示 231 次点赞、16 条评论和 9109 次浏览。
辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。
OpenAI 在 28 天挑战中为 GPT-6 Astra 和 Sol 提速 50% 至 50 tokens/s,并上线免费 auto-review 与 ChatGPT Meetings 插件;Gemini 4 Argon 发布,主打长时间多步骤编码与网络防御,输出上限 100 万 token。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
Google 宣布 Spanner Omni 正式 GA,这是其分布式 SQL 数据库的可部署到任意环境的版本,可运行在客户自有数据中心、其他云或笔记本上。为脱离 Google 基础设施,它用类似 Colossus 的抽象层替代分布式文件系统 Colossus,用软件实现误差有界的时间同步替代基于原子钟和 GPS 的 TrueTime。
Google 发布图像模型 Nano Banana 2.1,官方称其画面生成更自然,改图衔接更连贯。原文未披露参数规模、benchmark 分数与开放方式等具体细节。
Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
Google DeepMind 的模型页面已出现在 Ollama 模型库中(ollama.com/library/embedd…),@GoogleDeepMind 转发确认了这一收录。目前该帖互动量极低,仅 6 次点赞、0 次回复与转发。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,将文本、代码、图像、视频和音频映射到统一嵌入空间。
Gemini Live 的 Guided Vision 功能已在 Android 9 及以上版本的设备上线,覆盖 Gemini Live 支持的地区和语言。用户需将 Gemini app 与 Android 系统软件更新至最新版本即可使用,官方博客还介绍了日常使用场景及该功能与无障碍社区合作开发的细节。
Google Gemini App 上线 Guided Vision 视觉辅助功能,可读取小字与复杂文本、寻找并定位物体、描述物体并比对细节、探索身边环境。该功能面向老年人、识字有限者或在弱光下阅读小字的人群,用于找物、备餐、挑选衣物等需要快速视觉帮助的日常场景。
Gemini Live 开启 Guided Vision 后,Gemini 会充当对话伙伴。当摄像头抬得太高、离得太近或偏离一侧时,Gemini 会用自然语言提示你缓慢右移、向下倾斜或后退,以获取清晰视觉上下文来回答你的问题。
Google 在 Gemini Live 中推出 Guided Vision,面向盲人和低视力群体提供对话式实时视觉辅助。用户可共享摄像头,获得动态音频描述和自然的语音重构提示,以探索周围环境。该功能由 Google Gemini 与盲人和低视力社区共同打造。