Google Nano Banana 2.1 上线 OpenRouter:Flash 速度实现 Pro 级图像生成与编辑
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
Google Gemma 现可在浏览器中直接完成嵌入,无需服务端支持。该能力借助 WebML 相关工具实现,用户打开对应页面即可试用。
Nano Banana 2.1 已在 Pika 上线,带来更好的视觉质量、更快的速度,并内置 Gemini 的真实世界智能。Pika 官方表示用户现在可以尽情使用。
Google 发布 EmbeddingGemma 2,这是其首个原生多模态嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它可将 100 多种语言以及代码、图像、音频和视频嵌入同一个向量,上下文长度 8,192,提供 740M omni、440M text+vision、570M text+audio 和 270M text-only 四种规格。
Nano Banana 2.1 已发布,面向图像生成与编辑用户,带来更高质量的图像和对前代模型的诸多 bug 修复,并采用更低的价格。该模型已在 API、AI Studio 和 Gemini app 中提供使用。
Google 与 Northwestern、Jacaranda Health 合作,在肯尼亚内罗毕和芝加哥各纳入 1000 名孕妇,用机器学习模型分析未经超声培训的卫生员按预设路径完成的"盲扫"超声视频,估测妊娠龄和胎位,准确度与受训超声医师相当。卫生员仅需 8 小时即可学会操作,且全部处理在设备端完成,无需供电或 Wi-Fi,可在资源匮乏地区提供产前关键信息。
Google 发布新一代图像生成和编辑模型 Nano Banana 2.1,从今天起陆续上线 Gemini App、Google 搜索 AI 模式、AI Studio、Flow、Stitch、Google Ads 和 Gemini 企业平台。
Replicate 已在平台上提供 Google 的 nano-banana 模型,用户可通过 replicate.com/google/nano-ba… 直接试用。原文未披露该模型的参数规模、上下文长度或 benchmark 数据。
Replicate 上线 Google DeepMind 图像模型 Nano Banana 2.1,该模型在价格与性能之间寻求平衡。它在视觉设计、基于 mask 的编辑和主体一致性上有所提升,以生成更自然的图像。
Claude 现可在 Google Docs、Sheets 和 Slides 内工作,这些文件也能在 Claude 中打开。在 Google Workspace 里,Claude 以侧边栏形式出现在文件旁,读取当前打开的内容并就地编辑,用户可逐条批准每次修改后再落地。
GPT-6 Astra 在 Lilypond Bach Benchmark 上取得迄今最佳结果,其四声部众赞歌没有声部进行错误,和声语汇复杂到包含那不勒斯六和弦,并且是首个在该 benchmark 上写出经过音的模型。测试使用 Extra High effort,提示词要求在 LilyPond 2.24 中按巴赫风格写 G 小调 3/4 拍四声部众赞歌并只返回代码块。
谷歌发布图像生成模型 Nano Banana 2.1,官方称其在视觉设计、基于蒙版的编辑、主体一致性和画面自然度上全面超越前代模型,并已在 Google AI Studio 上线。歸藏实测表示,该模型中文文字清晰度和错字问题大幅改善,中文字体设计与排版美学良好、画面干净,且支持生成 4K 图片,但价格偏贵。
Nano Banana 2.1(gemini-nano-banana-2.1)已上线,价格从上一代 Pro 模型的每张 0.134 美元降至 0.034 美元。
Google DeepMind 发布 EmbeddingGemma 2,参数量 740M,在多项基准上具有竞争力,甚至超过部分参数量两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如用语音备忘录在视频中定位片段,也可与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 上线。
Google DeepMind 发布 EmbeddingGemma 2,称这是其首个原生多模态的端侧嵌入开源模型。该模型在文本之外统一了代码、图像、音频和视频,把它们映射到同一个共享空间。
Google Flow Music 的 Spaces 功能现支持将自然语言定制的乐器或效果导出为 VST3/AU 插件,直接在自己的 DAW 中运行,无需编程经验。制作人 Khris Riddick-Tynes 借此做出了插件 "No Chaser",可让不同环境下录制的器乐与人声保持录音室级清晰度。
Google DeepMind 发布 EmbeddingGemma 2,一个将文本、代码、图像、视频和音频映射到统一嵌入空间的轻量多模态嵌入模型,基于 Gemma 4 架构、Apache 2.0 许可,参数量 7.4 亿。
Google DeepMind 的 Janie Gu 与 LinqAlpha 的 Chanyeol Choi、Jack Haverty、Suyeol Yun 对谈,主题为前沿模型为何在十亿美元级投资组合上失败。该场分享定于 10 月 13 日在 AI Engineer New York 举行。
Google Research 与 Google Health 发布研究,展示 Google Earth AI 结合卫星影像、移动性数据与基础模型(AlphaEarth Foundations、Population Dynamics Foundation Model),并配合 Geospatial Reasoning 智能体原型,帮助公共卫生机构预测疾病暴发。
来自 17 个国家的 100 多家创业公司将于今年 11 月在 Google 山景城总部参加为期两天的 Gemini Startup Forum,这是该论坛的第四批入选团队。
Stack Overflow 第 16 届开发者调查公布,超 3 万人参与,Claude Code(66%)和 GitHub Copilot(59%)是开发者最常用的编码智能体。Anthropic 与 OpenAI 的模型使用率并驾齐驱,Google 位列第三,但更多受访者愿意继续使用 Anthropic 模型。62% 的受访者对 AI 持正面看法,日活用户中这一比例升至 71%。
Theo Triantafyllidis 获得 2026 Frieze 伦敦艺术家奖,将在 Frieze London 展出可攀爬的巨型蜘蛛雕塑与多人游戏《Feral Metaverse (Spider), 2026》。
Google 与 Constellation Energy 达成新合作,通过升级伊利诺伊、宾夕法尼亚和新泽西六座在运核电站,为 PJM 电网增加 890MW 清洁核电,同时部署 Google Cloud 的 Gemini Enterprise 智能体工作流优化核电站运营。
a16z 合伙人 Josh Elman 在加入 a16z 后的首次播客访谈中提出,好产品的第一个检验标准是用户用了它之后"停止做了什么",而信任是 AI 产品从早期采用走向数亿乃至数十亿主流用户的分水岭。他认为 AI 对消费者仍处于皮毛阶段,多数人只是用 Chatbot、Gemini 让搜索更高效,个人 Agent 与互动娱乐是下一个值得期待的方向。
作者卡兹克解读 A16Z 第七版《Top 100 消费级 AI 应用》与 9 月底更新的《市场状况 II》两份报告,整理出其中的反常识数据。
Google 的 Nano Banana 2.1 已在 AI Gateway 上线,模型标识为 google/gemini-nano-banana-2.1。相比早期 Nano Banana 模型,它改进了图像生成与编辑,支持产品场景重构、基于遮罩和墨迹的编辑,并提升事实准确性,可呈现逼真肤色、细腻材质、锐利光照和连贯背景,同时保持 Flash 级延迟与成本。
Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。
NotebookLM 在 a16z 第七版 Top 100 消费级 AI 应用榜单中进入生成式 AI 网页产品前十。该榜单首次加入收入排行榜,ChatGPT 以移动端超 10 亿月活继续居首,Claude 以近 10 亿月访问量升至网页端第三,品类还扩展至 Lovable、Cursor、Suno、ElevenLabs、Kling、Manus 等。
a16z 的 Olivia Moore 认为消费级 AI 商业模式被搞反了:目前几乎所有收入都来自直接订阅,在其 Web 榜单中 85% 的产品靠订阅变现,62% 另有 credits 或超额使用付费,仅 13% 采用广告等"用户即产品"的模式。
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
Google AI 在 X 平台发布一篇新文章,附链接指向 x.com 的文章页面。该帖获得 62 条回复、218 次转发、1747 个点赞,浏览量达 115832。
美国佐治亚州 Decatur 的 Cedar Grove Middle School 八年级物理科学教师 Chanel Johnson 在课堂中借助 Gemini 对照课程标准审查单元教案并构思新教学思路,同时用 Gemini 和 Gemini Notebook 带学生做互动模拟、培养数字素养。她强调技术不会取代课堂上人与人之间的连接,只是留出更多空间去启发学生。
一位媒体制作与商业写作课教师分享,学生用 Google Drive 存储大型视频素材、交换高分辨率照片并实时互评,用 Google Sheets 分配任务、管理制作时间线。这些协作工具帮助课堂跟上紧张的播出与年鉴印刷排期,让学生建立技术信心并团队协作。
一位教师在日常教学中使用 Google Sites、Gemini Notebook 和 Google Vids,帮助学生从单纯消费信息转向自主创作:用协作 Sites 分享所学以强化分析能力,用自定进度学习笔记本,用 Vids 把想法做成创意视频演示。其目标是让每个孩子都有平等机会协作、批判性思考并找到自己的声音。
美国一所学校的八年级学生用 Gemini 作为创意伙伴,搭配 Google Docs 和 Slides,从无名称、无 logo 起步,搭建起校内首个新闻节目"The Cougar Rumble"。他们借助 Gemini 归纳 logo 草图共同主题并生成提示词打磨品牌套件,如今这套流程支撑每周播出,帮助团队在拍摄前润色脚本、整理镜头清单。
SF Tech Week 今日开幕,Speedrun 将在其 Jackson Square 新办公室办活动,并与 1000+ 投资人举办 Demo Day。官方议程超过 1700 场活动,两年翻倍以上,来自 1058 家公司的 1266 位主办方参与,包括 OpenAI、Anthropic、Google、Mistral 等,Speedrun 投资组合公司主办 100+ 场。
一条被广泛传播的说法称,Gemini 之所以能做到“最稳定”,原因在于“一个系统基本不更新就是最稳定的”。该帖由宝玉(@dotey)发出,获得 25 条回复、2 次转发、78 次点赞,浏览 27993 次。
前 Google DeepMind 研究员 @Turn_Trout 在纽约 AI 听证会上作证,称他曾试图推动 Google 对 AI 安全作出承诺。他表示 Google 最终从早先的 AI 安全承诺上退缩,其中也包括 Demis Hassabis。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入消费者实际付费情况的维度。数据显示付费高度集中于开发者、创作者等重度用户,Olivia Moore 与 Josh Elman 在播客中讨论了 ChatGPT、Claude、Gemini 的不同走向、个人智能体的隐私墙、OpenAI 的 10 亿美元广告收入规模,以及订阅制为何可能不是把消费级 AI 带给所有人的最终商业模式。
Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。