Google AI Studio 迎来新体验,成本低于上一代 3.1 Flash TTS 模型
Google AI Studio 上线新体验,配套成本低于此前的 3.1 Flash TTS 模型。该推文由 Logan Kilpatrick 发布,并附有 Google 官方博客链接供进一步了解。
Google AI Studio 上线新体验,配套成本低于此前的 3.1 Flash TTS 模型。该推文由 Logan Kilpatrick 发布,并附有 Google 官方博客链接供进一步了解。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
作者给豆包工作派了三件跨度较大的活:拍短剧、养自媒体号、搭AI新品雷达。拍短剧方面,它先列人物、分镜和衔接供确认,再切目标模式检查人物一致性和字幕配音并交出成片。
Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。
Google 发布 Gemini 3.1 的提示词指南与从 3.1 迁移的文档,并同步更新官方博客,相关链接指向 blog.google 与 ai.google.dev 的 Gemini API 文档页。
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 上线,支持用 30 秒音频复刻音色、用一句话从提示词设计新音色,并可逐句指定风格、<laugh>、<sigh>、|backchannels| 和双人场景。
Google 开始推送两款 TTS 模型:开发者可在 Google AI Studio 和 Gemini API 中使用,消费者侧 Gemini 3.8 Flash TTS 进入 Gemini Notebook,Gemini 3.8 Flash-Lite TTS 进入 Google Vids。两款模型后续还将上线 Gemini Enterprise。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。
两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 支持设计带有不同口音和特征的自定义音色;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从用户创建的风格或官方生产级音色库中选择。
Gemini API 现可逐行微调音频生成的语气、节奏与情感,并支持笑声、停顿等提示控制。所有生成音频均嵌入 SynthID 水印,可被可靠识别为 AI 生成。开发者可通过 Google AI Studio 用 Gemini API 开始构建。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。
哈佛外交与治国项目 Julian Simcock 与 Google DeepMind 的 Rick Ingram 就"分裂世界中的 AI 外交"展开对谈。该内容以视频形式发布,来源标注为 Runway 的推文。
Runway AI Summit 将于一周后举行,官方公布的首批议程为“Grounding Intelligence in the Physical World”,嘉宾包括 Nvidia 的 Ming-Yu Liu、Google DeepMind 的 Jon Barron 和 Wayve 的 Alex Toshev。更多场次信息尚未披露。
Google AI Studio 推出面向 Gemini 智能体的学习页面 aistudio.google.com/learn/gemini-a,用于讲解相关开发内容。该链接由 Patrick Loeber 在社交平台分享,帖文互动量较低(11 次点赞、1018 次浏览)。
Patrick Loeber 与 @timeyoutakeit 联合发布一份实用指南,拆解 Gemini API 技能并演示如何在编码智能体中使用,内容涵盖 Gemini API、Live API 与 Omni。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
Google 的 Gemini 3.8 Flash-Lite TTS 与 Gemini 3.8 Flash TTS 已在 AI Gateway 上线,均支持 100 多种语言的语音生成、长篇旁白、语调控制和双人对话。
Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。
作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。
硅谷101对话两位AI芯片创业者,拆解推理芯片三条路径:英伟达约200亿美元与Groq达成技术授权并吸纳Jonathan Ross等核心团队,Cerebras今年6月IPO市值达670亿美元,OpenAI联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅9个月。
Google Cloud 将于 9 月 23 日 15:00-16:00 举办线上课堂,介绍其在生命科学领域的全栈算法与算力应用,聚焦个性化肿瘤疫苗(PCV)的"千人千方"定制逻辑与临床转化中的维度、交付速度挑战。
a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。
Google Gemini App 将于 9 月 22 日 11am PT 举办直播演示,展示如何用 Gemini 购物,包括辅助决策购买、对比选项,以及通过拍照浏览商品。直播在 Discord 观看,地址为 discord.gg/gemini。
NotebookLM 的 Interactive Learning Overviews 现已向所有用户开放。该功能位于 Reports 下,可把来源摘要与 studio artifacts 整合进一个交互式中心,适合学习或对新主题做一站式深入探索。
Google 用 Gemini 3.8 Live Extended Thinking 构建了一个编程辅导工具,能识别用户屏幕上的 bug 并通过 function calling 引用 p5.js 库,然后讲解其中的逻辑。该演示展示了模型实时看屏加函数调用的组合用法。
HyperFrames 联合 Google DeepMind 和 Kaggle 推出 Code2Video Bench,用于衡量模型生成的代码能否渲染成值得观看的视频。该基准指出,SWE-bench 意义上的代码能力与"代码转视频"是两回事,目标是让前沿实验室在智能体视频任务上取得进展。
Google 正式发布 Googlebook,将 ChromeOS 与 Android 的最佳能力结合,打造面向笔记本的全新平台,初期重点是为 Android 手机用户提供体验出色的笔记本。该消息由 Sameer Samat 公布,Sundar Pichai 也转发表示看好。
NotebookLM 的 Live Chat 已在移动端向全部 Ultra 用户 100% 开放,可与笔记本进行实时语音对话,覆盖约 100 种语言。该功能由最新音频模型驱动,用户可就自己的资料提问并获取分步指导,几乎全程无需动手。
Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才练出的判断力,如今初级员工一出道就得硬抗。
Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。
红杉伦敦合伙人 Julien Bek 在 20VC 披露,红杉项目按 1 到 10 分打分,即便有人投 1 分,发起人仍可按下绿灯;Shaun Maguire 带 SpaceX 进来时正有人投 1 分,他逼所有合伙人飞过去亲眼看,先投小额再引出一笔重仓,如今位居该基金史上回报最前列。
前 Google Kotlin 团队首位工程师 Jake Wharton 在采访中表示,他在求职时把不加入 AI 公司、不做 AI 核心产品列为第一条要求,这让他放弃了约 80% 的潜在机会。
YouMind 直接用图生成 PPT 的效果被实测确认最好用:可指定 PPT 模板、针对单页快速改文字或按意图直接改图、新增页面时给素材即可自动理解生成,还会自动调整素材比例适配版面。分享者使用 Gemini 3.8 flash 模型,称积分消耗少、速度快。
腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。
有用户对比发现,Google Notebook 从上传资料中提取信息的能力依然很强,明显优于直接在 Codex 里提问。该用户查到的解释以配图形式给出,并向网友求证这一说法是否成立。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为目前最先进的实时对话音频模型。Google Labs 的个性化故事集 Dreambeans 与 Google Workspace 图像工具 Google Pics 均转为正式可用,同属 Google Labs 的 CC 则从个人效率工具扩展为面向家庭协作的共享智能体。
React 19.3 正式发布,View Transitions 与 Fragment Refs 转为稳定,并加入 Trusted Types 支持。
谷歌/DeepMind 研究人员推出 Dream-RSI,让 AI 智能体通过重放过去的发现尝试来改进探索问题的方式,以低成本测试数千种替代策略,并在下一轮部署更优策略。该系统在算法设计、数学优化和 GPU 内核工程中保持或提升发现质量的同时大幅降低搜索成本,一种场景下将智能体调用次数最多减少 162 倍。其改进的是探索策略,而非底层模型权重。
有人尝试用 ChatGPT 的 live 模式打电话改文章,方案是先在 Codex 里打电话并提前把 md 文件路径给它,写作则指定 Codex 调用 gemini 3.8 flash(可通过 agy cli 接入),再用任意 md 阅读器打开文件随时聊着改内容。
Gemini API 的 Managed Agents 迎来 harness 重大更新,Google AI Studio 发布了相关说明。原文未披露具体更新细节与版本号。
我们与 Speakeasy 合作,为 Interactions API 构建 SDK,并支持其将整套 OpenAPI 生成器套件开源,供社区使用,涵盖 SDK、agent CLI 和 MCP server。