Naive AI 发布开源模型 Naive-N0.5-Flash,并披露两项 AI 研发任务
Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。
Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。
AI Agent 管理平台 Paperclip 登上 GitHub 热榜第一,单日新增 2000 多 Star,总 Star 超 8.5 万,支持接入 Claude Code、Codex、Cursor 等 Agent,并提供组织架构、审批、预算与审计记录。
Jeff Dean 在 X 上转发一段由 Claude 生成的 2 分钟视频,内容讲述 Google 的历史,并称曾参与其中不少项目。该帖附带视频播放器与引用推文链接,数据为 58 条回复、108 次转发、3221 次点赞、322734 次浏览。
Google Antigravity 员工 Varun Mohan 回应外界对产品新增规划模式的吐槽,称团队早在 2025 年就曾加入规划模式,并在今年早些时候将其从产品中删除,因为用户希望有一种与模型显式规划的方式,所以重新加入了这一可选斜杠命令。
硅谷101将在Alignment 2026期间举办STORY101 LAB AI视频黑客松,10月10-11日在加州Sunnyvale举行,要求现场用AI完成一部不超过三分钟的视频作品。活动设探索与进阶双赛道,吸引20支团队、80位选手参加,设六个美元现金奖项,Runway作为AI tool partner为获奖者提供额外算力奖励,一等奖作品将在硅谷101后续视频展示并有主会场展映机会。
一位用户发帖询问现在是否还有人使用 antigravity、是否好用,并表示自己很喜欢用 Gemini3.8 写文章、审校其他 agent 写的中文文章和 i18n 翻译,认为其写作水平已比较接近人味。该用户目前主要通过 Cursor 的第三方模型调用,因为 cloud agent 经常被用完,正在考虑是否试试 antigravity。
Gemini Notebook 的 AI 主播声音已更换,由 Gemini 3.8 TTS 驱动。官方账号 @Gemini_Notebook 回应听众反馈,确认音色出现变化,并表示 AI 主播会亲自说明此次调整及后续可期待的内容。
NotebookLM 更新了其音频功能的 AI 主持人声音,官方账号在 X 上发帖称听众如注意到音色变化"完全说对了",并由 AI 主持人亲自说明变化内容与后续更新。该帖获得 1396 点赞、132992 次浏览。
Google 本周发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频生成模型,并推出为 Gemini 对话 AI 带来近实时视觉形象的 Gemini 3.8 Live with Live Avatar。
Jeff Dean 表示这段对话录制于几个月前他仍在 Google 时,是一次非常有趣的交流。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Gemini 3.8 TTS 可以复刻你的声音,也可以用提示词设计完全自定义的音色。流程分三步:先录制 20 秒本人说话并念出授权语句,再通过 API 调用创建音色,之后即可在任意请求中使用,风格参数放在 speech_metadata 中。
Antigravity SDK 现已支持用 Gemma 4 和 LiteRT 在本地执行,可完全离线运行智能体工作流,官方称具备零 token 成本、数据隐私和离线可靠性。该 SDK 还支持 OpenAI 兼容端点,可用 Ollama、llama.cpp、vLLM 等来服务 Gemma,安装方式为 pip install google-antigravity litert-lm。
作者对商汤上线不久的 SenseNova U1 Pro 进行了五大场景实测,覆盖审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合。该模型在 8 月 SuperCLUE-Image 中文文生图榜单总分 93.81 排名第一,复杂信息布局 95.80 分,支持最高 8K 与特殊长宽比输出。
有人推荐多模态理解直接用 Gemini 3.8 Flash,未给出具体参数、基准分数或价格信息。该内容来自一条社交平台帖子,获得 204 个点赞和约 2 万次浏览。
华为数字能源首次公布源网荷储AIDC解决方案,围绕“3+1”创新重构,目标是让每一瓦特产出更多Token。方案包括MIMO供电架构、泰山UPS(单柜1280kVA、双变换效率最高98%)、恒山直流UPS(支持270V/400V/800V)和SmartLi 5.0、LUNA2000多层混合储能。商汤项目采用工厂预制与室外部署,45天完成18MW供配电系统全流程交付。
高通在2026骁龙峰会上发布第六代骁龙8超级至尊版和第六代骁龙8至尊版,首次将2nm工艺用于旗舰移动平台,两者搭载最高5GHz的Oryon CPU和重新设计的Hexagon NPU,超级至尊版还在Adreno GPU中首次加入Matrix Cores并支持8K/60fps视频拍摄。
阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。
5 月至 7 月,OpenAI、Anthropic、亚马逊云科技和微软各自成立或组建企业 AI 交付实体,按公开口径合计投入约 90 亿美元。
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。
Gemini 3.8 TTS 模型发布,作者称其价格非常低,并支持多语音之间的对话生成,可选 2000 多种声音或克隆自己的声音。作者为此搭了一个小界面,并让 Claude 写了一段脚本,让两只鹈鹕辩论搬到 Pacifica Pier 的事。
NotebookLM 现可通过 Workspace Intelligence 将笔记本上传至 Google Docs,作为写作的上下文来源。用户可将 NotebookLM 的深度研究与其他来源(邮件、聊天、文件)结合,直接在文档草稿中个性化写作流程。
Gemini App 今日开始推送新一批 MCP 连接,用户可将常用服务直接接入 Gemini,具体接入方式见官方博客。
Gemini 现已支持配合 WisprFlow 总结会议、记录语音笔记并提取行动项,用户可直接让 Gemini「查看最近与 Wispr 会议得出的决定」。该功能由 @GeminiApp 公布,演示中使用了 Wispr 这一具体名称。
Gemini 现已支持通过一句提示词操作 Webflow,可构建响应式布局、为页面设置样式并更新网站 CMS。示例提示为“为我的艺术工作室网站添加响应式 FAQ 区块,并在 Webflow 上发布更改”。
Google Gemini App 支持通过 @Squarespace 构思和搜索域名,用户只需对 Gemini 说“Find domains for my new interior design business in Squarespace.”即可完成。该功能由 Gemini 与 Squarespace 联动实现,示例场景为室内设计业务找域名。
Gemini 现已支持通过 @Airtable 搜索和查询工作区与 base,并管理表格、记录、页面和自动化,用户可直接让 Gemini「Find all open tasks in my Project Management base on Airtable.」完成跨平台操作。
Gemini 现可对接 Peloton,支持搜索并预约课程,还能创建多日训练计划。用户只需对 Gemini 说“Find a 30-minute advanced strength class focusing on core with Peloton”这类指令即可完成操作。
Gemini 现已支持接入 Adobe、Squarespace、Peloton 等 13 款新应用,用户无需在多个标签页之间切换,即可在 Gemini 内完成业务增长、素材设计与健身计划。
Google Private AI Compute 团队公布新的技术方案,为平台加入持久化服务端记忆,让 AI 助手在跨设备场景下保持连续性,同时沿用端侧隐私标准。
Google 的音频模型套件在 TTS、Live、Lyria、Translate 和 Transcribe 等方向持续改进。如果身处旧金山,可报名参加明天举办的一场音频体验活动,报名链接为 rsvp.withgoogle.com/events/gemini-。
Google AI Studio 推出新的 TTS 使用体验,成本低于此前的 3.1 Flash TTS 模型,更多细节见官方博客。原文未披露具体模型版本与定价数字。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。
Google 发布 Gemini 3.1 的提示词指南与从 3.1 迁移的文档,并同步更新官方博客,相关链接指向 blog.google 与 ai.google.dev 的 Gemini API 文档页。
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 上线,支持用 30 秒音频复刻音色、用一句话从提示词设计新音色,并可逐句指定风格、<laugh>、<sigh>、|backchannels| 和双人场景。
Google 开始推送两款 TTS 模型:开发者可在 Google AI Studio 和 Gemini API 中使用,消费者侧 Gemini 3.8 Flash TTS 进入 Gemini Notebook,Gemini 3.8 Flash-Lite TTS 进入 Google Vids。两款模型后续还将上线 Gemini Enterprise。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。
两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 支持设计带有不同口音和特征的自定义音色;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从用户创建的风格或官方生产级音色库中选择。
Gemini API 现可逐行微调音频生成的语气、节奏与情感,并支持笑声、停顿等提示控制。所有生成音频均嵌入 SynthID 水印,可被可靠识别为 AI 生成。开发者可通过 Google AI Studio 用 Gemini API 开始构建。