Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 音频模型
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款 Gemini 音频模型。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款 Gemini 音频模型。
Google DeepMind 展示用 Gemini 3.8 Live Extended Thinking 充当编程辅导老师。两款模型均支持升级版推理、近实时视觉理解、97 种语言自动检测,以及不打断对话的后台工具调用。
Vidu S2 支持实时交互、可编辑与空间视频生成,论文已发布在 HuggingFace Papers(2609.11…)。该工作将交互式编辑与空间视频生成能力整合到同一视频生成框架中。
Yann LeCun 表示,基于 LLM 的 AI 工具虽然非常有用、人人都在用,但它们本身并不是通向人类级 AI 的路径。他指出,能够理解真实世界的架构并非 LLM,让当前 LLM 系统得以解读图像、视频等真实世界信号的架构组件也不属于 LLM。他同时提到有一场 1 小时的演讲,用结果和证据支撑上述结论。
创作者 Koldo Huici 用 GPT-6 Astra 生成布景与故事素材,再通过 Hailuo AI 的 MiniMax H3 将其制作成视频,实现"无需试镜、无需盒饭预算就能雇下整支军队"的效果。他在分享中附上了自己的使用技巧,该帖获得 22 次点赞、5873 次浏览。
HeyGen 展示了一条把医疗知识转化为患者内容的流程:预防保健提示、手术讲解、患者常见问题,全部用你的面部形象和声音呈现。原文将“你的知识”定位为信息源头,渠道则是患者寻找这些信息的地方,HeyGen 负责连接两端。
Character.AI 为 Last Summer 角色推出番外视频,现已在其 app 上线,可查看这些角色的日常生活片段。用户在 app 内打开 Last Summer 的剧集选择器并点击 "Bonus" 标签即可观看。
Resemble AI 发布 DETECT-World,称其为首个为深伪检测构建的世界模型,从光照、几何、运动、音视频同步等物理合理性判断内容是否可信,而非比对已见过的伪造样本。一次计算同时输出判定结果、异常发生时间线和异常位置热图。在外部运行的 Podonos 基准上,其音频准确率为 99.5%,在商业 API 中排名第一。
微软研究院新一期 Research Focus 聚焦四个方向:编码智能体在规模化场景下的行为表现、AI 模型在 PET/CT 扫描中识别淋巴瘤病灶的评估、AI 聊天机器人依赖问题,以及大规模决策系统的推进。
Yann LeCun 在 X 上回应 @ericxing 时表示,活在 bits 与 tokens 离散世界里的 AI 从业者,并不总能理解真实世界有多混乱。该帖获得 893 次点赞、82 次转发,浏览量 36227 次。
DeepSeek-V4.1-Flash 正式上线千问 AI 平台,相关 API 服务与 Token Plan 同步开放,开发者可通过 API 接入应用,也能在 Qoder、千问 APP、Codex 等工具中直接调用 Token Plan。
MiniMax Design 接入 GPT-6 Astra,并通过 MCP 直接连接 Blender,把 3D 制作纳入 AI 工作流。演示中不再只用 MiniMax Design 生成影像,而是让 Blender 的 3D 表现一起进入 AI 制作流程。相关尝试仍在测试中。
夕小瑶科技说实测了5款已开放体验的国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 和 8月26日开源的 Zing-0.5,从漫游、导演、联合控制三类能力评估输入还原度、运动一致性、物理合理性与导演表现。
Google DeepMind 团队将修复后的档案照片与姿态控制模型结合,还原 Burt 和 Ethelle 的神态与微表情,再现两人初次相遇的那一天。该片段用于与 PrimordialSoup_ 和 StorySyndicate_ 合作的新纪录片《Love, Rendered》,完整影片已在 YouTube 上线。
MiniMax Design 迎来重大升级,GPT-6 Astra 正式上线,并新增面向 Blender、PS、AE 等工具的 MCP 集成,同时加入协作项目功能。用户可用单条提示词生成 3D 模型,还能把 AI 剪辑片段直接转为可编辑的 AE 工程文件。
Kling AI 发布一支新宣传片,配文“Training season's over. You're the rodeo now.”,原文未披露具体模型版本或功能更新。该内容在 Twitter 上获得 106 次点赞、35 条回复、12 次转发,浏览量约 14.5 万。
MiniMax Design H3 结合 Blender 可生成室内视频场景,通过参照 Blender 搭建的场景,实现以往难以做到的室外到室内无缝转场。创作者 Toshi 表示,先用 Blender 做出一定程度的场景再交给 H3 参照,效果较好,该流程被视为视频制作工作流的更新。
NVIDIA 研究团队与 USC 提出 HorizonRelight,通过将目标域上下文从一个滑动窗口传递到下一个,让各片段衔接更连贯,减少长视频分块重打光时的光照跳变、边界伪影和外观突变。该工作基于扩散模型视频方法,论文与演示已随 ECCV 2026 公布。
Google Gemini 应用现已登陆 Windows,用户可通过 Alt + Space 快捷键随时唤起。该应用支持打磨草稿、总结长文档、头脑风暴创意,以及在常用工具和日常应用旁生成自定义图像和视频。
CCF 与快手联合发布第三期"CCF-快手大模型探索者基金"并启动申报,面向全球学者发布 5 个研究方向共 18 项研究课题,每项课题提供人民币 25 万元资助,申报截止时间为 2026 年 10 月 7 日 24:00(北京时间)。
DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。
DeepSeek 发布 DeepSeek-V4.1-Flash,称其更智能、更快、更高效,是新架构家族中最小的模型。该模型原生支持视觉理解,面向更强能力、更快推理、更高吞吐以及向更大模型扩展而设计。
DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。
GPT-6 Astra 被用于搭建一项医学教育服务,把解剖示意图、CT 切面和 3D 空间关系整合到一个工具中。该服务针对沿用数十年的三个结构性问题:平面解剖图丢失器官深度、CT 横截面难以与整体示意图对应、读片需同时维持患者方位与切面方向等多重心理模型。
NVIDIA 发文说明 Encode-Prefill-Decode(EPD)解耦这一多模态模型推理优化技术:它将视觉编码阶段与 prefill、decode 阶段分离,在图像密集提示词、中短输出和量化 MoE 模型上最有效。配合 NVIDIA Dynamo 使用 EPD 解耦,最高可带来 5 倍加速。
Q2D-Web 数据集覆盖编程、法律、健康、科学、金融以及消费品、旅游、娱乐和本地信息等领域,查询涉及十种语言,其中英语占 65.8%。
Google 将在 Gemini Discord 直播演示 Lyria 3.5 的新创作控制功能,用户可选择音乐时长、流派和人声,还能借助模板快速获取创作灵感。演示定于 9 月 10 日(周四)太平洋时间上午 11:30 举行。
Google DeepMind 的 Peter Battaglia 与 Hannah Fry 在播客中探讨 WeatherNext 3 如何改变天气预报建模与气候应对方式。节目从飓风 Melissa 切入,对比传统模型与 AI 模型,并讨论概率预报及该模型的未来展望。
作者对 Image 2.5 做了多组实测,官方 9 月 8 日发布说明称升级围绕参考图保真、精准局部编辑和多轮修改,并改善光影、材质与复杂指令理解。
HeyGen 在 8 月上线两项更新:面向房地产的 HeyGen for real estate 可将房产经纪人的自有知识转化为市场更新、房源视频和社区导览,全程无需摄像。另一项 edit look 只需对已有数字人重绘一次,此后基于该头像生成的每一条视频都会沿用新形象。
Gemini Live 推出杂物整理功能,用户打开 Gemini Live 后将摄像头对准杂乱区域,即可实时对话讨论如何整理,包括选购收纳用品和查找本地电池回收点。该功能由 Google Gemini App 官方账号发布。
vivo BlueImage Lab 提出 SmartPhotoCrafter,一个统一理解—生成—优化框架,实现"先分析、再决策、后优化"的自动图像优化流程。
开发者新清士以 GPT-6Astra 与 BlenderMCP 生成的蒸汽朋克风城市视频为素材,尝试用 MiniMax H3 转换为线画风格。流程为先用 GPT Image 2.5 将三段截图转成概念图,再以 ComfyUI 加 DepthAnything 将 15 秒视频转 Depth,最后投入 Hailuo 网站并让 Astra 拟定提示词生成视频。
Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。
智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。
HeyGen 展示同一个人用两款不同工具生成的两个 AI 数字人,使用相同脚本和相同音频并排运行。其中一个仍像本人,另一个接近到能被看出、又偏差到让人感觉不对。
Gemini App for macOS 新增 Gemini 3.5 Transcribe,可用语音和屏幕上下文完成更多任务。该功能支持总结本地文件、规划与研究,并用自然语言创建图像。
Google DeepMind 的 AlphaGenome Atlas 团队发布了 AlphaGenome Atlas,一个可搜索的 1-petabyte 数据库,映射人类基因组中全部 90 亿个单字母 DNA 变异的分子效应。该数据库提供统一的 AVI 突变评分,并配套网页门户、AlphaGenome API 以及智能体技能(Agent skill)。
Google DeepMind 宣布 AlphaGenome Atlas 资源面向全球科学界开放,可通过 Atlas 网站与 AlphaGenome API 使用,并已作为技能接入 Google Antigravity,后续还将登陆 Google Cloud。
Weaviate《Building Foundry》最后一集演示如何在不移动或重命名原文件的前提下,为创意素材库搭建可搜索层,结合描述、标签、提取文本与元数据补充上下文。该搜索层支持关键词、语义与混合搜索,搜索“white rabbit in a grassy landscape”可同时召回参考图、预告片片段及相关景观素材,即使文件名完全不含这些词。
Jerrod Lew 演示了 GPT-6 Astra 配合 Blender 生成 3D 模型并对相机运动做关键帧,导出 MP4 后可作为 MiniMax H3 等 AI 视频工具的参考素材。他随后用 Magnific 对输出做进一步处理,成品在 X 上获得超过 5.9 万次浏览。