Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,通过原生视频工具动态搜索、扫描目标片段,替代固定帧率的静态处理方式。
为什么值得看
原文给出 token 与成本降幅及基准表现,读者可据此判断长视频分析的落地成本变化。
AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,通过原生视频工具动态搜索、扫描目标片段,替代固定帧率的静态处理方式。
原文给出 token 与成本降幅及基准表现,读者可据此判断长视频分析的落地成本变化。
MiniMax 将 H3 Max 768P、H3 Max 480P 接入开放平台和 MiniMax Design,该模型生成 5 秒 768p 音视频不到 3 秒,15 秒视频约 15 秒完成,吞吐量约为 MiniMax H3 的 35 倍。
H3 Max 把 5 秒 768p 音视频生成压进 3 秒内,读者可据此理解实时直播这类新场景的门槛变化与并发限制。
阿里视频生成模型Wan3.0于8月24日正式上线,单次可生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,在生成时长、参考一致性和真实世界还原等维度升级。
原文给出Wan3.0的时长、文档输入与API定价,读者可据此判断它在短剧、广告等生产流程中的落地成本。
MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。
H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。
MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。
MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。
Meta Superintelligence Labs 发布其首个媒体生成模型 Muse Image,并预览 Muse Video。Muse Image 以智能体方式运行,调用搜索和编码工具,能自我改进并随测试时算力扩展而提升,已上线 Meta AI 应用、meta.ai、美国 Instagram Stories 及部分国家的 WhatsApp。
Meta Superintelligence Labs 首发的图像生成模型,其智能体式工具调用与推理时算力扩展为图像生成提供了新范式。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
官方给出两款新模型的价格、延迟与定位差异,读者可据此判断图像到视频链式工作流的成本与适用边界。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频内容。
Google 把 Gemini 的推理与世界知识接入视频生成,读者可据此判断多模态创作工具的能力边界。