Gemini 推出智能体视频理解,token 消耗降低最多 88%
Gemini 推出智能体视频理解能力,让 Gemini 调用工具并动态分析视频。官方称该方式最多降低 88% 的 token 消耗,成本最多降低 66%,并配套发布了开发者指南。
Gemini 推出智能体视频理解能力,让 Gemini 调用工具并动态分析视频。官方称该方式最多降低 88% 的 token 消耗,成本最多降低 66%,并配套发布了开发者指南。
Google 发布 agentic video 主题的 launch blog,并称 Gemini 在视频理解上继续保持 SOTA。该帖子引导读者前往 blog.google 阅读更多内容,并呼吁继续提供反馈。
Google 的 Logan Kilpatrick 宣布 Gemini API 推出 Agentic Video,一种处理长视频的新方式,可将 token 消耗最高降低 88%,同时提升质量。该功能可在 API 中按单个视频单独控制,并在 3.7 Flash 等最新模型上提供。
Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 已支持智能体视频理解,即日起可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上传视频及处理 YouTube 视频。更多细节见官方博客。
Gemini 3.7 Flash 借助新的智能体视频理解能力,可自动调整处理速度,准确识别并统计每一次拍手,解决了静态处理默认 1 FPS 下瞬间动作易被漏掉或与打响指、点击混淆的问题。该能力针对快速动作计数的难点,展示了模型按需调节视频处理速度的方式。
Gemini 的视频理解改为智能体方式,可自行在时间轴上迭代导航,决定看什么内容、选择帧率,并判断回答提示词是否需要语音转录、音频或视觉帧。官方给出的结果是长视频最多减少 88% 的 token、成本降低 66%,基准准确率提升约 7%。
Google DeepMind 为最新 Gemini 模型引入智能体视频理解能力,模型分析视频的准确率提升,token 用量最多减少 88%。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,通过原生视频工具动态搜索、扫描目标片段,替代固定帧率的静态处理方式。
原文给出 token 与成本降幅及基准表现,读者可据此判断长视频分析的落地成本变化。
演员、AI 创业者吴汉坤在播客中表示,AI 难以模拟喜剧等毫秒级节奏的表演,真人演员的微表情、情绪停顿和设计性「破绽」是 AI 无法精准调控的。他用 Kling 2.0 等工具独立完成《粉丝悖论》《人口异常》两部 AI 短片的全流程制作,并开发了智能体 Verdict AI,认为亲身实践是消解「被取代」焦虑的最好方式。
HeyGen 官方账号发布了一条指向 x.com 文章的链接,未在推文中说明具体内容。该帖获 4 条回复、5 次转发、42 个赞和 5528 次浏览。
开发者苏打白使用腾讯 Hy4 preview 制作了《清明上河图》动画效果,并称在相同提示词下效果优于 GLM5.3-flash。
关于 AI 时代后的游戏开发路径,a16z 的 Andrew Chen 认为只有两条路:three.JS 或世界模型。他引用数据称 three.js 每周 npm 下载量达 1500 万次。
MiniMax 将 H3 Max 768P、H3 Max 480P 接入开放平台和 MiniMax Design,该模型生成 5 秒 768p 音视频不到 3 秒,15 秒视频约 15 秒完成,吞吐量约为 MiniMax H3 的 35 倍。
H3 Max 把 5 秒 768p 音视频生成压进 3 秒内,读者可据此理解实时直播这类新场景的门槛变化与并发限制。
Replicate 宣布 Wan 3.0 本周末限时半价,用户可通过 replicate.com/alibaba/wan-3 直接使用。该模型页面归属 alibaba,优惠仅限周末。
Gemini Omni 1.1 Flash 现可让你从视频结束的位置继续延展,把在 Gemini 中创作的视频无缝接续,构建连贯、动态的故事线。该功能由 Gemini App 官方账号公布。
HeyGen 展示如何从电影感开场无缝过渡到有实质内容的市场更新风格视频。它把开场定位为抓住注意力的钩子,再接入真实信息主体。官方称这类日更内容能积累信任其内容的受众,指南可在评论区索取。
Google 本周发布 Gemini 3.5 Transcribe,官方称其为目前最精准的语音转文字模型,主打智能转录。同时发布 Gemini Omni 1.1 Flash,为视频生成与编辑带来更多创作能力和控制选项。
Google DeepMind 正在推出 Gemini Omni 1.1 Flash,目标是让生成视频具备更高的可控性、更快的迭代速度,并更精细地适配生产级使用。官方表示可在 Flow by Google 等入口试用,并附有详情链接 goo.gle/4zHEzJ2。
Kling AI 发布八月创作者精选,主题为"平行世界的你会是谁",用想象力把观众带到新的地方。该内容在 Twitter 上获得 15 条回复、9 次转发、122 个赞和 359129 次浏览。
HeyGen 称 Ryanair 团队对其视频翻译功能给出 10/10 评价。相关推文展示了 Ryanair 集团 CEO Michael O'Leary 对西班牙部长 Puente 的回应视频。
Gemini 面向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放场景延展(Scene extension)功能。用户在工具菜单中选择“Create video”,创建或上传视频后,可让 Gemini 按指定后续情节“extend the scene”延展场景。
Gemini Omni 1.1 Flash 新增场景延展能力,用户可创建或上传视频后让 Gemini 从画面中断处继续续写,从而生成更长的故事或分叉出新的创作方向。该功能由 Google Gemini App 公布。
HeyGen 展示了如何从电影感开场无缝过渡到有实质内容的市场更新风格视频。其认为电影感开场是抓住注意力的钩子,而这类日更内容能积累信任你的受众。原文未披露具体模型、参数或价格信息。
Google Flow 迎来升级:Gemini App 中新增场景延展(Extend scenes)功能,面向所有 Google AI Plus、Pro 和 Ultra 订阅用户全球滚动推出。用户可直接在 Google AI Studio 中构建,并在 Gemini Enterprise Agent Platform 上部署。
Google DeepMind 推出 Gemini Omni 1.1 Flash,面向视频生成与编辑的多模态模型,已在 Replicate 上线。该版本支持首尾帧插值、延长场景、添加视频输入参考、最高 4K 放大,并可用 360p 快速验证创意。
Google Omni 从首次发布到将用户喜爱的 Veo 功能融入 Omni 模型,经历了大量工作。团队表示未来 Omni 版本还有更多内容正在打磨,并继续征求反馈。
Google 发布 Gemini Omni Flash 1.1,这是对其 anything in, anything out 世界模型的更新。新版本支持 360p 草稿与 4K 上采样、延长时最多 10 秒视频上下文、以 10 秒为单位递增的视频延展,以及视频参考功能。
Google AI Studio 推出 Gemini Omni 1.1 Flash,为开发者带来一组新的创意控制与生成式视频能力:可延长场景以支持更长叙事、指定首帧和末帧、以 360p 更高效地草稿视频,并可放大到 4K 分辨率,还支持在多模态输入中加入视频参考。该模型现可通过 Gemini API 和 AI Studio 使用。
Google Flow 即将加入场景延展(scene extension)功能。Gemini App 中的场景扩展正向所有 Google AI Plus、Pro 和 Ultra 订阅用户全球推送,同时支持在 Google AI Studio 中直接构建,并可部署到 Gemini Enterprise Agent Platform。
Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供生成式视频的创作控制能力,通过 Gemini API 和 Google AI Studio 使用。
Kling AI 发布一段短视频,画面围绕婚礼场景展开,文案以“Till death do us part? Not for this guy”点出反转让誓言落空。原帖由 Kling AI 官方账号发布,互动数据为 12 条回复、6 次转发、94 次点赞、119814 次浏览。
阿里 Wan-3 现已在 Replicate 上线,可通过 replicate.com/alibaba/wan-3-… 试用。该模型由阿里发布,具体参数与版本信息尚未在原文中披露。
Replicate 上线阿里 Wan 3.0 的加速版本 Wan 3.0 Prime,支持文生视频、图生视频和参考驱动工作流。该版本可一次性生成最长 30 秒的片段,并集成音视频一体化生成。
Kling AI 发布预热内容"Welcome to a World You've Never Seen",配有一段视频,但正文未透露具体产品、模型版本或发布时间。该帖在 Twitter 上获得 236 个点赞、30 条回复、11 次转发和 163128 次浏览。
Fish Creative 现已上线 Seedance 2.5,可将创意直接生成为 30 秒带音频的视频。该功能在 Fish Creative 平台 Live now,官方以"创意的兔子洞更深了"宣传此次更新。
LiveAvatar 取消并发限制,不再是提高上限而是彻底移除,同一 API 可同时运行 1 个或 10000 个数字人。规模化使用下全身 1080p 输出低至每分钟 0.01 美元。有大规模需求的用户可通过 liveavatar.com/contact-sales 联系销售。
Sundar Pichai 在访谈中预测,3 年后任何内容都能从任意模态转换到任意模态,消费者自选形式,创作者只提供想法、品牌与个性。他认为今天的技术回头看会像翻盖手机一样原始,并称当人人都能生产内容时,数量不再构成优势,专注质量才是创作者胜出的关键。YouTube 新政策针对的是低质内容(slop)而非 AI 本身。
前央视纪录片总导演、现即梦AI超级创作者抽象仔XEIIZO在《三五环》回顾转型:他因一条侃爷相关AI视频获几十万播放入局,凭《大东北福音版》拿到几千万播放,后用模型能力升级完成《新鸳鸯蝴蝶梦福音版》,国内下架后在海外自发出圈。
阿里 Wan 3.0 已在 Replicate 上线,可生成原生 30 秒一镜到底、带同步音频的视频,目前限时 30% off(7 折)。模型页面为 replicate.com/alibaba/wan-3。