跳到正文

#多模态

今日 12 条
9月8日周二
  1. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Matt M 用 GPT 6 Astra 与 MiniMax H3 Max 打造 Rhino 3D 树冠场景

    Matt M 用 GPT 6 Astra 生成 Rhino 3D 模型、图像与相机视角,搭建出一个树冠场景,并用 Magnific 与 MiniMax H3 Max 完成渲染。他称这套组合越来越有意思,但自己的 token 已用尽,无法继续生成更多内容。

  2. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT-6 建模 Blender 场景,再经 MiniMax H3 重绘为埃舍尔风格

    Ben Nash 展示了一条工作流:先用 GPT-6 在 Blender 中搭建出 M.C. Escher 经典画作的完整房间 3D 场景并加入反射球,渲染成视频后再由 MiniMax H3 按原始画作风格重新绘制。该演示由 Hailuo AI(MiniMax)转发。

  3. 屠龙之术AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026 AI江湖夜话:谁在上桌、下桌、掀桌,钱又流向了哪?|对话「屠龙之术」庄明浩

    「有点Yi思」第14期邀请「屠龙之术」主理人庄明浩与蚂蚁战投「AGI及支付宝」负责人王盟,复盘2026年AI圈每两月一轮的座次洗牌:Coding、多模态、Agent、价格四张新桌分桌而立。讨论提到美国头部Coding ARR已破10亿美金、Seedance 2.0后情绪面翻转,以及有效成本等于token成本加试错成本与人工纠正。

  4. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 6 在 Blender 中搞定 3D 控制,搭配 Hailuo H3 与 GPT-6 完成视频制作

    GPT-6 直接操作网页版 Hailuo,调用 H3 的 omni 参考与精确视频编辑能力完成整段制作,全程无需 API、在 GPT-6 内即可收尾。流程以 Blender 生成 15 秒拳击参考视频并制作角色与背景参考图,由 GPT-6 设计提示词,最终在 Hailuo 以 2k 16:9 出片,消耗 360 积分。

  5. Greg Brockman(@gdb)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 可从 mel 频谱图零样本识别声音

    Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。

  6. Greg Brockman(@gdb)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 可视化展示 Ozempic 药物作用机制

    用户 Andrew Aiginin 用 GPT-6 Astra 先构建了一个细胞模型,随后让其解释 Ozempic 的作用机制,1 小时后得到可视化结果。他称 GPT-6 Astra 能力极强,并进一步提出能否用其建模 rentosertib 的机制。

  7. Greg Brockman(@gdb)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Astra(Ultra)看视频测量数据,设计零件并一次 3D 打印成功

    用户录制约 4 分钟视频讲解淋浴地漏毛发清理难题并用数显卡尺测量,GPT 6 Astra(Ultra)从中提取语音、将视频帧与测量位置对应,给出改进方案和可交互草图,再通过 computer use 在 Fusion 360 中实时完成参数化零件设计并添加圆角,3D 打印后一次装配成功。

9月7日周一
  1. 深网腾讯新闻AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    华为 Mate XT2 非凡大师发布:首发麒麟9050 Pro,19999 元起

    华为9月7日发布新一代三折叠手机 Mate XT2 非凡大师,首发麒麟9050 Pro 芯片,整机性能较 Mate XTs 提升42%,起售价19999元,比上一代涨2000元。该机改用U型双内折方案并首次加入独立外屏,出厂搭载 HarmonyOS 7 正式版,集成盘古大模型端侧AI能力。余承东透露华为三折叠手机全球发货量已超100万台。

  2. 硅谷101AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    机器人触觉的爆发前夜:五大技术路线、数据困局与模型之争

    机器人触觉传感器目前主要有压阻式、压电式、电容式、光学式和磁感应五条路线,业内认为多传感器结合更适合全身不同部位的需求。其中光学式(视触觉)精度最高,一目科技称其传感器可达24万个感知点,超过人类指尖约12000个神经元,但单指单价仍在千元级。触觉可用训练数据基本为0,真机采集面临三大难题,成本并非现阶段首要障碍,验证路径可行性才是关键。

9月5日周六
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 前端生成能力实测:孩子几轮对话做出「咪咪小镇」

    有用户用 GPT 6 给孩子做「咪咪小镇」项目,给出参考后几轮对话就生成了界面,孩子被界面吸引。室内原本没有 3D 场景,孩子用一句话提出让居民能"现实进去"、每栋楼都要能看到里面,随即也生成了。该帖称 GPT 6 的前端能力比之前强多了。

  2. Paul Couvert(@itsPaulAi)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 音乐生成工具支持钢琴与乐器模板,也可自定义风格

    Google 一款音乐生成工具新增聚焦钢琴与乐器的模板,用户可直接选择预设,也能按自己的风格生成曲目。作者表示预设选项让工作流更简便,并感谢 Google 提供的预览。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Lyria 3.5 并集成进 Gemini

    Google 发布 Lyria 3.5,并集成进 Gemini。作者在预览阶段试用后表示其生成音乐的方式相当易用,提供 24 个可直接使用的模板、对歌词的完整控制以及 17 种风格。

  4. Fei-Fei Li(@drfeifei)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 发布多模态世界模型 Atlas

    World Labs 发布 Atlas,称其为首个多模态世界模型,可生成图像和视频帧,并具备像素级精确的相机控制,还能将这些帧重建成3D。官方描述称其可建模世界、移动相机并模拟空间与时间。李飞飞转发该消息并指向更多 Atlas 内容。

  5. Fei-Fei Li(@drfeifei)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布世界模型 Atlas,用新视角预测统一像素生成与重建

    World Labs 发布面向空间智能的世界模型 Atlas,其核心是新视角预测,并称它是首个统一像素生成与像素重建的模型。团队表示这让数字化采集一个空间三维表示所需的数据量减少 50 到 100 倍,过去一个房间需要 100 到 300 张照片,Atlas 只需三张。

  6. Google AI(@GoogleAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash、Lyria 3.5 与 WeatherNext 3 等模型

    Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。

  7. Google Gemini App(@GeminiApp)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 面向全球用户上线 Lyria 3.5 音乐生成

    Google 宣布 Lyria 3.5 已在网页端 gemini.google.com/music 和 Gemini App 中面向全球所有用户开放。用户在工具菜单中选择 Create music,描述想要的音乐即可生成配乐、品牌短曲或个性化铃声,并可在回复中分享作品。

  8. Google Gemini App(@GeminiApp)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 在 Gemini 中发布 Lyria 3.5 音乐生成模型

    Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型,官方称其为目前最先进的音乐生成模型,带来更丰富的编曲、更具表现力的人声和更高的保真度。用户可以选择音乐流派并选择人声或纯器乐,使用新模板,生成短曲或较长曲目。

9月4日周五
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepLearning.AI 与 Google Cloud 推出免费课程:构建能自我批判迭代的 UI 设计智能体

    DeepLearning.AI 携手 Google Cloud 推出免费新课程,教你构建一个可依据品牌规范自我批判并迭代的 UI 设计智能体。课程指出,单张优质 AI 图像容易实现,但规模化的一致质量本质上是评估问题。

  2. Philipp Schmid(@_philschmid)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 多模态任务实用性获赞,图像推理与数据提取排第一

    Gemini 3.8 在多模态任务上的真实世界实用性被评价为无可匹敌,Gemini 3.8 Flash 被称为新的最爱 Gemini 模型。其在图像推理和数据提取上排名第一,目标检测排名第二,速度比 Gemini 3.7 Flash 快 30%。

  3. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 在 Blender 中快速生成 3D 模型

    用户 Vaibhav.Gen 展示了用 MiniMax H3 在 Blender 中制作 3D 模型的效果,并称其"效果非常好"。该演示由 @aimikoda 的灵感启发,相关推文获得 463 个点赞和逾 4.5 万次浏览。

  4. andrew chen(@andrewchen)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 一周内在 Unreal Engine 构建曼哈顿世界

    GPT-6 Astra 用一周时间在 Unreal Engine 中构建出一座曼哈顿城市场景,并能逐条街道精细打磨每个细节。这条演示由 Matt Shumer 发布,被评论者称为「GTA7 is gonna be sick」。

  5. NotebookLM(@NotebookLM)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 短视频概览全球上线:新增 70+ 语言与 3 种英语变体

    NotebookLM 的短视频概览(Short Video Overviews)国际扩展已在网页端 100% 向所有用户推出,移动端即将上线。此次新增 70+ 种语言和 3 种英语变体,用于生成短视频内容。

  6. Google AI(@GoogleAI)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,预测能力比 WeatherNext 2 精细最多 5 倍。

  7. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini-Omni-1.1-Flash 上线 Poe,支持文本、图像或视频生成

    Gemini-Omni-1.1-Flash 已在 Poe 上线,这是 Google 的多模态视频模型,可从文本、图像或视频生成内容。它支持延长场景、在首帧与末帧之间插值,以及用自然语言编辑,Poe 给出入口 poe.com/Gemini-Omni-1.

9月3日周四
  1. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 提示词:一张参考图生成"从零手工制作"幕后视频

    MiniMax H3 新增一段可复用的提示词,能把任意参考图像转成"从零手工制作该主体"的幕后创作视频,参考图只定义成品外观、比例、材质与颜色,忽略背景和光线。视频从空工作台开始,用固定前四分之三俯视视角,0-14 秒以加速延时呈现,全程同一双手左右手保持一致、同时最多出现两只手。作者 Kōda 称已用自己的头像测试,该提示词适用于任意主体。

  2. 十字路口CrossingAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对卷卷的3小时访谈:从抖音到AI 3D、成为制造业OS的野心,以及基础模型不会吞噬一切

    数美万物创始人任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍公司最新发布的 Hi3D 3.0 2048³ 模型。他将数美万物的目标从 Maker OS 推向「制造业 OS」,认为基础模型不会吞噬一切——进入实体制造后仍需能产出「生产级」3D 资产的模型,以及拆件、加连接结构、适配材料设备等后续环节。

9月2日周三
  1. Google AI Developers(@googleaidevs)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 用 ThreeJS 在 Google AI Studio 生成 3D 硬件拆解可视化

    Gemini 3.8 Flash 面向复杂推理打造,Google 用它与 ThreeJS 在 Google AI Studio 搭建了一个交互式 3D 可视化工具。该模型能生成比例真实的硬件拆解图,自动将设备分解为多个图层,用户可通过拆解滑块逐层展开查看。

  2. Google AI(@GoogleAI)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash,主打智能体与多步骤任务

    Google 发布 Gemini 3.8 Flash,定位为面向复杂智能体和多步骤任务的最智能主力模型,在推理上有明显提升,可处理模糊且高摩擦的任务并参与复杂项目。3.8 Flash 提供一贯的 effort 控制,让任务所需的思考量与 tokens 消耗成比例。官方演示中,它结合原生视频理解与高级编码,在 @antigravity 中自主构建 3D 游戏、试玩找错并在智能体循环中执行代码修改。

  3. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax-H3 被改造为世界模型 H3-World

    Hailuo AI 转述团队工作 H3-World,称其首次把 MiniMax-H3 本身变成世界模型,无需新增动作模块,直接把 H3 预训练的语言理解转换为角色与镜头控制,仅用 8K 样本和 0.199% 可训练参数。团队表示,最值得关注的不只是 H3 也能成为世界模型,而是所需新增的部分极少,并给出论文与项目主页链接。

  4. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者用 Hailuo AI 打造生成式视频课堂:Tung Tung Tung Sahur 实时讲解任意概念

    开发者基于 fal H3 Max 构建了一个生成式视频课堂,输入任意概念即可在几秒内生成由 Tung Tung Tung Sahur 讲解的动画解说视频。用户可在观看时排队新视频并追问,课程时长不受限制。演示中 Triple T 讲解了核能原理。

  5. Fei-Fei Li(@drfeifei)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:带空间上下文的相机条件世界模型可广泛用于机器人 real2sim

    李飞飞回应 Jim Fan 关于 World Labs 的讨论时表示,带空间上下文的相机条件世界模型(camera conditioned world model)有大量横向用途,包括用于机器人领域的 real2sim。

  6. NotebookLM(@NotebookLM)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 短视频概览支持 70+ 语言

    NotebookLM 的 Short Video Overviews 现已支持 70+ 种语言,并新增 3 种英语变体,可将来源材料转成约 60 秒的竖屏视频。该功能面向 Ultra 和 Pro 用户,正在 Web 和移动端陆续推送。

  7. Mike Krieger(@mikeyk)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mike Krieger 让 Claude 自制人脑交互模型,还原"递盐"听觉处理过程

    Mike Krieger 让 Claude 构建了一个人脑交互模型,模拟听到"could you pass the salt?"时大脑的处理过程。该模型未借助任何外部素材,由 Claude 自行推理出相关解剖结构,可在 claude.ai/code/artifact 试用。

  8. Alex Albert(@alexalbert__)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.1 用代码生成视频:从地块照片到房屋设计与电影级漫游

    Fable 5.1 能通过代码生成视频。给它一张地块照片,它便为该地块设计房屋、完成渲染,并输出一段电影级漫游视频。该帖由 Alex Albert 发布,获 8620 次点赞。

  9. Patrick Loeber(@patloeber)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 推出智能体视频理解,token 消耗降低最多 88%

    Gemini 推出智能体视频理解能力,让 Gemini 调用工具并动态分析视频。官方称该方式最多降低 88% 的 token 消耗,成本最多降低 66%,并配套发布了开发者指南。

  10. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini API 推出 Agentic Video,长视频处理 token 消耗最高降低 88%

    Google 的 Logan Kilpatrick 宣布 Gemini API 推出 Agentic Video,一种处理长视频的新方式,可将 token 消耗最高降低 88%,同时提升质量。该功能可在 API 中按单个视频单独控制,并在 3.7 Flash 等最新模型上提供。

  11. Google AI Developers(@googleaidevs)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 支持智能体视频理解

    Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 现已支持智能体视频理解,即日起可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上处理视频上传和 YouTube 视频。更多细节见官方博客。

  12. Google AI Developers(@googleaidevs)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 用智能体视频理解能力数掌声

    Gemini 3.7 Flash 借助新的智能体视频理解能力,能准确识别并数清每一次拍手。由于静态处理默认以固定 1 FPS 读取视频,拍手这类瞬间动作容易被漏掉或与响指、点击声混淆,新能力会按需自动调整处理速度。

  13. Philipp Schmid(@_philschmid)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 视频理解转为智能体模式,长视频 token 最多降 88%

    Gemini 的视频理解改为智能体方式,可自行在时间轴上迭代导航,决定看什么内容、选择帧率,并判断回答提示词是否需要语音转录、音频或视觉帧。官方给出的结果是长视频最多减少 88% 的 token、成本降低 66%,基准准确率提升约 7%。

  14. Fei-Fei Li(@drfeifei)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 发布多模态世界模型 Atlas

    World Labs 发布多模态世界模型 Atlas,称其为首个从零训练的多模态世界模型,支持像素级精确的相机控制生成画面。Atlas 可从单张输入图像重建大场景,通过重构视频模拟时空,并能从一张或多张图像原生输出 3D 空间、将多张位姿图像合成为一致的 3D 世界。团队称其可应用于 VFX 和机器人等领域。