跳到正文

#视频

今日 0 条
10月9日周五
  1. 国际大厂AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    英伟达 Physis-Lang:让自然语言成为世界模型的物理表征,增强视频物理真实性

    英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。

  2. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LIFT:大视角变化下通过 On-Policy 自蒸馏实现 Layout-In-Future 视频生成

    LIFT 提出一种 Layout-In-Future 视频生成方法,在大视角变化条件下通过 On-Policy 自蒸馏实现生成,论文已发布在 Hugging Face Papers。

10月7日周三
  1. 机器之心AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈工大(深圳)与 NUS 提出 QuantWM:免训练 2-bit KV Cache 量化,视频世界模型压缩最高 6.20 倍

    哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。

10月5日周一
  1. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Rollout-Marginal Distillation:面向长时长自回归视频生成的论文发布

    论文《Rollout-Marginal Distillation for Long-Horizon Autoregressive Video Generation》已在 Hugging Face Papers 上线,提出用于长时长自回归视频生成的 rollout-marginal 蒸馏方法。原文未披露具体模型、参数规模或 benchmark 分数,仅给出论文链接与演示视频。

10月3日周六
  1. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 多奖励优化

    论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。

10月1日周四
  1. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LongLive-Plug:面向视频生成的一次性通用蒸馏

    LongLive-Plug 提出一种面向视频生成的“plug once-for-all”蒸馏方法,论文已发布在 Hugging Face Papers。该方法主打一次蒸馏即可通用适配,具体加速倍数与评测结果原文未披露。

9月30日周三
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 发布 Physis-Lang:为视频世界模型补上物理推理

    NVIDIA 研究人员发布开源自进化框架 Physis-Lang,通过为视频描述加入物理解释来提升世界模型的物理推理能力。仅将物理推理加入提示词、不做重训练,NVIDIA Cosmos 3 的 PhyGenBench 分数即提升 5.62 分。论文与项目已上线。

9月22日周二
  1. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorldCrafter:带隐式 3D 感知记忆的一致性视频世界模型

    WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。

  2. HeyGen(@HeyGen_Official)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HyperFrames 与 Google DeepMind、Kaggle 联合推出 Code2Video Bench,衡量代码生成视频质量

    HyperFrames 联合 Google DeepMind 和 Kaggle 推出 Code2Video Bench,用于衡量模型生成的代码能否渲染成值得观看的视频。该基准指出,SWE-bench 意义上的代码能力与"代码转视频"是两回事,目标是让前沿实验室在智能体视频任务上取得进展。

9月15日周二
  1. AK(@_akhaliq)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vidu S2:实时交互、可编辑与空间视频生成

    Vidu S2 支持实时交互、可编辑与空间视频生成,论文已发布在 HuggingFace Papers(2609.11…)。该工作将交互式编辑与空间视频生成能力整合到同一视频生成框架中。

9月11日周五
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 与 USC 提出 HorizonRelight,解决长视频重打光的光照跳变问题

    NVIDIA 研究团队与 USC 提出 HorizonRelight,通过将目标域上下文从一个滑动窗口传递到下一个,让各片段衔接更连贯,减少长视频分块重打光时的光照跳变、边界伪影和外观突变。该工作基于扩散模型视频方法,论文与演示已随 ECCV 2026 公布。

9月2日周三
  1. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax-H3 被改造为世界模型 H3-World

    Hailuo AI 转述团队工作 H3-World,称其首次把 MiniMax-H3 本身变成世界模型,无需新增动作模块,直接把 H3 预训练的语言理解转换为角色与镜头控制,仅用 8K 样本和 0.199% 可训练参数。团队表示,最值得关注的不只是 H3 也能成为世界模型,而是所需新增的部分极少,并给出论文与项目主页链接。

6月12日周五
  1. 哔哩哔哩技术AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站 Index LLM 团队开源 CASTER:让 AI 像观众一样评估 UGC 视频

    哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。

3月21日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 Dream2Flow:用 3D 物体流连接视频生成与机器人控制

    斯坦福李飞飞团队发布 Dream2Flow,用 3D 物体流(3D object flow)打通视频生成与机器人控制,实现开放世界机器人操作。该方法以物体为中心的空间信息作为表征,旨在提升泛化能力,相关工作将亮相 ICRA 2026,项目主页为 dream2flow.github.io。