为什么大家都对 Opus 生成的视频如此着迷
针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。
针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。
Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。
Vidu 发布旗舰视频模型 Q4 的首个预览版本 Q4 Preview,最高支持 4K 直出,最多可输入 15 张参考图,并支持 3 段参考音频统一音色。SaaS 侧 Preview 阶段提供两个月限时优惠,最低 0.09 元/秒起,官方称一个 10s 视频的创作成本首次可以低至不到一块钱。
Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。
Kling AI 展示创作者使用 Kling 4.0 和 Kling 4.0 Flash 制作的作品,主打新想象、新故事与新创作方式。官方同步放出演示视频,并附上 X(Twitter)原帖链接。
外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。
Kling AI 展示了创作者使用 Kling 4.0 和 Kling 4.0 Flash 生成的作品,强调新的想象、新的故事与新的创作方式。两条模型版本号分别为 Kling 4.0 与 Kling 4.0 Flash,配以 #Kling4 与 #klingai 话题发布。原文未披露参数规模、benchmark 分数或开放方式等细节。
作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。
Fable 5.5 即将发布,演示显示其能在连续动画中保持不同艺术风格,被形容为"超人"。相关推文由 Chetaslua 发布,并称这标志着"超级智能时代"的到来。
Tavus 的 Griffin 上线 Replicate,号称首个通过视频图灵测试的模型:48% 与其实时对话的人认为对方是真人,而此前系统通过率低于 3%。Griffin 被称作首个 Human Interaction Model(HIM),并在 NVIDIA 全双工 AI 视频基准上排名第一。
Umesh 提前获得 Kling 4.0 Flash 的早期访问权限,并在首次试用中称其提示词理解能力出色。该反馈由 Kling AI 官方账号转发,附带展示效果的视频。
可灵 Kling 4.0 满血版生成的短片曝光,相比 Flash 版本具备原生 30 秒直出、画面与声音更清晰、口型匹配更精准、21:9 电影画幅等能力。该版本将于 10 月上线,短片由内测用户使用可灵 AI 邀约额度制作。
影溯科技发布并上线新一代世界模型 InSpatio-World 1.5,支持单图、多图、全景图和视频等不同输入,强化实时场景探索与时空一致性,并已开放试用与开源代码,同时即将邀测世界模拟器 Topos-Pro 1.0。
GPT 6.1 Sol 发布,缓存价格下降 50%。作者提到其能力不如 Opus 5.5,但价格更低;并补充称近期流行的动效视频 Luna 也能制作。
Physis-Lang 搭配 NVIDIA Cosmos 3 Super 和 Nano 在 Physics-IQ Verified 图生视频(image-to-video)排行榜上分列第 1 和第 2 名。该基准测试衡量生成视频对真实世界物理规律的遵循程度,完整排名见 physics-iq-verified.anates.ai/?track=i2v。
Claude 官方账号展示了一组对比:给 Sonnet 5 与 Sonnet 5.5 同一个提示词,分别用 JavaScript 生成不到一分钟讲完恐龙史的动画,由 @kevin_t_ngo 创作。该演示发布在 Twitter 上,获得 693 个点赞、23 次转发和约 28 万次浏览。
PrunaAI 的视频模型 P-Video-2-Pro 已在 Replicate 上线,包含 Quality 与 Speed 两个版本,基于 MiniMax H3。两版在 Design Arena 图生视频榜单以 1325 Elo 并列第 2,Quality 生成耗时 8.0 秒,Speed 为 4.5 秒。
Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年费订阅用户上线。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。
Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。
新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。
原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。
Runway 发布帧插值模型 Enhance Frame Rate,可将任意素材转换为所需帧率规格,支持 25、30、48、60、120 fps 以及 NTSC 的 59.94 标准。用户可通过官方链接开始使用。
World Labs 发布 Atlas,称其为首个多模态世界模型,可生成图像和视频帧,并具备像素级精确的相机控制,还能将这些帧重建成3D。官方描述称其可建模世界、移动相机并模拟空间与时间。李飞飞转发该消息并指向更多 Atlas 内容。
Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。
MiniMax 发布 H3 Max Turbo 预览版,这是 H3 Max 的更快、更省成本版本,运行速度为 H3 Max 的 2 倍、成本减半,同时在自家评测中达到原版 H3 Max 质量表现的第 97 百分位,并仍优于 H3 及其他视频模型。该版本保留 H3 Max 的提示词理解、美学和整体质量,生成时间减半;促销价下 768p 视频为每秒输出 0.01 美元,促销期持续两周。
Gemini 3.7 Flash 借助新的智能体视频理解能力,可自动调整处理速度,准确识别并统计每一次拍手,解决了静态处理默认 1 FPS 下瞬间动作易被漏掉或与打响指、点击混淆的问题。该能力针对快速动作计数的难点,展示了模型按需调节视频处理速度的方式。
Google DeepMind 为最新 Gemini 模型引入智能体视频理解能力,模型分析视频的准确率提升,token 用量最多减少 88%。
Gemini Omni 1.1 Flash 现可让你从视频结束的位置继续延展,把在 Gemini 中创作的视频无缝接续,构建连贯、动态的故事线。该功能由 Gemini App 官方账号公布。
Google DeepMind 正在推出 Gemini Omni 1.1 Flash,目标是让生成视频具备更高的可控性、更快的迭代速度,并更精细地适配生产级使用。官方表示可在 Flow by Google 等入口试用,并附有详情链接 goo.gle/4zHEzJ2。
Google DeepMind 推出 Gemini Omni 1.1 Flash,面向视频生成与编辑的多模态模型,已在 Replicate 上线。该版本支持首尾帧插值、延长场景、添加视频输入参考、最高 4K 放大,并可用 360p 快速验证创意。
Google Omni 从首次发布到将用户喜爱的 Veo 功能融入 Omni 模型,经历了大量工作。团队表示未来 Omni 版本还有更多内容正在打磨,并继续征求反馈。
Google 发布 Gemini Omni Flash 1.1,这是对其 anything in, anything out 世界模型的更新。新版本支持 360p 草稿与 4K 上采样、延长时最多 10 秒视频上下文、以 10 秒为单位递增的视频延展,以及视频参考功能。
Google AI Studio 推出 Gemini Omni 1.1 Flash,为开发者带来一组新的创意控制与生成式视频能力:可延长场景以支持更长叙事、指定首帧和末帧、以 360p 更高效地草稿视频,并可放大到 4K 分辨率,还支持在多模态输入中加入视频参考。该模型现可通过 Gemini API 和 AI Studio 使用。
Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供生成式视频的创作控制能力,通过 Gemini API 和 Google AI Studio 使用。
Replicate 上线阿里 Wan 团队的 Wan 3.0,称其可原生生成 30 秒单镜头视频并带同步音频。该内容为转载的模型上线信息,未给出更多参数、定价或开放范围细节。
阿里视频生成模型Wan3.0于8月24日正式上线,单次可生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,在生成时长、参考一致性和真实世界还原等维度升级。
原文给出Wan3.0的时长、文档输入与API定价,读者可据此判断它在短剧、广告等生产流程中的落地成本。
MiniMax H3 技术团队在周五晚的 Reddit AMA 和 ComfyUI Live 直播中,回应了模型架构、长视频续写、画质局限与后续开源计划等问题。
黑森林实验室的 FLUX 3 Video 已在 Replicate 上线,该多模态模型覆盖视频、音频、图像和动作预测,本次先放出视频能力。它支持生成最长 20 秒、最高 1080p 的视频,具备原生音频、文生视频、多帧图生视频、视频续写和多语言对话,并提供 Draft 模式以更低成本快速试想法,可通过 API 或常用工具使用;2K、4K 和开放权重版本即将推出。