Runway 推出 Project Continuum:围绕实时视频界面的操作系统研究应用
Runway 旗下 runwayml_labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示 Portals、Visual Thinking、Responsive Video Interfaces、Interactive Worlds 四种与电脑交互的新方式。
Runway 旗下 runwayml_labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示 Portals、Visual Thinking、Responsive Video Interfaces、Interactive Worlds 四种与电脑交互的新方式。
Perplexity Computer 现已集成 Seedance 2.5,营销与品牌团队可在其中为小企业生成商业或品牌视频,品牌视觉、产品样机和完整视频剪辑全部在 Computer 内完成。
Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。
官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。
MiniMax H3 为 MINIMA 打造的新 MV《くさらび》发布,配乐由 SunoV6 与 SunoV4.5+ 混音而成。该作品为 CapCut AI Creative Award 参赛作品,标注 CapCutCPP AIFJ2026。
MiniMax 上线首个 Flash 模型 M3.1-Flash-Preview,目前为预览版,未正式发布也未公布 benchmark,规格为 100 万 token 上下文、原生多模态,深度思考分 low 到 max 五档,默认 max。
有人用 Opus 5.5、Gemini 2.5 Flash、SAM 3.1 和 Ideogram 4.5 组成一套技术栈,分别负责界面、照片分类、图像分割和编辑,全部通过一个 fal API key 跑通,并称过去这需要一整支工程团队才能完成。
LEGO-Anything 提出用编码智能体(Coding Agents)做 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36)。该工作把 3D 场景重建任务交给编码智能体完成,具体方法与实验结果见论文原文。
Runway AI Summit 正在旧金山举行,Runway 联合创始人兼联合 CEO Anastasis Germanidis 以主题演讲开场,提出通用世界模拟器将成为我们时代最重要的技术发展。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。
NVIDIA AI 将于明天太平洋时间上午 9 点直播,演示如何用单个提示词构建一个视觉 AI 智能体,并在 YouTube 上开放提问。
Manus 推出 Manus Game Dev,可将一个想法直接转化为 3D 赛车游戏,游戏中的赛车由合作方 Tripo AI 生成的 3D 模型充当。该能力通过 Manus 官方账号演示发布。
Runway 发布 Praxis-1,一个开放权重的世界动作模型(World Action Model),把其在视频预训练上的积累用于机器人真实世界控制。该模型基于大规模视频预训练和实时基础设施构建,定位为可跨任意具身形态与环境的策略模型,面向机器人开发者和研究者。
NVIDIA 发布教程,演示如何用 NVIDIA VSS Blueprint 3.3 新增的 Build Vision AI 技能,仅凭一条提示词就在 30 分钟内为制造产线构建并部署视觉 AI 智能体。该智能体具备告警、视频搜索和事件报告功能。
Ideogram 4.5 与 GPT Image 2.5 Sunburst、Nano Banana Pro、Nano Banana 2 进行了同一组编辑的逐轮对比。Ideogram 4.5 在多次编辑后仍保持画面干净,而 GPT Image 与 Nano Banana 的输出在几轮编辑后就变得不可用。
可灵 Kling 4.0 满血版生成短片曝光,相比 Flash 版本,支持原生 30 秒直出、画面与声音更清晰、口型匹配更精准,并提供 21:9 电影画幅。该版本将于 10 月上线。
在2026网易未来大会上,灵初智能陈源培、OriginFlow秦深涛、万格智元王冠博三位00后创业者对话,谈具身智能落地瓶颈从算法转向算法工程化,创业公司真正的"死亡谷"在50到150人之间,端侧AI可用4G内存推理35B模型、10G内存推理80B模型。
美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。
影溯科技发布并上线新一代世界模型 InSpatio-World 1.5,支持单图、多图、全景图和视频等不同输入,强化实时场景探索与时空一致性,并已开放试用与开源代码,同时即将邀测世界模拟器 Topos-Pro 1.0。
MiniMax 于 9 月 27 日在 MiniMax Code 上线 M3.1-Flash-Preview,1M 上下文,原生支持文字、图片、视频输入,思考强度五档可调,主力场景是 Coding。
2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。
NVIDIA 研究人员发布开源自进化框架 Physis-Lang,通过为视频描述加入物理解释来提升世界模型的物理推理能力。仅将物理推理加入提示词、不做重训练,NVIDIA Cosmos 3 的 PhyGenBench 分数即提升 5.62 分。论文与项目已上线。
Dextac-WAM 项目网站新增真机演示、世界模型预测、触觉可视化、消融实验与详细说明,网址为 dextacwam.github.io。
Berkeley AI 人类智能中心发布 DexTacWAM,一个将预训练视频世界模型通过持续视触觉学习改造而成的视触觉世界-动作模型,用于多指接触预测与动作生成。
微软研究院启动早期研究项目 Quine,旨在构建生物学的多模态世界模型,打通不同生物尺度和模态间的洞察。Quine 帮助科学家以计算方式搜索远超直觉范围的假设空间,并在进入实验室前对假设排序;实验结果再作为反馈,帮助研究者校准后续研究方向。
OpenAI 9/22 上线 GPT-6 Sol 和 Luna,Sol 定价 $2/$10 MTok 约为 GPT-5.6 一半,DeepSWE 68.8%,Luna 定价 $0.10/$0.50 MTok、单任务成本约 Sol 的 1/5。
Perplexity 的 Aravind Srinivas 演示了 Computer(Standard Mode 搭配 Opus 5.5)端到端设计并构建一款浏览器端开放世界游戏,过程中自行租用 GPU、运行 headless Blender、做程序化设计、联网下载素材并设计音频,成本约 2000 美元额度。
微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。
Anthropic 的 Opus 5.5 靠纯代码生成品牌宣传片、像素动画,还能操控电脑画图,与 GPT-6 的 Sol 和 Luna 同周发布后,热度持续一周不退。
Claude 发布 Sonnet 5 与 Sonnet 5.5 的弹跳球物理测试对比,两者使用来自 @forwardeditor 的同一提示词生成。结果以视频形式在 Twitter 展示,该帖获得 234 次点赞和约 10 万次浏览。
Claude 官方账号展示了一组对比:给 Sonnet 5 与 Sonnet 5.5 同一个提示词,分别用 JavaScript 生成不到一分钟讲完恐龙史的动画,由 @kevin_t_ngo 创作。该演示发布在 Twitter 上,获得 693 个点赞、23 次转发和约 28 万次浏览。
@measure_plan 用代码实时渲染出森林树冠间穿透的光线,画面与声音均由代码编写。该演示在浏览器中播放,帖文获得 301 次点赞、41163 次浏览。
LlamaIndex 为表单解析打造了专用模型,并集成在 LlamaParse 中,可识别复选框、文本框、标签和签名字段等结构。该模型支持扫描件、手写涂写及约 100+ 字段的密集表单,精度要求接近 100%,同时为每个值提供来源定位与归因。团队博客称最新前沿 VLM 在真实 W-2、1040、W-9 和扫描版 W-4 上仍会出错,专用解析方案成本更低。
Manus Studio 上线 Alchemy 模式,用户只需一条提示词即可生成成片视频,从导演、脚本、分镜到剪辑全部自动完成并对齐音乐节奏。官方在推文中展示了视频、原始提示词及完整会话记录。
LlamaIndex 指出,最新前沿 VLM 在表单解析上仍会失误,因为表单不是页面上的文本,而是由分组字段构成的层级结构。其最新博客分析了 VLM 在真实 W-2、1040、W-9 和扫描版 W-4 上的失败点,并给出用 LlamaParse 以更低成本处理这些表单的定制 cookbook。
Claude 官方账号表示 Sonnet 5.5 在設計方面颇有心得,能为用户界面增加精致度,并按模板生成几乎无需再编辑的幻灯片。
Fish Audio 的 ASR 模型现可区分不同说话人、识别说话人情绪,并在转录文本中标注 [laughter]、[surprised] 等情绪线索。该模型支持 83 种语言,官方称其为目前最准确的 STT 模型。
Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年费订阅用户上线。
有用户演示了 Claude Code Opus5.5 可一次性完成租赁图纸到 CAD(JWW、DXF)、再到 Blender 高画质渲染的透视图,并直接生成 Web 共享页面。该帖作者称其能做的事太多,反而让工作推进不下去,并引发结合家具软装生成选品的设想。
Kling AI 官方账号 @Kling_ai 发布预告,称“CLING ON! We’ve got news”,暗示即将公布新消息,但未透露具体内容。该推文由 Replicate 转发,附带一条引用推文链接。
阿里云在云栖大会先进制造AI论坛上提出,制造业正从"产品售出"走向"产品在线",把设备运行数据回流研发与生产,形成数据网络效应。其数据产线覆盖数据接入、知识组织、模型训练、业务执行与反馈回流,并以Qwen、真武AI芯片和阿里云基础设施支撑自主可信、本地化、专业化、生态化"四化"。宁德时代已积累超600TB研发测试数据,覆盖3000万辆新能源汽车和3000个储能电站真实运行数据。