跳到正文

#多模态

今日 10 条
10月6日周二
  1. a16z(@a16z)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    人们究竟想让 AI 智能体做哪些任务?a16z Top 100 消费级 AI 应用榜单更多图表解读

    a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。

  2. LlamaIndex 🦙(@llama_index)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 谈 agentic OCR:传统 OCR 一次成稿,智能体式解析改为循环校验

    LlamaIndex 开源负责人 Logan Markewich 撰文讨论从传统 OCR 向 agentic OCR 的转变:传统 OCR 单次扫描直接输出文本,表格被压平、图表消失、多栏排版错乱,且无人校验结果。

10月5日周一
  1. Import AI — Jack ClarkAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 475:群体扩展、Google DeepMind 为生物内容加水印与 AI 科学经济

    Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。

  2. 新智元AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    魔芯科技MoWorld以鸿蒙应用摸小宠把4D世界模型带上手机

    魔芯科技在华为Mate 90系列发布会上亮出鸿蒙独占应用摸小宠,用户拍几张猫的照片即可生成可从任意角度观看的4D数字猫,其技术底座是MoWorld世界模型。该链路端云协同:云端在昇腾NPU上用扩散模型生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪跑在麒麟芯片上完成端侧渲染。

  3. CSDNAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 负责人 Yossi Matias:AI 正在终结岗位头衔,初级员工要一出道就硬抗判断力

    Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才积累的判断力,如今初级员工一出道就得硬扛。

  4. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Octrees as an Explicit 3D Language:用八叉树作为显式 3D 语言的论文

    论文《Octrees as an Explicit 3D Language》提出将八叉树作为显式的 3D 语言表示,论文页面已在 Hugging Face Papers 上线(huggingface.co/papers/2610.02…)。该工作由 AK 在 X 上分享,附带的演示视频因浏览器不支持 video 标签未能直接播放。

  5. AK(@_akhaliq)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。

  6. Justine Moore(@venturetwins)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 用 Astra 写词、Suno 与 MiniMax H3 生成 Threads 用户吐槽音乐视频

    有人给 Codex 几个小时和一个 API key,做出一支调侃 Threads 用户的音乐视频:Astra 负责写词,Fal 负责媒体生成,歌曲用 Suno、视频用 MiniMax H3。作者称歌词相当犀利,并反问谁说 LLM 不好笑。

  7. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    VA-Bench 测出大模型空间智能执行断层:目标识别接近满分,完整任务成功率仅约一半

    VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。

  8. meng shao(@shao__meng)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Hands-On Large Language Models》全书近 300 张自制图解拆解 LLM 原理与架构

    JayAlammar 与 MaartenGr 合著的《Hands-On Large Language Models》全书绘制近 300 张自制图,作者称之为 "The Illustrated LLM Book"。

  9. 十字路口CrossingAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1 Flash Preview 前端能力:三个案例对比 Opus 5.5

    MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。

  10. 向阳乔木(@vista8)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Black Forest Labs 发布 FLUX 3 Image,支持精准局部编辑与 JSON 布局控制

    Black Forest Labs 发布 FLUX 3 Image,主打精准局部编辑:框选区域后用文字描述修改需求,画面其余部分几乎不变。官方说明称该模型还支持用 JSON 坐标指定各元素位置的布局控制,适合排版、海报等场景,并最多可合成 10 张参考图。在线体验地址为 flux-tools.bfl.ai/precise-editing。

  11. Demis Hassabis(@demishassabis)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 谈 AI 加速科学与医学的社会影响

    Demis Hassabis 为团队用 AI 加速科学与医学、造福社会的工作影响力感到自豪。过去一周左右,Google 用 AlphaGenome Atlas 绘制了人类基因组全部 9B 种单字母遗传变化并向研究者开放,还推出迄今最准确的全球天气 AI 模型 WeatherNext 3,并发布开放获取的 AI & Economy ATLAS。

10月4日周日
  1. 向阳乔木(@vista8)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网页运动游戏 poddleball:用摄像头识别动作、手机或 AirPods 当球拍

    网页运动游戏 poddleball 用电脑摄像头识别动作,把手机或 AirPods 的传感器当作球拍,并支持联机对战。作者认为其识别准确度和响应速度都偏弱,但思路很好,游戏地址为 poddleball.com。

  2. 宝玉(@dotey)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.5 生成人类 40000 年艺术史动画

    Fable 5.5 整理并生成了人类 40000 年艺术史动画,原作者感叹难以理解抽象的向量矩阵如何输出这些精美动画。其称即便最厉害的动画团队,也不是一两个月能完成的。

  3. cohere(@cohere)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 用 WMT26 基准测试 North Small Translate

    Cohere 使用 WMT26 基准测试其翻译模型 North Small Translate,该基准在模型创建之后才发布,因此模型无法针对其指标进行训练。

10月3日周六
  1. 智东西AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1-Flash 前端能力,效果硬刚 Opus 5.5

    智东西实测 MiniMax M3.1-Flash 在动效视频、鸡尾酒动画和像素巫师等前端任务上的表现,并与 Claude Opus 5.5 对比,部分细节处理甚至更丰富。M3.1-Flash 基于 M3 系列的 1M 上下文窗口和原生多模态训练路线,能主动补全设计细节并直接交付完整可用的交互成品。该模型国庆前夕上线并开启公测,目前仍处于公测阶段。

  2. Pika(@pika_labs)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pika 重构视频创作体验:Video Studio 与指定模型双路径

    Pika 重新设计了整个视频创作体验,让创作者可自选生成方式:不关心具体技术的用户可直接用 Video Studio,偏好特定模型的则可直接调用对应模型。创作者反馈称,在 New Pika 的 Create Video 中使用 Seedance 的费用仅为其他平台的一半,且没有虚假的无限量或把最强模型锁在更高档订阅后面。

  3. Claude(@claudeai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5 打造的交互式 3D 喷气发动机,可剖切、可拆解

    有人用 Opus 5.5 做出了一个可交互的 3D 喷气发动机,支持剖切和拆解查看内部结构。该内容在浏览器中运行,原帖为视频展示形式,已获得 1563 个点赞和 25 万余次浏览。

  4. Claude(@claudeai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 生成纸上折叠的立体城市

    Claude Sonnet 5.5 展示了一项生成能力:在平面画布上绘制出每栋建筑都由纸张折叠而成的立体城市。演示由 Sonnet 5.5 完成,相关视频发布在 Twitter 上。

  5. ElevenLabs(@elevenlabsio)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eleven v4 语音模型上线 ElevenReader,支持 90+ 语言朗读

    ElevenLabs 将最具表现力的语音模型 Eleven v4 接入 ElevenReader,用户可自选音色朗读任意文章、电子书或 PDF,覆盖 90+ 种语言。

  6. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 多奖励优化

    论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。

  7. AK(@_akhaliq)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EgoTools:面向真实第一人称视频的工具中心推理

    论文 EgoTools 提出面向真实第一人称视频的工具中心推理,论文已在 HuggingFace 上线(编号 2609.39…)。目前仅有论文链接与演示视频,未披露模型规模、benchmark 分数或开源情况。

10月2日周五
  1. Milvus(@milvusio)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 推出 StructArray Hybrid Search 演示,支持父子嵌套数据混合检索

    Milvus 3.0 推出 StructArray Hybrid Search 演示,可在视频级别理解"路口"场景,同时在嵌套子记录中定位"白色卡车"等具体对象,并将两级信号合并为一个排序结果。StructArray 将父记录与其子元素保存在一起,嵌套元素内的向量仍可直接检索,减少数据建模复杂度并保留更多上下文。该模式适用于多模态数据集、含章节的文档以及带变体的商品等父子结构数据。

  2. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 呈现短片《Let us keep imagination alive》:以“sonder”探讨他者与想象

    MiniMax H3 相关短片《Let us keep imagination alive》以“sonder”开场,讲述城市中每次短暂相遇都属于一个自己无法完全了解的人生。影片将城市、人群、动物、植物与超现实生物并置,延续作者对 zoopoetics 的关注,追问“他者”能否存在于非人、混合与不可命名的生命形态中。

  3. The Rundown AI(@TheRundownAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日 AI 头条:Tavus Griffin 在视频通话中骗过人类、ChatGPT「Dots」是否值得升级 Pro、Google AI 水印进入实验室

    Tavus 的 Griffin 在视频通话中已能骗过人类,无法被辨别为 AI。同期热点还包括对 ChatGPT「Dots」是否值得升级到 Pro 的讨论,以及 Google 的 AI 水印技术延伸至实验室场景。

  4. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 视频编辑玩出新花样:角色替换 LoRA 测试

    MiniMax 的 H3 在视频编辑中的表现引发关注,用户 toyxyz 在 ComfyUI 上测试了 MiniMax-H3-Character-Swap-LoRA,展示了角色替换效果。相关内容在 Twitter 上获得 198 次点赞和超 2.1 万次浏览。

  5. 爱范儿AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 Opus 5.5 同题交卷,MiniMax M3.1 让 Flash 开始超纲了

    作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。

  6. 小互(@imxiaohu)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 发布:主打高精度局部编辑与多轮改图一致性

    Ideogram 4.5 是主打高精度局部编辑与超强一致性的图像编辑模型,连续多轮改图时可减少偏色、细节走样和异常纹理,保留上一轮已满意的结果,而不是重新生成全新的图。它支持换色调光、改图中文字、产品换场景、老照片修复等;大图可裁出局部编辑再拼回高清原图。文中举例先给烤面包机换色,再换旁边的水果,后一次修改仍会沿用前一次已确定的机身颜色、按钮与镀铬细节。

  7. 小互(@imxiaohu)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.5 要来了,看起来更强大

    Fable 5.5 即将发布,演示显示其能在连续动画中保持不同艺术风格,被形容为"超人"。相关推文由 Chetaslua 发布,并称这标志着"超级智能时代"的到来。

  8. Aravind Srinivas(@AravSrinivas)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源多模态决策模型 pplx-decider-27b 并推出 Decisions API

    Perplexity 开源多模态决策模型 pplx-decider-27b,并推出由 pplx-decider-v1-27b 驱动的 Decisions API。该模型被训练为输出固定答案集合上的概率分布而非文本,定价为每百万输入 token 4 美分、输出 token 免费,跨基准测试得分 85.71%,官方称未来几天还会进一步降价。

  9. Pika(@pika_labs)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pika 推出全新 AI 创意平台,内置 40 多款应用

    Pika 发布全新 AI 创意平台,内置 40 多款应用,覆盖从完成剪辑到完整视频广告的各类创意需求。官方称该平台简单、全面,专为满足严苛标准的输出而设计,目标是构建面向创意工作未来的 AI。

  10. Aravind Srinivas(@AravSrinivas)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源多模态 Decision 模型并提供 Decisions API

    Perplexity 开源其多模态 Decision 模型,并通过 Decisions API 对外提供。该 API 由 pplx-decider-v1-27b 驱动,模型被训练为对固定答案集输出概率分布而非文本,输入价格为每百万 token 0.04 美元,跨基准得分 85.71%。

  11. The Rundown AI(@TheRundownAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tavus 发布人类交互模型 Griffin,直播测试中 48% 的人误认为是真人

    Tavus 发布名为 Griffin 的"人类交互模型",公司称其通过了视频图灵测试。在与它实时对话的人中,48% 认为对方是真人,而早期模型这一比例不到 3%。

  12. Google DeepMind(@GoogleDeepMind)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 播客:AI 内容真假难辨,如何用 SynthID 水印验证来源

    Google DeepMind 在播客中探讨内容溯源问题:当 AI 生成内容逼真到难以分辨,如何验证内容由人类、机器还是自然产生。节目介绍了不可感知水印技术,重点讲解 SynthID 用于图像和视频,以及面向生物设计的 SynthID Bio。

  13. Fish Audio(@FishAudio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 搭配 Fish Audio MCP:一张海报直接生成 10 秒短片

    Claude Sonnet 5.5 结合 Fish Audio MCP 的图像与视频生成能力,可将一张海报在单次对话中直接生成为含标题和声音的 10 秒短片。Fish Creative 称该模型在艺术指导上表现惊人,相关提示词已在推文中公开。

  14. Runway(@runwayml)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway Labs 推出 Project Continuum 研究应用

    Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,官方称这是对贴合用户所处场景的界面的早期探索,并放出了完整演示视频。

  15. 大模型智能AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    世界—动作模型综述:从预测未来到机器人闭环控制

    MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。

10月1日周四
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 NVIDIA Cosmos 和 VSS 3.3 从一条提示词构建视觉 AI 智能体

    NVIDIA 发布基于 Cosmos 和 VSS 3.3 的方案,可通过一条提示词构建视觉 AI 智能体。该内容以直播形式呈现,具体功能与参数未在原文中披露。

  2. Runway(@runwayml)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 将任意媒体扩展为可交互的实时世界模拟

    Runway 宣布可将任意媒体扩展为可交互的实时世界模拟,把固定体验转化为面向人和 AI 智能体的沉浸式多模态模拟。该功能支持实时交互与多模态形式,适用于人类用户与智能体两类对象,目前尚未公布具体可用时间与价格信息。