人们究竟想让 AI 智能体做哪些任务?a16z Top 100 消费级 AI 应用榜单更多图表解读
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。
LlamaIndex 开源负责人 Logan Markewich 撰文讨论从传统 OCR 向 agentic OCR 的转变:传统 OCR 单次扫描直接输出文本,表格被压平、图表消失、多栏排版错乱,且无人校验结果。
Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。
魔芯科技在华为Mate 90系列发布会上亮出鸿蒙独占应用摸小宠,用户拍几张猫的照片即可生成可从任意角度观看的4D数字猫,其技术底座是MoWorld世界模型。该链路端云协同:云端在昇腾NPU上用扩散模型生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪跑在麒麟芯片上完成端侧渲染。
Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才积累的判断力,如今初级员工一出道就得硬扛。
论文《Octrees as an Explicit 3D Language》提出将八叉树作为显式的 3D 语言表示,论文页面已在 Hugging Face Papers 上线(huggingface.co/papers/2610.02…)。该工作由 AK 在 X 上分享,附带的演示视频因浏览器不支持 video 标签未能直接播放。
EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。
有人给 Codex 几个小时和一个 API key,做出一支调侃 Threads 用户的音乐视频:Astra 负责写词,Fal 负责媒体生成,歌曲用 Suno、视频用 MiniMax H3。作者称歌词相当犀利,并反问谁说 LLM 不好笑。
VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。
JayAlammar 与 MaartenGr 合著的《Hands-On Large Language Models》全书绘制近 300 张自制图,作者称之为 "The Illustrated LLM Book"。
MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。
Black Forest Labs 发布 FLUX 3 Image,主打精准局部编辑:框选区域后用文字描述修改需求,画面其余部分几乎不变。官方说明称该模型还支持用 JSON 坐标指定各元素位置的布局控制,适合排版、海报等场景,并最多可合成 10 张参考图。在线体验地址为 flux-tools.bfl.ai/precise-editing。
Demis Hassabis 为团队用 AI 加速科学与医学、造福社会的工作影响力感到自豪。过去一周左右,Google 用 AlphaGenome Atlas 绘制了人类基因组全部 9B 种单字母遗传变化并向研究者开放,还推出迄今最准确的全球天气 AI 模型 WeatherNext 3,并发布开放获取的 AI & Economy ATLAS。
网页运动游戏 poddleball 用电脑摄像头识别动作,把手机或 AirPods 的传感器当作球拍,并支持联机对战。作者认为其识别准确度和响应速度都偏弱,但思路很好,游戏地址为 poddleball.com。
Fable 5.5 整理并生成了人类 40000 年艺术史动画,原作者感叹难以理解抽象的向量矩阵如何输出这些精美动画。其称即便最厉害的动画团队,也不是一两个月能完成的。
Cohere 使用 WMT26 基准测试其翻译模型 North Small Translate,该基准在模型创建之后才发布,因此模型无法针对其指标进行训练。
智东西实测 MiniMax M3.1-Flash 在动效视频、鸡尾酒动画和像素巫师等前端任务上的表现,并与 Claude Opus 5.5 对比,部分细节处理甚至更丰富。M3.1-Flash 基于 M3 系列的 1M 上下文窗口和原生多模态训练路线,能主动补全设计细节并直接交付完整可用的交互成品。该模型国庆前夕上线并开启公测,目前仍处于公测阶段。
Pika 重新设计了整个视频创作体验,让创作者可自选生成方式:不关心具体技术的用户可直接用 Video Studio,偏好特定模型的则可直接调用对应模型。创作者反馈称,在 New Pika 的 Create Video 中使用 Seedance 的费用仅为其他平台的一半,且没有虚假的无限量或把最强模型锁在更高档订阅后面。
有人用 Opus 5.5 做出了一个可交互的 3D 喷气发动机,支持剖切和拆解查看内部结构。该内容在浏览器中运行,原帖为视频展示形式,已获得 1563 个点赞和 25 万余次浏览。
Claude Sonnet 5.5 展示了一项生成能力:在平面画布上绘制出每栋建筑都由纸张折叠而成的立体城市。演示由 Sonnet 5.5 完成,相关视频发布在 Twitter 上。
ElevenLabs 将最具表现力的语音模型 Eleven v4 接入 ElevenReader,用户可自选音色朗读任意文章、电子书或 PDF,覆盖 90+ 种语言。
论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。
论文 EgoTools 提出面向真实第一人称视频的工具中心推理,论文已在 HuggingFace 上线(编号 2609.39…)。目前仅有论文链接与演示视频,未披露模型规模、benchmark 分数或开源情况。
Milvus 3.0 推出 StructArray Hybrid Search 演示,可在视频级别理解"路口"场景,同时在嵌套子记录中定位"白色卡车"等具体对象,并将两级信号合并为一个排序结果。StructArray 将父记录与其子元素保存在一起,嵌套元素内的向量仍可直接检索,减少数据建模复杂度并保留更多上下文。该模式适用于多模态数据集、含章节的文档以及带变体的商品等父子结构数据。
MiniMax H3 相关短片《Let us keep imagination alive》以“sonder”开场,讲述城市中每次短暂相遇都属于一个自己无法完全了解的人生。影片将城市、人群、动物、植物与超现实生物并置,延续作者对 zoopoetics 的关注,追问“他者”能否存在于非人、混合与不可命名的生命形态中。
Tavus 的 Griffin 在视频通话中已能骗过人类,无法被辨别为 AI。同期热点还包括对 ChatGPT「Dots」是否值得升级到 Pro 的讨论,以及 Google 的 AI 水印技术延伸至实验室场景。
MiniMax 的 H3 在视频编辑中的表现引发关注,用户 toyxyz 在 ComfyUI 上测试了 MiniMax-H3-Character-Swap-LoRA,展示了角色替换效果。相关内容在 Twitter 上获得 198 次点赞和超 2.1 万次浏览。
作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。
Ideogram 4.5 是主打高精度局部编辑与超强一致性的图像编辑模型,连续多轮改图时可减少偏色、细节走样和异常纹理,保留上一轮已满意的结果,而不是重新生成全新的图。它支持换色调光、改图中文字、产品换场景、老照片修复等;大图可裁出局部编辑再拼回高清原图。文中举例先给烤面包机换色,再换旁边的水果,后一次修改仍会沿用前一次已确定的机身颜色、按钮与镀铬细节。
Fable 5.5 即将发布,演示显示其能在连续动画中保持不同艺术风格,被形容为"超人"。相关推文由 Chetaslua 发布,并称这标志着"超级智能时代"的到来。
Perplexity 开源多模态决策模型 pplx-decider-27b,并推出由 pplx-decider-v1-27b 驱动的 Decisions API。该模型被训练为输出固定答案集合上的概率分布而非文本,定价为每百万输入 token 4 美分、输出 token 免费,跨基准测试得分 85.71%,官方称未来几天还会进一步降价。
Pika 发布全新 AI 创意平台,内置 40 多款应用,覆盖从完成剪辑到完整视频广告的各类创意需求。官方称该平台简单、全面,专为满足严苛标准的输出而设计,目标是构建面向创意工作未来的 AI。
Perplexity 开源其多模态 Decision 模型,并通过 Decisions API 对外提供。该 API 由 pplx-decider-v1-27b 驱动,模型被训练为对固定答案集输出概率分布而非文本,输入价格为每百万 token 0.04 美元,跨基准得分 85.71%。
Tavus 发布名为 Griffin 的"人类交互模型",公司称其通过了视频图灵测试。在与它实时对话的人中,48% 认为对方是真人,而早期模型这一比例不到 3%。
Google DeepMind 在播客中探讨内容溯源问题:当 AI 生成内容逼真到难以分辨,如何验证内容由人类、机器还是自然产生。节目介绍了不可感知水印技术,重点讲解 SynthID 用于图像和视频,以及面向生物设计的 SynthID Bio。
Claude Sonnet 5.5 结合 Fish Audio MCP 的图像与视频生成能力,可将一张海报在单次对话中直接生成为含标题和声音的 10 秒短片。Fish Creative 称该模型在艺术指导上表现惊人,相关提示词已在推文中公开。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,官方称这是对贴合用户所处场景的界面的早期探索,并放出了完整演示视频。
MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。
NVIDIA 发布基于 Cosmos 和 VSS 3.3 的方案,可通过一条提示词构建视觉 AI 智能体。该内容以直播形式呈现,具体功能与参数未在原文中披露。
Runway 宣布可将任意媒体扩展为可交互的实时世界模拟,把固定体验转化为面向人和 AI 智能体的沉浸式多模态模拟。该功能支持实时交互与多模态形式,适用于人类用户与智能体两类对象,目前尚未公布具体可用时间与价格信息。