a16z 的 Andrew Chen:AI 原生消费应用距离 ARPU 覆盖推理成本还差 10 倍以上
a16z 的 Andrew Chen 认为,AI 原生消费应用要实现普及,需月均 ARPU 高于单用户平均推理成本,但当前月 ARPU 约 2-5 美元,而 AI 重度应用的 token 成本达 20-50 美元,差距超过 10 倍。
a16z 的 Andrew Chen 认为,AI 原生消费应用要实现普及,需月均 ARPU 高于单用户平均推理成本,但当前月 ARPU 约 2-5 美元,而 AI 重度应用的 token 成本达 20-50 美元,差距超过 10 倍。
高通在圣迭戈总部搭建面向5G和6G的研发测试平台,用无线信号追踪无人机并由AI分类,展示其6G愿景的连接、感知、高性能计算三大基石。高通提出"计算连续体"多层架构,并计划推出面向家庭和小企业、可承载万亿级参数模型的设备形态;同时探索把AI算力下沉到基站侧,供运营商提供"算力即服务"或"Token即服务"。
LangChain 将于下周二举办直播,由工程团队的 Sydney Runkle 讲解 TypeSafe AI 的新模型 Jev 如何用于 AI 智能体。该模型在分类任务上据称推理速度最高快 200 倍、成本低 400 倍,目标是解决智能体循环慢且昂贵的问题。直播内容涵盖 Jev 在智能体循环中的位置以及如何搭建 harness。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理的基准测试。文章指出用 curl 命令、手写 asyncio 脚本或临时压测工具测推理性能,都会受单进程性能上限和 Python GIL 并发限制影响,导致测得的数字不可靠。
SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。
智谱正式推出 GLM-5.3-FlashX,最高 200 tokens/s,API 已上线,Model Key 为 GLM-5.3-FlashX。官方称该版本前身以 Ox Alpha 之名与开发者见面,调用量持续攀升,此次在10万张国产芯片提供的推理算力基础上加大 Infra 投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。
TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。
Z.ai 的多模态编码模型 GLM 5.3 FlashX 现已上线 AI Gateway,提供约 200 tokens/s 的高速推理服务,适合编码智能体、工具循环和交互式应用。模型 ID 为 zai/glm-5.3-flashx,可在各 API 格式和编码智能体中调用。AI Gateway 按供应商价格原价计费,不收取推理平台费,BYOK 请求同样适用。
Anthropic 在最新 Science Blog 中介绍,Claude 为 30 多个生物领域的开源模型优化推理,平均提速 4 倍,部分做法是为 GPU 编写定制软件。Anthropic 表示将全部优化代码开源,这些模型原先运行成本较高,可能限制其实际影响;详情见 anthropic.com/research/claud…。
Perplexity 新增控制选项,用户可自行定制模型选择、推理等级以及可用的速度设置,让回答过程更可控。该功能由 Perplexity 官方账号发布,具体可调模型与速度档位原文未披露。
在 Claudian 中使用 Gemini 3.8 flash 写稿,思考时间基本在 20s 以内,随后快速持续输出。该体验由用户 @PMbackttfuture 分享,原帖附有演示视频,互动量约 20 条回复、4 次转发、56 个点赞、18500 次浏览。
普林斯顿博后张载熙创立AI4S公司科理新序(Scinetics),近日完成近5000万元人民币融资,英诺科创基金领投,沂景资本、小苗朗程、麟阁创投跟投。公司核心是开发多模态长程推理基座模型,提出Science Token概念,将小分子、核酸、蛋白质结构等科学数据转为统一表征单元,不经过人类语言转译,短期聚焦生命科学。
NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该基准针对 AI 智能体在车辆、机器人等边缘设备上的多步推理工作流,要求模型快速生成 token 并在不断增长的对话中持续推理。TensorRT Edge-LLM 面向此类边缘推理场景优化。
2026年上半年四家国产GPU合计收入52.42亿元,同比增长约162%,但7月以来沐曦、天数智芯股价最大回撤分别达55%和64%,且反弹乏力。作者认为原因是国产GPU稀缺性下降、研发投入占收入50.7%导致利润未跟上,且大客户议价权增强。推理时代ASIC抢增量、推理卡毛利率明显低于训练卡,连英伟达的估值倍数年内也压缩约17%。
Yann LeCun 指出,AI 在搜索并写下定理形式化证明上超过人类,不等于「数学达到超越人类水平」。他认为这只是整个数学活动中一项可自动化的「机械性」任务,就像算术或符号/数值积分并不等于全部数学。数学家的核心工作是发明新概念、新框架、新抽象与新定义并提出猜想,这依赖当前 AI 系统尚不具备的直觉与创造力。
Amjad Masad 对 Diogo Almeida 发布的 Jev 模型提出质疑:如果输出域提前已知,为什么不直接训练一个在枚举上输出 logprobs 的模型。Jev 号称比现有方案快 20-200 倍、便宜 40-400 倍,且输出 token 免费,定位为面向决策的可组合前沿智能。
NVIDIA 发布技术解析,解释 30B 参数模型为何每 token 只激活 3B 参数却仍能调用全部模型容量。文章对比稠密模型与 MoE 模型在参数使用方式上的差异,并说明这对吞吐量、内存占用和部署复杂度的影响。
Suhail 回应 @martin_casado 时提出,如果(1)不太在意推理成本、(2)推理近乎即时,就有另一种想象问题的方式。原文未展开具体场景或模型。
Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。
推理芯片竞赛升温:英伟达以约200亿美元对 Groq 进行 acqui-hire,Cerebras 今年6月 IPO 市值达670亿美元,OpenAI 联手博通推出首款自研推理芯片 Jalapeño,从设计到流片仅用9个月。
Fireworks AI 在 Astra 与 DeepSeek V4.1-Flash 上运行 DeepSWE,输入 token 与输出 token 比例为 174:1,其中 99.6% 为缓存命中,缓存命中占账单的 60%。两者质量相同,但单任务成本分别为 $0.43 与 $6.52。
播客对话 Recursive SI 联合创始人 Richard Socher,该公司以 5B 美元融资跻身最新 neolab,目标是用开放式、自我改进的 AI 做 AI 研究。节目讨论了 Eureka Machine、Richard 的 10 Spaces of Intelligence、DecaNLP 与被拒的早期 GPT 思路,以及 AI 同行评审为何失灵。
Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。
Google DeepMind 展示用 Gemini 3.8 Live Extended Thinking 充当编程辅导老师。两款模型均支持升级版推理、近实时视觉理解、97 种语言自动检测,以及不打断对话的后台工具调用。
NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高能效、高交互性推理。文章指出,功耗是 AI 工厂的核心约束,衡量 AI 平台价值的关键指标是每瓦性能而非未归一化的原始吞吐量。
Yann LeCun 表示,基于 LLM 的 AI 工具虽然非常有用、人人都在用,但它们本身并不是通向人类级 AI 的路径。他指出,能够理解真实世界的架构并非 LLM,让当前 LLM 系统得以解读图像、视频等真实世界信号的架构组件也不属于 LLM。他同时提到有一场 1 小时的演讲,用结果和证据支撑上述结论。
2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。
SemiAnalysis 用自研 AgentX 智能体推理基准实测 NVIDIA Vera Rubin NVL72,在 Apples to Apples TRTLLM NVFP4 Dense 配置下。
SemiAnalysis 分析机器人与 LLM 的硬件逻辑差异:LLM 是模型先行、硬件适配,机器人则因实时控制环路和整机成本约束,硬件固定、模型去适配 Jetson 或 H100 等可量产硬件。
SAS 提出一种通过上下文排序端到端优化实现的简单注意力稀疏化方法,论文已在 Hugging Face 上线(huggingface.co/papers/2609.13…)。该方法以排序优化驱动注意力稀疏化,具体参数与评测结果暂未披露。
Yann LeCun 指出,现代 AI 系统底层的 LLM 是自回归的,但 AI 系统本身不是:所谓"reasoning"系统会生成大量 token 序列并挑选最优解,这属于非自回归搜索。他认为当前系统的错误在于把搜索放在离散 token 空间,主张 planning/reasoning 的 inference-by-search 应在抽象表示空间完成,因为人类的推理与规划大多与语言无关。
SemiAnalysis 指出,AI 加速器的 HBM 堆叠高度趋势正在逆转:下一代 Rubin Ultra 每 GPU 仅配 192GB HBM,低于标准 Rubin 与 B300 的 288GB,8-hi 将取代 12-hi 成为新标准。
NVIDIA 详解全栈 NIM 优化如何让 Nemotron 3 Ultra 在现有 GPU 上支撑 2.5 倍并发用户,同时保持交互响应速度。这一权衡对智能体 AI 负载尤为关键,因为其提示词更长、上下文会在多步之间复用。
DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。
DeepSeek 发布 DeepSeek-V4.1-Flash,称其更智能、更快、更高效,是新架构家族中体量最小的模型,并具备原生视觉理解能力。该模型面向更强能力、更快推理、更高吞吐设计,可扩展至更大模型。
阿里云开发者梳理了 Agent 自进化(Self-Evolution)的技术全景:进化对象既包括 Skill、Harness、Memory 等非参数化组件,也包括通过微调、强化学习、自蒸馏将经验内化为模型权重。
NVIDIA 发文说明 Encode-Prefill-Decode(EPD)解耦这一多模态模型推理优化技术:它将视觉编码阶段与 prefill、decode 阶段分离,在图像密集提示词、中短输出和量化 MoE 模型上最有效。配合 NVIDIA Dynamo 使用 EPD 解耦,最高可带来 5 倍加速。
Sebastian Raschka 撰文讨论 GPT-6 Astra,认为其最大跃升在计算机使用能力,并称 Astra 很可能采用循环 Transformer(recurrent depth)变体,理由是 The Information 的报道与该方法在固定算力下可提升建模表现。
Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。
智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。
一篇题为《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》的论文发布,提出用离散扩散为 LLM 带来无损加速,论文已在 Hugging Face Papers 上线。该工作聚焦大语言模型的推理提速,具体方法细节与实验数据见原文。