跳到正文

#推理

今日 17 条
9月20日周日
  1. andrew chen(@andrewchen)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 的 Andrew Chen:AI 原生消费应用距离 ARPU 覆盖推理成本还差 10 倍以上

    a16z 的 Andrew Chen 认为,AI 原生消费应用要实现普及,需月均 ARPU 高于单用户平均推理成本,但当前月 ARPU 约 2-5 美元,而 AI 重度应用的 token 成本达 20-50 美元,差距超过 10 倍。

9月19日周六
  1. 甲子光年AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    探访高通总部:6G网络如何从传输数据走向感知与计算?

    高通在圣迭戈总部搭建面向5G和6G的研发测试平台,用无线信号追踪无人机并由AI分类,展示其6G愿景的连接、感知、高性能计算三大基石。高通提出"计算连续体"多层架构,并计划推出面向家庭和小企业、可承载万亿级参数模型的设备形态;同时探索把AI算力下沉到基站侧,供运营商提供"算力即服务"或"Token即服务"。

  2. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 直播:Jev 如何加速 AI 智能体循环

    LangChain 将于下周二举办直播,由工程团队的 Sydney Runkle 讲解 TypeSafe AI 的新模型 Jev 如何用于 AI 智能体。该模型在分类任务上据称推理速度最高快 200 倍、成本低 400 倍,目标是解决智能体循环慢且昂贵的问题。直播内容涵盖 Jev 在智能体循环中的位置以及如何搭建 harness。

  3. NVIDIA Technical BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 如何用 AIPerf 对大规模 LLM 推理做基准测试

    NVIDIA 发布 AIPerf,用于大规模 LLM 推理的基准测试。文章指出用 curl 命令、手写 asyncio 脚本或临时压测工具测推理性能,都会受单进程性能上限和 Python GIL 并发限制影响,导致测得的数字不可靠。

9月18日周五
  1. SemiAnalysisAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 解读 Engram 嵌入:面向高效 DRAM/SSD 卸载的软硬件协同设计

    SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。

  2. 智谱AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱上线 GLM-5.3-FlashX,最高 200 tokens/s

    智谱正式推出 GLM-5.3-FlashX,最高 200 tokens/s,API 已上线,Model Key 为 GLM-5.3-FlashX。官方称该版本前身以 Ox Alpha 之名与开发者见面,调用量持续攀升,此次在10万张国产芯片提供的推理算力基础上加大 Infra 投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。

  3. 数字生命卡兹克AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TypeSafe AI 发布只做高频决策的模型 Jev

    TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。

  4. Vercel NewsAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 FlashX 上线 AI Gateway,约 200 tokens/s 高速推理

    Z.ai 的多模态编码模型 GLM 5.3 FlashX 现已上线 AI Gateway,提供约 200 tokens/s 的高速推理服务,适合编码智能体、工具循环和交互式应用。模型 ID 为 zai/glm-5.3-flashx,可在各 API 格式和编码智能体中调用。AI Gateway 按供应商价格原价计费,不收取推理平台费,BYOK 请求同样适用。

  5. Anthropic(@AnthropicAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 为 30 多个开源模型优化推理,平均提速 4 倍并开源代码

    Anthropic 在最新 Science Blog 中介绍,Claude 为 30 多个生物领域的开源模型优化推理,平均提速 4 倍,部分做法是为 GPU 编写定制软件。Anthropic 表示将全部优化代码开源,这些模型原先运行成本较高,可能限制其实际影响;详情见 anthropic.com/research/claud…。

  6. Perplexity(@perplexity_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 支持自定义模型选择、推理等级与速度设置

    Perplexity 新增控制选项,用户可自行定制模型选择、推理等级以及可用的速度设置,让回答过程更可控。该功能由 Perplexity 官方账号发布,具体可调模型与速度档位原文未披露。

9月17日周四
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claudian 里用 Gemini 3.8 flash 写稿:思考 20s 以内,输出速度极快

    在 Claudian 中使用 Gemini 3.8 flash 写稿,思考时间基本在 20s 以内,随后快速持续输出。该体验由用户 @PMbackttfuture 分享,原帖附有演示视频,互动量约 20 条回复、4 次转发、56 个点赞、18500 次浏览。

  2. 暗涌WavesAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    科理新序张载熙:做AI4S多模态基座模型,以Science Token计费

    普林斯顿博后张载熙创立AI4S公司科理新序(Scinetics),近日完成近5000万元人民币融资,英诺科创基金领投,沂景资本、小苗朗程、麟阁创投跟投。公司核心是开发多模态长程推理基座模型,提出Science Token概念,将小分子、核酸、蛋白质结构等科学数据转为统一表征单元,不经过人类语言转译,短期聚焦生命科学。

  3. NVIDIA Technical BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA TensorRT Edge-LLM 在 Jetson AGX Thor 上以 6.4 倍速度完成 MLPerf Edge Agentic Benchmark

    NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该基准针对 AI 智能体在车辆、机器人等边缘设备上的多步推理工作流,要求模型快速生成 token 并在不断增长的对话中持续推理。TensorRT Edge-LLM 面向此类边缘推理场景优化。

9月16日周三
  1. 乌鸦智能说AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    投资人开始“抛弃”国产GPU了

    2026年上半年四家国产GPU合计收入52.42亿元,同比增长约162%,但7月以来沐曦、天数智芯股价最大回撤分别达55%和64%,且反弹乏力。作者认为原因是国产GPU稀缺性下降、研发投入占收入50.7%导致利润未跟上,且大客户议价权增强。推理时代ASIC抢增量、推理卡毛利率明显低于训练卡,连英伟达的估值倍数年内也压缩约17%。

  2. Yann LeCun(@ylecun)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:形式化定理证明超越人类不等于「数学超越人类」

    Yann LeCun 指出,AI 在搜索并写下定理形式化证明上超过人类,不等于「数学达到超越人类水平」。他认为这只是整个数学活动中一项可自动化的「机械性」任务,就像算术或符号/数值积分并不等于全部数学。数学家的核心工作是发明新概念、新框架、新抽象与新定义并提出猜想,这依赖当前 AI 系统尚不具备的直觉与创造力。

  3. Amjad Masad(@amasad)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amjad Masad 质疑 Jev:输出域已知为何不直接训练枚举 logprobs 模型

    Amjad Masad 对 Diogo Almeida 发布的 Jev 模型提出质疑:如果输出域提前已知,为什么不直接训练一个在枚举上输出 logprobs 的模型。Jev 号称比现有方案快 20-200 倍、便宜 40-400 倍,且输出 token 免费,定位为面向决策的可组合前沿智能。

  4. NVIDIA AI(@NVIDIAAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 技术解析:30B 参数模型如何每 token 仅激活 3B 参数

    NVIDIA 发布技术解析,解释 30B 参数模型为何每 token 只激活 3B 参数却仍能调用全部模型容量。文章对比稠密模型与 MoE 模型在参数使用方式上的差异,并说明这对吞吐量、内存占用和部署复杂度的影响。

  5. Suhail(@Suhail)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail 谈推理成本与速度:若不担心推理成本且近乎即时,该如何重新想象

    Suhail 回应 @martin_casado 时提出,如果(1)不太在意推理成本、(2)推理近乎即时,就有另一种想象问题的方式。原文未展开具体场景或模型。

  6. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:GPT-6 Astra 在数学基准上领先,软件工程并非如此

    Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。

  7. 硅谷101AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硅谷101|推理芯片之战:聊聊 Groq、Cerebras 与 OpenAI 三大路径

    推理芯片竞赛升温:英伟达以约200亿美元对 Groq 进行 acqui-hire,Cerebras 今年6月 IPO 市值达670亿美元,OpenAI 联手博通推出首款自研推理芯片 Jalapeño,从设计到流片仅用9个月。

  8. Fireworks AI(@FireworksAI_HQ)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 实测:DeepSWE 智能体成本 99.6% 命中缓存,单任务 $0.43 对 $6.52

    Fireworks AI 在 Astra 与 DeepSeek V4.1-Flash 上运行 DeepSWE,输入 token 与输出 token 比例为 174:1,其中 99.6% 为缓存命中,缓存命中占账单的 60%。两者质量相同,但单任务成本分别为 $0.43 与 $6.52。

  9. Latent.Space(@latentspacepod)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive SI 联合创始人 Richard Socher 谈"人类最后一项发明"与递归自我改进 AI

    播客对话 Recursive SI 联合创始人 Richard Socher,该公司以 5B 美元融资跻身最新 neolab,目标是用开放式、自我改进的 AI 做 AI 研究。节目讨论了 Eureka Machine、Richard 的 10 Spaces of Intelligence、DecaNLP 与被拒的早期 GPT 思路,以及 AI 同行评审为何失灵。

  10. Patrick Loeber(@patloeber)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。

  11. Google DeepMind(@GoogleDeepMind)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Live Extended Thinking 演示:充当编程辅导老师

    Google DeepMind 展示用 Gemini 3.8 Live Extended Thinking 充当编程辅导老师。两款模型均支持升级版推理、近实时视觉理解、97 种语言自动检测,以及不打断对话的后台工具调用。

  12. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Groq 3 LPX 确定性执行如何为 NVIDIA Vera Rubin 带来高能效高交互推理

    NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高能效、高交互性推理。文章指出,功耗是 AI 工厂的核心约束,衡量 AI 平台价值的关键指标是每瓦性能而非未归一化的原始吞吐量。

9月15日周二
  1. Yann LeCun(@ylecun)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:LLM 本身并非通向人类级 AI 的路径

    Yann LeCun 表示,基于 LLM 的 AI 工具虽然非常有用、人人都在用,但它们本身并不是通向人类级 AI 的路径。他指出,能够理解真实世界的架构并非 LLM,让当前 LLM 系统得以解读图像、视频等真实世界信号的架构组件也不属于 LLM。他同时提到有一场 1 小时的演讲,用结果和证据支撑上述结论。

  2. 硅谷科技评论AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越便宜,什么才开始值钱?——Imagination In Action 硅谷 AI 峰会观察

    2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。

  3. SemiAnalysisAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测 Vera Rubin NVL72 智能体推理:每美元性能最高提升 67 倍

    SemiAnalysis 用自研 AgentX 智能体推理基准实测 NVIDIA Vera Rubin NVL72,在 Apples to Apples TRTLLM NVFP4 Dense 配置下。

  4. SemiAnalysisAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大脑太大带不动:机器人推理该放在本体还是数据中心

    SemiAnalysis 分析机器人与 LLM 的硬件逻辑差异:LLM 是模型先行、硬件适配,机器人则因实时控制环路和整机成本约束,硬件固定、模型去适配 Jetson 或 H100 等可量产硬件。

9月14日周一
  1. AK(@_akhaliq)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SAS:通过上下文排序端到端优化实现简单注意力稀疏化

    SAS 提出一种通过上下文排序端到端优化实现的简单注意力稀疏化方法,论文已在 Hugging Face 上线(huggingface.co/papers/2609.13…)。该方法以排序优化驱动注意力稀疏化,具体参数与评测结果暂未披露。

  2. Yann LeCun(@ylecun)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:现代 AI 系统并非自回归,推理搜索应在抽象表示空间进行

    Yann LeCun 指出,现代 AI 系统底层的 LLM 是自回归的,但 AI 系统本身不是:所谓"reasoning"系统会生成大量 token 序列并挑选最优解,这属于非自回归搜索。他认为当前系统的错误在于把搜索放在离散 token 空间,主张 planning/reasoning 的 inference-by-search 应在抽象表示空间完成,因为人类的推理与规划大多与语言无关。

  3. SemiAnalysisAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 4-hi HBM 会赢:SemiAnalysis 解析 HBM 堆叠高度趋势逆转

    SemiAnalysis 指出,AI 加速器的 HBM 堆叠高度趋势正在逆转:下一代 Rubin Ultra 每 GPU 仅配 192GB HBM,低于标准 Rubin 与 B300 的 288GB,8-hi 将取代 12-hi 成为新标准。

9月11日周五
  1. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 全栈 NIM 优化如何让 Nemotron 3 Ultra 支撑 2.5 倍并发用户

    NVIDIA 详解全栈 NIM 优化如何让 Nemotron 3 Ultra 在现有 GPU 上支撑 2.5 倍并发用户,同时保持交互响应速度。这一权衡对智能体 AI 负载尤为关键,因为其提示词更长、上下文会在多步之间复用。

9月10日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1-Flash 将 KV cache 的 HBM 需求降至上一代的 1/4

    DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。

  2. DeepSeek(@deepseek_ai)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4.1-Flash 模型

    DeepSeek 发布 DeepSeek-V4.1-Flash,称其更智能、更快、更高效,是新架构家族中体量最小的模型,并具备原生视觉理解能力。该模型面向更强能力、更快推理、更高吞吐设计,可扩展至更大模型。

  3. 阿里云开发者AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 如何自己变强?从 Skill 到模型权重的自进化全景图

    阿里云开发者梳理了 Agent 自进化(Self-Evolution)的技术全景:进化对象既包括 Skill、Harness、Memory 等非参数化组件,也包括通过微调、强化学习、自蒸馏将经验内化为模型权重。

  4. NVIDIA Technical BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    何时使用 Encode-Prefill-Decode 解耦加速多模态模型服务

    NVIDIA 发文说明 Encode-Prefill-Decode(EPD)解耦这一多模态模型推理优化技术:它将视觉编码阶段与 prefill、decode 阶段分离,在图像密集提示词、中短输出和量化 MoE 模型上最有效。配合 NVIDIA Dynamo 使用 EPD 解耦,最高可带来 5 倍加速。

9月9日周三
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra、循环 Transformer 与隐藏推理链

    Sebastian Raschka 撰文讨论 GPT-6 Astra,认为其最大跃升在计算机使用能力,并称 Astra 很可能采用循环 Transformer(recurrent depth)变体,理由是 The Information 的报道与该方法在固定算力下可提升建模表现。

  2. DeeplearningAIAI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 发布 GLM-5.3-Flash,Ox Alpha 谜底揭晓并开放权重下载

    Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。

    为什么值得看

    智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。

  3. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通过离散扩散实现 LLM 无损加速的新论文

    一篇题为《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》的论文发布,提出用离散扩散为 LLM 带来无损加速,论文已在 Hugging Face Papers 上线。该工作聚焦大语言模型的推理提速,具体方法细节与实验数据见原文。