跳到正文

#推理

今日 17 条
10月8日周四
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 压缩智能体记忆:每 token 缓存 890 字节,比 DeepSeek-V1 小 437 倍

    DeepSeek 针对智能体"读多写少"的特点压缩了其记忆机制,每 token 仅占 890 字节缓存,比 DeepSeek-V1 小 437 倍。输入从 4K 扩展到 1M 时,每输出 token 的算力增加 25%。Flash 在 AA Index 上以 39 比 36 超过 V4-Pro,价格为每百万 token 0.27 美元对 0.67 美元。

  2. Aravind Srinivas(@AravSrinivas)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider 演示:决策模型速通《谁想成为百万富翁》

    Aravind Srinivas 展示 Perplexity Decider 的演示,该决策模型被 Sanchit Monga 称为最佳决策模型,并被用于其决策模型推理栈 EVE。演示中它速通了《谁想成为百万富翁》。

  3. Simon Willison's WeblogAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,同步上线订阅用户 API 额度

    Anthropic 发布快速低价模型 Claude Haiku 5.5,价格与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为每百万 token 输入 0.10 美元。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 点评 OpenAI 数学大动作

    Gary Marcus 与 Terence Tao 就 OpenAI 的数学领域大动作发表互补评论,试图解读数学研究的新范式。相关内容发布于 Gary Marcus 的 Substack。

  5. garymarcus.substack.comAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 评 OpenAI 新数学模型的模糊发布

    Gary Marcus 与 Terence Tao 就 OpenAI 新公布的数学成果发表互补评论。Marcus 指出,OpenAI 仅称"用同一流程、借助未发布模型"完成证明,未披露架构、失败率、训练与数据增强细节,还提到证明是否由 Lean 一次性生成并验证也不清楚。他认为无法判断该结果的通用性,甚至无法排除其只是借助 Lean 与合成数据在可验证领域取巧。

  6. Gary Marcus(@GaryMarcus)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑 OpenAI 未公开模型数学证明报告缺乏科学细节

    Gary Marcus 批评 OpenAI 一份关于未发布模型的报告信息严重缺失:未说明"same procedure"具体流程、架构细节(证明是否一次性生成再由 Lean 验证)、失败率,以及训练、后训练和数据增强方式。因此无法判断该结果在数学领域之外的可泛化性,它既可能是迈向 AGI 的一步,也可能只是借助 Lean 与合成数据在可验证领域的技巧性应用。

  7. 大模型智能AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 TIS 到 score centering,重新理解 LLM RL 中的训推不一致

    文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。

10月7日周三
  1. DatawhaleAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 十月组队学习开放报名,首次开设 Jev 课程共 11 门

    Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。

  2. Mistral AI(@MistralAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 在 Harvey 法律智能体基准 LAB 上位列开源模型第一

    在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。

  3. MIT Technology ReviewAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Download:减肥药显现延缓衰老迹象,Energy Dome 用二氧化碳电池储能

    Eli Lilly 和 Novo Nordisk 称,服用其 GLP-1 减肥药的患者在追踪 DNA 与关键蛋白变化的分子“衰老时钟”上衰老更慢,但这一结果的解读仍存疑问。

  4. 腾讯科技AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    辛顿首次参与递归自我改进研究:AI已开始参与造AI,人类或只剩一两年准备监管

    辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。

  5. AI前线AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection Beam 与 Mistral Large 4 同期发布,西方开放模型重新提速

    美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。

  6. Gary Marcus(@GaryMarcus)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:分不清神经网络自主解题与符号系统验证答案,就别评论 AI

    Gary Marcus 批评那些把「神经网络自己解决问题」与「神经网络提出答案、再由独立符号系统验证」混为一谈的评论者,称这种混淆正是对 AI 缺乏基本理解的典型表现。他强调,分不清这两者是根本性认知错误,不懂的人不应就 AI 发表评论。

  7. 机器之心AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈工大(深圳)与 NUS 提出 QuantWM:免训练 2-bit KV Cache 量化,视频世界模型压缩最高 6.20 倍

    哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。

  8. 跨国串门儿计划AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Huberman Lab 43 期混剪:一份学习、专注与深度工作指南

    从 43 期 Huberman Lab 中剪辑出的一集「学习指南」发布,按主题分 12 章重新编排,内容取自 Andrew Huberman 与 Cal Newport、Matthew Walker、James Clear 等 20 位嘉宾的原话,未添加旁白,时间跨度 2021-02-08 至 2026-08-31。

  9. Gary Marcus(@GaryMarcus)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 评 OpenAI 新数学成果:用 Lean 等符号 AI 加 LLM,但不等于 AGI

    Gary Marcus 就 OpenAI 新数学成果表态:该系统在 LLM 之外还使用了 Lean 等符号 AI,印证了他多年主张的神经符号 AI 路线。但他强调这并不意味着 OpenAI 已实现 AGI,因为数学领域的符号验证与符号数据增强无法在开放的真实世界中广泛泛化。他重申 2019 年的观点:神经符号 AI 是必要而非充分条件,世界模型同样关键。

  10. Greg Brockman(@gdb)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布了一批由其内部前沿模型产出的数学结果,并在 GitHub 上公开(github.com/openai/math)。发布前 OpenAI 咨询了普林斯顿高等研究院数学与人工智能独立咨询组的意见,并参考其建议与公开推荐来确定发布方式。Greg Brockman 表示这是朝着加速科学发现、改善所有人生活质量的方向。

  11. 刘润AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:10年之后,职场上只会剩下两种人

    李飞飞在Huberman Lab等播客访谈中判断,未来十年职场上更有竞争力的是把一件事做到极致的专才和什么都能上手的通才,两者共同的能力是主动性。她创办的World Labs正探索空间智能,让机器理解并生成三维空间;她认为AI的下一个前沿在语言之外,机器人落地仍需更长时间。

  12. Vercel NewsAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster 并限时免费

    Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。

  13. The Rundown AI(@TheRundownAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未公开内部模型发布 722 篇数学论文

    OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。

  14. OpenAI(@OpenAI)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。

  15. DeepLearning.AI(@DeepLearningAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo-V2.6-Pro RL 用质量清单加权修复应试模型,登顶开源模型智能指数

    小米发现只以通过测试为目标的模型会添加未被要求的代码并让错误静默通过,于是将每项测试结果乘以质量清单评分来修正。结果 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。

  16. Mistral AI(@MistralAI)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 端到端逆向恶意软件样本,12 分钟判定为 Cobalt Strike

    Mistral Large 4 面对未知二进制文件可端到端完成恶意软件逆向:本次任务中它判定样本为 Cobalt Strike,提取 IoC 与恶意软件配置,并生成报告和用于捕获后续攻击的 YARA 规则。这项原本可能耗时一天的工作,Mistral Large 4 用 12 分钟完成。

  17. Mistral AI(@MistralAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Mistral Large 4,19 道 CTF 题解出 18 道

    Mistral AI 发布 Mistral Large 4,并以其在 CTF 挑战中的表现展示推理能力。官方称在包含工具调用、解题时间均来自真实运行记录的 CTF speedrun 中,该模型解出 19 道题中的 18 道。

  18. Simon Willison(@simonw)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilypond Bach Benchmark:GPT-6 Astra 首次写出经过音

    GPT-6 Astra 在 Lilypond Bach Benchmark 上取得迄今最佳结果,其四声部众赞歌没有声部进行错误,和声语汇复杂到包含那不勒斯六和弦,并且是首个在该 benchmark 上写出经过音的模型。测试使用 Extra High effort,提示词要求在 LilyPond 2.24 中按巴赫风格写 G 小调 3/4 拍四声部众赞歌并只返回代码块。

10月6日周二
  1. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 联创 Christian Szegedy 长文《数学何去何从?》:AI 让数学「毕业」,两千年英雄攀登史落幕

    xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。

  2. AINLPAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Baseten 让 Claude Code 写推理引擎 VibeQwen,单流解码比 vLLM 快 90%

    Baseten 工程师 Shawn Rushefsky 分享实验,让 Claude Code 为 Qwen-3.6-35B-A3B 自主编写并优化推理引擎 VibeQwen。

  3. AI Engineer(@aiDotEngineer)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 解析量化、投机解码与推理控制带来的"更快模型"隐藏成本

    MiniMax 的 Morgan Suo 将在 AI Engineer New York 演讲《The Hidden Costs of a Faster Model》,拆解量化、投机解码与推理控制在生产环境中究竟改变了什么。该分享定于 10 月 14 日举行。

  4. Vercel NewsAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 现已上线 AI Gateway

    Mistral Large 4 已在 AI Gateway 上线,该开源权重模型原生支持多模态,将推理与文本、图像理解结合,适用于网络防御、制造和金融工作流。

  5. meng shao(@shao__meng)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection 预告首个西方开源模型 Beam:501B 总参数、23B 激活的 MoE 架构

    Reflection 预告其首个西方开源模型 Beam,采用 MoE 架构,总参数 501B、激活参数 23B,推理效率比 GLM 5.2 高 3–4 倍,官方称以 GLM 5.2 三分之一到四分之一的推理成本达到相当能力水平。

  6. elvis(@omarsar0)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection 发布 Beam 开源智能体模型,501B 总参数、23B 激活

    Reflection 发布 Beam,一个面向智能体的开源权重模型,总参数 501B、激活参数 23B,从零端到端训练,完整权重本月发布。转发的评价称其推理效率比 GLM 5.2 等竞品高 3-4 倍,在编码与智能体任务上推进了西方开源前沿。

  7. Simon Willison(@simonw)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 复测 Qwen 3.8 27B 本地长数字加法,对比推理与非推理模式

    Simon Willison 重跑了 Colin Fraser 早前针对 GPT-4o 的长数字加法实验,这次改用本地运行的 Qwen 3.8 27B,并分别测试推理模式与非推理模式。原帖未给出具体得分,仅附上实验记录链接。

10月5日周一
  1. meng shao(@shao__meng)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Hands-On Large Language Models》全书近 300 张自制图解拆解 LLM 原理与架构

    JayAlammar 与 MaartenGr 合著的《Hands-On Large Language Models》全书绘制近 300 张自制图,作者称之为 "The Illustrated LLM Book"。

  2. meng shao(@shao__meng)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 CME 295《Transformers & Large Language Models》开课,第二讲 138 页讲义公开

    斯坦福 2026 秋季新课 CME 295《Transformers & Large Language Models》已开课,由双胞胎兄弟 @afshinea 与 @shervinea 主讲,9 讲覆盖 Transformer 架构、RoPE、LoRA 微调、RLHF/GRPO 训练、Flash Attention、MCP 与 AI Agent、扩散语言模型。

10月4日周日
  1. meng shao(@shao__meng)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 MS&E 319「高效生成式语言模型」课程:公开前四节讲义,覆盖预训练到后训练效率设计

    斯坦福在线课程 MS&E 319「高效生成式语言模型」开课,聚焦从预训练、架构、推理到后训练的效率设计,已公开前四节课程讲义。授课教师为 Amin Karbasi、Anay Mehrotra、Amin Saberi 和 Grigoris Velegkas 四人。

  2. InfoQ 中文AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    o1 奠基人 Noam Brown:1 万个 Agent 解出世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。

  3. meng shao(@shao__meng)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sebastian Raschka 第 6 讲:用纯 PyTorch 从零实现 GRPO 训练推理模型

    Build A Reasoning Model (From Scratch) 系列第 6 讲由 Sebastian Raschka 讲解用 GRPO 做可验证奖励的强化学习(RLVR),这是该系列首次真正更新模型权重。

  4. Amjad Masad(@amasad)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联合创始人 Alex Atallah 谈 Stripe 收购:为什么 AI 的未来是独立与专业化

    OpenRouter 联合创始人 Alex Atallah 在 Stripe 收购后首期播客中,与 Replit 联合创始人 Amjad Masad 及 a16z 的 Erik Torenberg 探讨 AI 的未来为何是独立与专业化。

10月3日周六
  1. orange.ai(@oran_ge)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地跑 Qwen Flash 读写速度一周内提升近十倍

    作者称自己的本地机双 5070ti 跑 Qwen Flash,从上周末的 200 prefill、10 decode 提升到今天在 Strata 与自制 PR 支持下的 2200/67,只用一张卡,读写速度都提高近十倍。

  2. meng shao(@shao__meng)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CMU 11-768《AI Agents》第 12 讲讲义公开:强化学习系统

    CMU 秋季课程 11-768《AI Agents》第 12 讲讲义公开,主题为强化学习系统(RL Systems),由 @gneubig 主讲,聚焦如何在真实多 GPU 集群上跑通 LLM Agent 的 RL 训练。