跳到正文

#数据/训练

今日 42 条
7月25日周六
  1. Microsoft Research(@MSFTResearch)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 与 Broad Institute 合作项目 Ex Vivo 如何用 AI 推进精准肿瘤学

    Microsoft Research 与 Broad Institute 合作推出 Project Ex Vivo,并获 Dana-Farber Cancer Institute 支持,利用 AI 更好地理解癌细胞状态,以推进精准肿瘤学。项目详情已发布于 Signal Magazine。

7月24日周五
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley AI Research 的 Peter Bartlett 将在 ICM2026 作全会报告

    Berkeley AI Research 的 Peter Bartlett 将于 2026 年 7 月 28 日在 ICM2026 作全会报告,题目为《Modern Machine Learning Methods。

7月23日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    无需梯度下降:研究团队给出直接向 Transformer 模块写入事实的闭式方法,获 COLM 2026 接收

    Jerry Liu 与 HazyResearch 等合作者提出一种闭式(closed-form)方法,可将事实直接写入面向 Transformer 的 MLP,无需梯度下降或训练,相关工作已被 COLM 2026 接收。该研究指出 MLP 在语言模型中承担事实存储功能,并给出可直接存储事实的 MLP 构造配方。

7月22日周三
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 等八位经济学家合著论文《递归自我改进的经济学》,探讨 AI 加速 AI 研发的反馈强度

    METR 的 Parker 与 Tom 联合 7 位经济学家发布论文《The Economics of Recursive Self-Improvement》,用一系列简单模型刻画 AI 如何加速 AI 研发。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tatsunori Hashimoto:Gigatoken 快到无需在训练前等待 tokenization

    Tatsunori Hashimoto 称 Gigatoken 速度极快,让他(有望)不必再等待 tokenization,并认为训练前无需等待 tokenization 是一种范式转变。他指出,即便是 tokenizer 这类成熟组件,只要贴近硬件、用状态机实现,仍有数量级的提升空间。

  3. 张小珺Jùn|商业访谈录AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up

    蚂蚁集团孵化的蚂蚁灵波刚发布第二代具身基础模型,首席科学家沈宇军在本期访谈中介绍了这次发布的 Depth、Vision、VLA、Video、World、VA 2.0 六个模型及其关系。

  4. Microsoft Research(@MSFTResearch)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 感谢数据集创建者与社区贡献者,并征集下一版本的语言支持

    Microsoft Research 公开致谢数据集创建者、社区贡献者、维护者与合作伙伴,称他们持续推动这项工作。该团队同时开放征集额外语言支持,以用于下一个版本的发布。

  5. Microsoft Research(@MSFTResearch)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 扩展 PazaBench V2,提升语音 AI 基准的语言与地域覆盖

    PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。

  6. QdrantAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 增量嵌入更新教程:让向量搜索与文档变更同步

    Qdrant 发布增量嵌入更新教程,提供一套从第一天就能部署的流水线,检测文本数据变更并只重新嵌入改动的分块:未变的分块保持不动、文本移动时复用向量、新增与删除同步处理。

7月21日周二
  1. METRAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 提出"支出视界"指标衡量 AI 优化能力,并以 NanoGPT 为例

    METR 提出用"支出视界"(expenditure horizon)量化 AI 智能体的优化能力,即 AI 与人类在同等预算下效率持平的美元成本。在 NanoGPT speedrun 的实测中,人力边际上每提升 1% 性能约需 2500 美元人力成本,而初步智能体优化跑在花费超 1 万美元后,估计支出视界仅为 0–3000 美元。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aurora 1.5 扩展开放预测能力,Flint 重定义可视化,FlowDAgger 加速自适应

    微软研究院推出 Aurora 1.5,将开放预测能力进一步扩展,同时发布 Flint 重定义可视化、FlowDAgger 加速自适应。此外,AI 智能体攻破了 Rowhammer 防御,内存技术正在重塑对话式 AI。

7月18日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 LLM 中控制推理努力程度

    GPT-5.6 模型家族包含三种尺寸,每种尺寸提供大约五到六档推理努力设置。文章以 DeepSeek-R1 的 RLVR 训练方法为基础,讲解如何开发具备多种努力模式的推理模型,其中 OpenAI o1 让基于 LLM 的推理模型概念流行起来。

  2. Jim Fan(@DrJimFan)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 介绍 RoboTTT 机器人模型:上下文扩至 8000 时间步

    Jim Fan 介绍 RoboTTT,将机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,推理成本保持恒定,比 SOTA 推进三个数量级。

7月17日周五
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 助力解决统计学悬置难题:BH 方法在相关高斯检验下不控制 FDR

    宾夕法尼亚大学 Edgar Dobriban 借助 GPT-5.6 Sol Pro 推翻了统计学界二十年来的猜想:Benjamini-Hochberg 方法对相关双侧高斯检验并不普遍控制错误发现率(FDR)。

7月16日周四
  1. 硅谷101AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    机器人走错路了?苏度科技韩铮谈具身智能的3D数据、路径分野与硅谷竞赛

    苏度科技联合创始人兼CEO韩铮在硅谷101播客中称,公司走软硬件协同设计的上下分层路线,上层负责规划与环境理解、下层负责物体操作,并以Sim-to-Real为核心训练范式。其零样本通用抓取单次成功率接近100%,节目中另有片段提到98%。他预测,被硅谷主流冷落的"上下分层"路线将重新回到主流。

7月15日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA GEAR Lab 推出 RoboTTT,将机器人策略扩展到 8K 时间步视觉运动上下文

    NVIDIA GEAR Lab 发布 RoboTTT,将机器人策略的视觉运动上下文扩展到 8K 时间步,远超当前 SOTA,且推理延迟保持恒定。凭上下文中的数分钟经验,机器人可单次模仿人类视频演示、在部署中自我改进、从扰动中恢复,并完成 5 分钟 10 阶段装配流程。

  2. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI Futures 团队在 Nature Health 发表论文:分析 109 国 170 万次 Copilot 对话

    Microsoft AI Futures 团队在 Nature Health 发表新论文,审查了覆盖 109 个国家的 170 万次对话,发现 Copilot 对本国卫生系统信心较低的人群尤其有价值。团队称这是 AI 为全球服务不足人群提供支持的进一步证据。

  3. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arm CEO Rene Haas:AI 数据中心反对派或重蹈制造业外流覆辙

    Arm CEO Rene Haas 在 AI 数据中心争论中指出,当年反对美国制造业外流至中国的阵营,如今若在本土阻挠 AI 工厂生态,可能重蹈覆辙。Tae Kim 称 AI 终将到来,问题在于美国是否要留下相关岗位与制造生态。

7月14日周二
  1. Epoch AIAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 解读 AI 能耗:单次聊天机器人提问仅需约 0.6 Wh

    Epoch AI 估算,向免费聊天机器人发送 100 词提示词生成回复约耗 0.6 Wh 电,比微波炉运行 10 秒还少。AI 目前仅占美国年用电量的百分之几,低于空调(12%)和照明(8%),但数据中心电力需求大约每年翻一番。

  2. QdrantAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 批量上传数据指南:内存、索引与量化策略

    Qdrant 发布批量上传数据指南,针对大规模写入密集和稀疏向量时的内存、磁盘与搜索可用性问题给出配置策略。指南基于 Qdrant v1.19 引入的 memory 设置,提供三条路径:将密集向量设为 cold 存盘、上传前建好 payload 索引、以及用 TurboQuant 量化在 RAM 中保留压缩副本,其中 BITS4 为默认最接近全精度、BITS1 压缩最高。

  3. Fei-Fei Li(@drfeifei)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队致谢 Simovation 与 NVIDIA:JoyLo 遥操作数据助力 BEHAVIOR 数据集

    李飞飞团队在 BEHAVIOR 数据集相关工作中致谢 Simovation 提供模拟环境下的高质量 JoyLo 遥操作数据,并说明 BEHAVIOR 构建于 NVIDIA Omniverse 之上,感谢 NVIDIA 的持续支持。

7月13日周一
  1. 十字路口CrossingAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话英灵殿 Odin:AI4S 需要狂人与野心家,想造"全模态分子世界模型"

    英灵殿创始人 Odin 投身 AI for Science 创业,已融资数千万美元,想造"全模态分子世界模型"和"通用科学人工智能",做一台"新时代科学发现的蒸汽机"。他高中辍学后自学考上浙大,修过药学和物理,曾进 David Baker 实验室又选择离开。团队约 30 人,短期内坚决不做药物管线。

7月11日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ICML 2026 收官日:Jessica Chudnovsky 将报告 "Scale Dependent Data Duplication"

    Stanford AI Lab 在 ICML 2026 最后一天推荐 "Scale Dependent Data Duplication"。

7月10日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 提出 D2D:蒸馏放大微调 LLM 隐藏偏见

    斯坦福 AI 实验室提出 Distill to Detect(D2D),将疑似有偏见的微调模型与其基座模型之间的差异蒸馏进一个小型 cartridge,把隐藏偏好放大到生成文本中,使现有审计方法能识别原本无法搜索的偏见信号。该方法针对只在某个未知话题上显现的隐蔽偏见,论文见 arXiv 2607.01208。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文《Internal Data Repetition Destroys Language Models》获 ICML 2026 深度生成模型基础研讨会口头报告与亚军奖

    论文《Internal Data Repetition Destroys Language Models》在 ICML 2026 的 Foundations of Deep Generative Models 研讨会上进行口头报告,并获该研讨会亚军奖。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报

    Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报,面向真实场景的天气、气候和能源应用。该版本由 Microsoft Research 发布。

7月8日周三
  1. Mistral AI(@MistralAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI:完全在仿真中训练,前缀缓存配方将训练 token 减少 22 倍

    Mistral AI 展示了一套完全在仿真中训练的方案:覆盖 6000 个场景、约 40 万条轨迹,其前缀缓存(prefix-caching)配方将训练 token 用量减少 22 倍,把原本数月的训练压缩到数天。在线强化学习(CISPO)进一步提升了成功率。

  2. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    因 8 ≈ e²,Anthropic 研究员提效很可能超过 2 倍

    Anthropic 在 Q2 2026 的 RSI 博客称其贡献者日均合并代码量是 2021-2024 年的 8 倍。基于 Cobb-Douglas 与 CES 生产函数建模,Thomas Kwa 推断仅凭编程智能体带来的研究员提效就超过 2 倍:Cobb-Douglas 在 β=0.5 下给出约 2.83 倍,CES 均质代码情形为 [2.75, 2.91]。

7月7日周二
  1. Hugging Face(@huggingface)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Training Agents 2:模型蒸馏训练自定义智能体的直播教程

    Hugging Face 发布 Training Agents 2 直播教程,讲解如何用模型蒸馏训练自定义智能体。该教程以直播形式进行,附有 x.com 直播链接。

  2. Berkeley AI Research BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能免费时代,数据系统如何为智能体、由智能体、属智能体

    伯克利 EPIC Data Lab 提出,推理价格已从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1,部分厂商低于 $0.10,年均降幅中位数近 50 倍,近乎免费的智能正在到来。

  3. Lilian Weng(@lilianweng)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 谈 AI 自我改进的 harness 工程

    Lilian Weng 发布新文章,探讨 harness 工程如何推动 AI 自我改进。她认为 harness 工程或将朝自我改进方向演进并实现自动研究,而更聪明的模型又会让 harness 保持简单;即便许多 harness 改进最终被内化进核心模型,明确目标与上下文的需求也不会消失。

  4. 字节跳动SeedAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节 Seed 发布 EdgeBench 评测集,提出环境学习 log-sigmoid 规律

    字节跳动 Seed 发布超长程评测集 EdgeBench,包含 134 个真实任务,横跨科学、复杂软件工程、白领知识工作、算法优化、前沿数学和数字游戏六大领域,每个任务支持 Agent 持续工作至少 12 小时,部分延长实验超过 72 小时。

7月5日周日
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    研究:预训练数据残留重复最坏可浪费 33% 算力,重复结构可由模型规模预测

    斯坦福 AI Lab 分享的研究《Internal Data Repetition Destroys Language Models》量化了预训练数据去重后残留重复的代价:最坏情况下可浪费高达 33% 的算力(FLOPs),且最坏情况的重复结构可由模型规模预测。

  2. cat(@_catwu)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 在留存分析中主动采用倾向得分匹配

    Claude Fable 5 在用户的留存分析中未经提示便自动使用了倾向得分匹配,将用户按活跃度对齐后再做同类比较。用户称 Fable 5 在各类任务中的判断力均有提升,包括在 Cowork 中撰写邮件和文档、在 Claude Code 中调试复杂错误。

7月4日周六
  1. 李继刚(@lijigang_com)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚:书架上的书,是你大脑的训练语料

    李继刚把书架比作大脑的训练语料,指出多数人对选书毫无门槛:畅销榜推什么读什么,等于拿互联网噪声训练自己的神经网络。他认为"多"不是好指标,关键是你允许谁的思想进入你的权重,每读一本平庸的书都是在用平庸覆盖本可形成的结构、占用梯度更新方向。

7月3日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mira Murati:Bridgewater 借助 Tinker API 微调模型,帮分析师聚焦核心工作

    Mira Murati 表示 Bridgewater 利用其金融专业知识,与 Thinking Machines 的 Tinker API 合作微调了一个模型,帮助其分析师专注于重要工作。她称这是"专家改进 AI,AI 赋能专家"。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford 提出 Freeform Preference Learning:用自然语言偏好轴改进机器人策略

    Stanford AI Lab 提出 Freeform Preference Learning,让标注者用自然语言描述偏好轴,并据此学习条件奖励、提取更优策略。该方法针对机器人反馈中单一偏好会掩盖信息的问题——如同样的两条轨迹,一条掉了餐具、一条掉了盘子,只问一个偏好无法体现差异。相关博客与论文已公开(arXiv 2606.32027)。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 QuasiMoTTo:用相关采样提升推理算力扩展效率

    Stanford AI Lab 提出 QuasiMoTTo,通过改用相关采样而非独立并行采样来扩展推理算力,减少重复求解带来的浪费。该方法在测试时扩展中实现同等性能、样本量减少 25-47%,并将 RL 训练步数减少 50%;相关样本覆盖度更高,边际上仍是 LLM 的精确采样,且可并行生成。

7月2日周四
  1. Epoch AIAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-4 在 ECI 榜首停留时间远超其他任何模型

    Epoch AI 追踪各时点 ECI 得分最高的模型及其在榜首的持续时间,结果显示 GPT-4 领先的时间远超其他任何模型。ECI 会随时间小幅波动,但很少足以大幅改变模型排名,且这一回顾性视角未计入模型发布后 ECI 估计值的变化。

7月1日周三
  1. 哔哩哔哩技术AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站技术团队携 FATE 系列 SABER、CASTER 亮相 ACL 2026

    B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。