跳到正文

#论文/研究

今日 1 条
今天10月10日周六
  1. AI Will(@FinanceYF5)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未发布内部模型生成 722 篇数学手稿

    OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。

10月7日周三
  1. OpenAI(@OpenAI)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。

9月24日周四
  1. Anthropic(@AnthropicAI)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 在噬菌体 DNA 中发现未知酶系统

    Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统。该酶基因旁有一段与 CRISPR 有些相似的长重复 DNA 序列,目前尚不清楚该系统的作用,但已知具备类似特征的少数系统都能剪切、复制和粘贴 DNA。

9月16日周三
  1. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:GPT-6 Astra 在数学基准上领先,软件工程并非如此

    Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。

8月31日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 靠后训练追平开源模型榜首,CyberGym 得分 84.5% 引发安全暂缓

    GLM-5.3 在 Artificial Analysis Intelligence Index 上得分 60,在开源权重模型中并列第一。其整体智能提升完全来自对 GLM-5.2 的微调,而非训练新的基础架构,通过在长时间运行的软件工程环境中训练,模型涌现出网络安全能力,在 CyberGym 上得分 84.5%。

5月9日周六
  1. Alex Albert(@alexalbert__)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评测 Claude Mythos Preview 时间跨度超次优模型 2 倍

    Alex Albert 称,提供给 METR 的早期 Claude Mythos Preview 快照在 METR 80% 成功率基准上的时间跨度超过次优模型 2 倍。METR 表示在 2026 年 3 月的有限窗口内对该早期版本做了风险评估,在其任务套件上估计 50% 时间跨度为至少 16 小时(95% CI 8.5 至 55 小时),已接近其在无新任务情况下可测量的上限。

3月1日周六
  1. DeepSeek(@deepseek_ai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V3/R1 推理系统概览

    DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。