跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 1–7 条 · 共 7 条
10月7日周三
  1. 国际大厂AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部模型 722 篇数学论文,攻克 500 个公开数学难题中的 90 个

    OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。

    为什么值得看

    汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。

9月29日周二
  1. 有新NewinAI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AMD 以 82 亿美元收购 World Labs,李飞飞出任首席科学家

    AMD 与 World Labs 达成收购协议,交易金额 82 亿美元,交易预计今年年底前完成,仍需获得监管批准;World Labs 创始人李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接与 CEO 苏姿丰及团队合作。

    为什么值得看

    交易把世界模型团队接入芯片研发链条,读者可以了解空间智能路线与硬件协同的动因。

9月2日周三
  1. Qwen(@Alibaba_Qwen)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen3.8-Max-0902,2.4T 参数、1M 上下文

    Qwen 将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T,上下文窗口 1M tokens。该版本在 Coding 与 Cowork 方向做了后训练,官方称在复杂企业任务、科研和长周期工作流上表现更强。API 定价为每 1M tokens 输入 $2、输出 $6,显式缓存命中 $0.17、隐式缓存命中 $0.25,现已在 QwenCloud 上线。

    为什么值得看

    官方给出参数规模、上下文长度和 API 定价,读者可据此判断它在长流程任务上的接入成本。

8月27日周四
  1. 阿里研究院AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Flash 多模态 MoE 模型并开源 Next 权重

    阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。

    为什么值得看

    官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。

8月25日周二
  1. SemiAnalysisAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Jalapeño 芯片实测:能效超过 Nvidia Blackwell

    OpenAI 在 Hot Chips 上公布了与 Broadcom 合作自研的推理芯片 Jalapeño,设计始于 2024 年中,约 16 个月完成流片,SemiAnalysis 受邀在其实验室用 InferenceX 实测该芯片。

    为什么值得看

    SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片 Jalapeño,给出逐场景吞吐与能效对比及架构细节。

7月27日周一
  1. 月之暗面 KimiAI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 开放日:模型权重、技术报告与关键 Infra 技术同步开放

    月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重、技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。

    为什么值得看

    Kimi K3 开放权重、技术报告与 Infra 技术,读者可了解其 2.8 万亿参数 MoE 与 3 倍规模化效率的具体做法。

12月3日周三
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 DeepSeek V3 到 V3.2:架构、稀疏注意力与 RL 更新

    Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。

    为什么值得看

    梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。