跳到正文

#数据/训练

今日 1 条
今天10月10日周六
  1. 宝玉(@dotey)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布决策模型 Microsoft-Decision-1,基于 Qwen3.5-9B 后训练

    微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。

10月8日周四
  1. Perplexity(@perplexity_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    9B 与 0.6B 模型在 Q2D-Web 检索基准上超越 nemotron-embed-8b

    在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。

10月7日周三
  1. 国际大厂AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部模型 722 篇数学论文,攻克 500 个公开数学难题中的 90 个

    OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。

    为什么值得看

    汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。

10月4日周日
  1. cohere(@cohere)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 推出 North Small Translate 开源机器翻译模型,1T 参数以下全球最佳

    Cohere 推出开源机器翻译模型 North Small Translate,称其为 1T 参数以下全球最佳。该模型权重与流程均对外开放,并由 Cohere 本地化负责人 Tom Kocmi 出镜讲解。

10月1日周四
  1. 爱范儿AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 4 Argon 正式发布,知识写作强于编程与 Agent 能力

    Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。

  2. Aravind Srinivas(@AravSrinivas)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源上下文嵌入模型 pplx-embed-v2-context-9b-preview,在 turbopuffer context-bench 上表现最佳

    Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。

  3. Perplexity(@perplexity_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 预览版模型在 ConTEB 平均 nDCG@10 居首,向量存储仅 1 KB

    在 ConTEB 基准上,该预览版模型取得所测模型中最高的平均 nDCG@10,但并非每个任务都领先。它在 chunk retrieval 上超过 voyage-context-4,且每个向量仅占 1 KB(1024 维、int8),相比后者的 8 KB(2048 维、float32)存储占用降低 8 倍。

  4. Perplexity(@perplexity_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 推出 pplx-embed-v2-context-9b-preview,上下文嵌入模型刷新 ConTEB 纪录

    Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。

9月30日周三
  1. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质加水印

    Google DeepMind 推出 SynthID Bio,将 SynthID 水印技术扩展到合成生物学,可在生物代码中嵌入不可感知的签名,并能在合成出的物理蛋白质上验证,同时保持其生物学功能。

  2. cohere(@cohere)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 发布 Embed 5 嵌入模型系列,含 Pro 与 Fast 两个版本

    Cohere 发布 Embed 5 嵌入模型系列,提供 Embed 5 Pro 与 Embed 5 Fast 两个版本。Pro 主打前沿能力,Fast 主打低延迟性能。

  3. Jerry Liu(@jerryjliu0)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 开源 Jev 模型,文档任务基准超越同类 OSS 模型

    LlamaIndex 发布 Jev 模型,并联合其他 OSS 模型(含通用分类器与文档专用模型)在方向检测、语言检测、分类、拆分等需快速决策的文档任务上做了基准测试,从准确率、成本、延迟三个维度评估,Jev 在多数基准中领先。模型代码与视频已通过 GitHub 仓库和 YouTube 公开。

  4. NVIDIA AI(@NVIDIAAI)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 开源 Kumo Tabular 表格数据基础模型系列

    NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。

9月29日周二
  1. Akshay Kothari(@akothari)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 评测:Opus 5.5 与 GPT-6 Luna 如何改变成本质量前沿

    Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。

9月24日周四
  1. Anthropic(@AnthropicAI)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 在噬菌体 DNA 中发现未知酶系统

    Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统。该酶基因旁有一段与 CRISPR 有些相似的长重复 DNA 序列,目前尚不清楚该系统的作用,但已知具备类似特征的少数系统都能剪切、复制和粘贴 DNA。

9月23日周三
  1. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical 临床语音转写模型

    ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 在 ParseBench 拿下 93.9%,成 PDF 表格解析最强前沿模型

    Opus 5.5 在 PDF 表格解析基准 ParseBench 上得分 93.9%,比 Opus 5 提升 7% 以上,超过 Fable、Gemini 和 Astra。其表格质量与 LlamaParse Agentic Plus 相当,但在图表、格式和版面处理上仍有不足,每页成本 5.8 美分,作为生产级 OCR 方案偏贵。完整结果见 parsebench.ai。

  3. Perplexity(@perplexity_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 实测:提示词使模型规避原失败案例比例从 75.1% 升至 93.7%

    在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。

9月22日周二
  1. ElevenLabs(@elevenlabsio)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical,临床音频转录 WER 降低 18%

    ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。

  2. Hunyuan(@TXhunyuan)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4 preview 用 214 GiB 装下 770B 参数模型:STQ1_0 量化如何做到"体积更小、智能不变"

    腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。

9月17日周四
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo-V2.6 大规模 RL 训练进展公开,Fuli Luo 称将逐项开源细节

    小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。

  2. 夕小瑶科技说AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米直播 MiMo-V2.6 强化学习训练,两天花费超113万美元

    小米 MiMo 大模型负责人罗福莉宣布,新一代模型 MiMo-V2.6 处于强化学习训练阶段,训练过程实时对外直播,页面同时跑 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两条线,数据直接来自训练器日志。

9月16日周三
  1. Jeff Dean(@JeffDean)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Periodic Labs 用 1300 块 H200 训练开源模型 Neon,称在分析基准上超过 GPT-6 Astra

    Jeff Dean 转发并祝贺 Liam Fedus 及 Periodic Labs 团队的研究结果。Liam Fedus 称团队在 Menlo Park 搭建高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。

  2. NVIDIA AI(@NVIDIAAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron Labs 专家解读 Nemotron 后训练

    NVIDIA Nemotron Labs 推出「Ask the Experts」栏目,专门解读 Nemotron 的后训练流程。内容以直播形式发布,原帖附带 x.com 直播链接。

9月14日周一
  1. 小红书技术REDtechAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书 AllSpark 发布开源 Search Agent Iris,35B 版本逼近万亿参数模型

    小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。

9月11日周五
  1. Greg Brockman(@gdb)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 在抗体成药性预测基准上超越其他前沿模型

    GPT-6 Astra 在抗体成药性预测基准测试中成为表现最佳的前沿模型,优于测试中的其他前沿模型。它可预测抗体聚集、稳定性等成药性属性,连展示抗体工作机制的交互式可视化也用 Astra 在约 1 小时内构建完成。

  2. Scott Wu(@ScottWu46)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-2 模型,评测追平前沿且成本最多降 70%

    Cognition 发布 SWE-2 模型,称在主流评测上得分与近期前沿模型相当,成本最多降低 70%。该模型通过在数万亿参数规模上做强化学习训练,在能力与成本两端同时推动帕累托曲线。Devin 付费方案用户可在接下来一个月免费使用。

9月10日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 552B 参数 MoE 非对称架构模型

    DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。

  2. DeeplearningAIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomson Reuters 发布法律金融领域专用模型 Thomson

    Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。

9月8日周二
  1. Demis Hassabis(@demishassabis)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepMind 发布 AlphaGenome Atlas,可预测 90 亿个单字母 DNA 变异影响

    DeepMind 发布 AlphaGenome Atlas。继 AlphaFold 绘制蛋白质宇宙之后,该工具用于绘制人类基因组,可预测全部 90 亿个可能的单字母 DNA 变异带来的影响,帮助科研人员更好地理解疾病。该资源面向学术研究免费开放,地址为 alphagenome.google/atlas。

9月5日周六
  1. 小米技术AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布表格数据大模型 Xiaomi-TabLDM 并开源权重

    小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。

9月3日周四
  1. Google DeepMind(@GoogleDeepMind)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 WeatherNext 3,直接从实时观测学习全球天气预测

    Google DeepMind 与 Google Research 联合推出 WeatherNext 3,该模型直接从真实世界实时观测数据中学习,能更快给出更本地化、更准确的全球天气预报。官方称其在全球天气预测方式上是重大突破。

  2. Google DeepMind BlogAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接使用实时地球静止卫星数据训练,可逐小时生成天气预报,温度和湿度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 的 25 公里网格清晰约五倍。

  3. DeepLearning.AI(@DeepLearningAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4 Pro 0813 发布,并开源评测框架 DeepSeek Harness

    DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。

9月2日周三
  1. Qwen(@Alibaba_Qwen)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen3.8-Max-0902,2.4T 参数、1M 上下文

    Qwen 将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T,上下文窗口 1M tokens。该版本在 Coding 与 Cowork 方向做了后训练,官方称在复杂企业任务、科研和长周期工作流上表现更强。API 定价为每 1M tokens 输入 $2、输出 $6,显式缓存命中 $0.17、隐式缓存命中 $0.25,现已在 QwenCloud 上线。

    为什么值得看

    官方给出参数规模、上下文长度和 API 定价,读者可据此判断它在长流程任务上的接入成本。

9月1日周二
  1. 腾讯混元AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview 轻量量化版,权重从 1.5 TB 压到 214 GB

    腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 GigaPath-Flash 与 GigaTIME-Flash:病理基础模型如何用更少算力保持强性能

    微软研究团队推出 GigaPath-Flash 与 GigaTIME-Flash,在保持强性能的同时降低计算需求,为更大规模研究和更广泛探索打开空间。

  3. Microsoft Research BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 推出 GigaPath-Flash 与 GigaTIME-Flash 病理基础模型

    Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。

8月30日周日
  1. Hunyuan(@TXhunyuan)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元开源 Hy4 preview:770B 总参数 MoE,支持 1M 上下文

    腾讯混元开源 Hy4 preview,采用 Apache 2.0 许可,总参数 770B、每 token 激活 49B,支持 1M 上下文,并自带用于投机解码的原生 MTP 层。

8月27日周四
  1. 阿里研究院AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Flash 多模态 MoE 模型并开源 Next 权重

    阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。

    为什么值得看

    官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。

8月26日周三
  1. Qwen(@Alibaba_Qwen)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash-Next 的 QSA 注意力内核:1M 上下文下 prefill 提速 7.6×、decode 提速 4.9×

    在 1M-token 上下文长度下,QSA 的注意力内核在 prefill 阶段最高提速 7.6×,decode 阶段提速 4.9×。当 prefix-cache 命中率为 90% 时,Qwen3.8-Flash-Next 的 prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。