微软发布决策模型 Microsoft-Decision-1,基于 Qwen3.5-9B 后训练
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
Cohere 推出开源机器翻译模型 North Small Translate,称其为 1T 参数以下全球最佳。该模型权重与流程均对外开放,并由 Cohere 本地化负责人 Tom Kocmi 出镜讲解。
Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。
Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。
在 ConTEB 基准上,该预览版模型取得所测模型中最高的平均 nDCG@10,但并非每个任务都领先。它在 chunk retrieval 上超过 voyage-context-4,且每个向量仅占 1 KB(1024 维、int8),相比后者的 8 KB(2048 维、float32)存储占用降低 8 倍。
Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。
Google DeepMind 推出 SynthID Bio,将 SynthID 水印技术扩展到合成生物学,可在生物代码中嵌入不可感知的签名,并能在合成出的物理蛋白质上验证,同时保持其生物学功能。
Cohere 发布 Embed 5 嵌入模型系列,提供 Embed 5 Pro 与 Embed 5 Fast 两个版本。Pro 主打前沿能力,Fast 主打低延迟性能。
LlamaIndex 发布 Jev 模型,并联合其他 OSS 模型(含通用分类器与文档专用模型)在方向检测、语言检测、分类、拆分等需快速决策的文档任务上做了基准测试,从准确率、成本、延迟三个维度评估,Jev 在多数基准中领先。模型代码与视频已通过 GitHub 仓库和 YouTube 公开。
NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。
Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。
Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统。该酶基因旁有一段与 CRISPR 有些相似的长重复 DNA 序列,目前尚不清楚该系统的作用,但已知具备类似特征的少数系统都能剪切、复制和粘贴 DNA。
ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。
Opus 5.5 在 PDF 表格解析基准 ParseBench 上得分 93.9%,比 Opus 5 提升 7% 以上,超过 Fable、Gemini 和 Astra。其表格质量与 LlamaParse Agentic Plus 相当,但在图表、格式和版面处理上仍有不足,每页成本 5.8 美分,作为生产级 OCR 方案偏贵。完整结果见 parsebench.ai。
在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。
ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。
腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。
小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。
小米 MiMo 大模型负责人罗福莉宣布,新一代模型 MiMo-V2.6 处于强化学习训练阶段,训练过程实时对外直播,页面同时跑 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两条线,数据直接来自训练器日志。
Jeff Dean 转发并祝贺 Liam Fedus 及 Periodic Labs 团队的研究结果。Liam Fedus 称团队在 Menlo Park 搭建高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。
NVIDIA Nemotron Labs 推出「Ask the Experts」栏目,专门解读 Nemotron 的后训练流程。内容以直播形式发布,原帖附带 x.com 直播链接。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
GPT-6 Astra 在抗体成药性预测基准测试中成为表现最佳的前沿模型,优于测试中的其他前沿模型。它可预测抗体聚集、稳定性等成药性属性,连展示抗体工作机制的交互式可视化也用 Astra 在约 1 小时内构建完成。
Cognition 发布 SWE-2 模型,称在主流评测上得分与近期前沿模型相当,成本最多降低 70%。该模型通过在数万亿参数规模上做强化学习训练,在能力与成本两端同时推动帕累托曲线。Devin 付费方案用户可在接下来一个月免费使用。
DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。
Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。
DeepMind 发布 AlphaGenome Atlas。继 AlphaFold 绘制蛋白质宇宙之后,该工具用于绘制人类基因组,可预测全部 90 亿个可能的单字母 DNA 变异带来的影响,帮助科研人员更好地理解疾病。该资源面向学术研究免费开放,地址为 alphagenome.google/atlas。
小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。
Google DeepMind 与 Google Research 联合推出 WeatherNext 3,该模型直接从真实世界实时观测数据中学习,能更快给出更本地化、更准确的全球天气预报。官方称其在全球天气预测方式上是重大突破。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接使用实时地球静止卫星数据训练,可逐小时生成天气预报,温度和湿度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 的 25 公里网格清晰约五倍。
DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。
Qwen 将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T,上下文窗口 1M tokens。该版本在 Coding 与 Cowork 方向做了后训练,官方称在复杂企业任务、科研和长周期工作流上表现更强。API 定价为每 1M tokens 输入 $2、输出 $6,显式缓存命中 $0.17、隐式缓存命中 $0.25,现已在 QwenCloud 上线。
官方给出参数规模、上下文长度和 API 定价,读者可据此判断它在长流程任务上的接入成本。
腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。
微软研究团队推出 GigaPath-Flash 与 GigaTIME-Flash,在保持强性能的同时降低计算需求,为更大规模研究和更广泛探索打开空间。
Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。
腾讯混元开源 Hy4 preview,采用 Apache 2.0 许可,总参数 770B、每 token 激活 49B,支持 1M 上下文,并自带用于投机解码的原生 MTP 层。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
在 1M-token 上下文长度下,QSA 的注意力内核在 prefill 阶段最高提速 7.6×,decode 阶段提速 4.9×。当 prefix-cache 命中率为 90% 时,Qwen3.8-Flash-Next 的 prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。