Perplexity 推出 pplx-embed-v2-context-9b-preview,上下文嵌入模型刷新 ConTEB 纪录
Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。
Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。
Google DeepMind 将 SynthID 引入生物学领域,推出蛋白质水印方法 SynthID Bio,让 AI 生成的蛋白质可以被水印标记。相关成果发表在 Nature 上,团队还实现了兼具功能性与水印的 AI 设计蛋白质的成功合成,并将 SynthID Bio 工具开源供研究社区使用。Demis Hassabis 称这是 AI 时代生物安全的关键一步。
针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。
Lenny Rachitsky 发问:还有比你的 Google 数据更有价值的数据集吗?他指出每个 AI 助手都在"吞食"这些数据并做出奇妙的事,而 Google 在这一领域却不见踪影。该帖获得 119 条回复、16 次转发和 592 个点赞,浏览量达 116059。
Google DeepMind 推出 SynthID Bio,将 SynthID 水印技术扩展到合成生物学,可在生物代码中嵌入不可感知的签名,并能在合成出的物理蛋白质上验证,同时保持其生物学功能。
Sharpa 在 IROS 2026 上一口气发布三款自研硬件:一体式触觉感知机器人本体 D01、新一代全触觉灵巧手 W02、外骨骼触感数据手套 AE01。D01 手臂载荷自重比接近 1:1,最大末端执行器速度超 10.5 m/s,通信频率 1000 Hz,单臂负载 5 公斤,电子皮肤支持 100 Hz 触觉采样、0.1–20 N 力感知范围和 0.2 N 力分辨率。
LlamaIndex 对 Jev 与其他开源模型(含通用分类器和文档专用模型)在方向检测、语言检测、分类、切分等文档任务上做了基准测试,衡量准确率、成本和延迟三个维度。Jev 在多数基准和这三个维度上领先。相关代码已开源于 github.com/run-llama/jev_。
DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。
一种手指与姿态感知的触觉压缩器将10路指尖数据流映射为2个手部级潜变量,同时保留89.4%的融合前接触召回率,使训练速度提升2.26倍、推理速度提升1.29倍。该工作面向十指触觉世界建模的规模化问题。
Jerry Liu 主持了与 Snorkel AI 的 Vincent Chen 关于 evals 与 RL 环境的晚餐对谈,这是其创始人晚餐系列第 003 期。
中国科学技术大学与新加坡国立大学团队提出 PALU(Prefix-Aware Localized Unlearning,前缀感知局部遗忘),从时序与词表两个维度做局部化约束:只干预敏感片段最前面的 N 个词元,且只对冻结参考模型选出的 Top-K logit 做局部熵最大化,并用 KL 散度约束非敏感词元分布。
微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。
博登智能在 IROS 2026 发表主题演讲,介绍第一人称视角手部重建算法 ChronoHand,在 ARCTIC 评测中五项重建精度全面超越 SOTA,MPJPE-p 降至 17.04,CT-p 降低 34.0%。该公司已在宁波、湖州、马鞍山建成超 3 万平方米创新中心,具备年产 50 万小时真机训练数据产能,并开源 RW-RL-HIL-Dataset,完成数据出境备案。
具身智能数据竞争正从比拼数据时长转向衡量数据带来的模型能力增益,无问智科以「世界模型×数据工厂×世界模拟器」构建 Real2Sim2Real 闭环。其数据从 Raw Data 到 Model-Ready 的处理效率提升 500% 至 1000%,Sim-Ready 资产构建从 3 天缩短至 5 分钟,已建百万级资产库。
远景科技集团创始人张雷提出“AI土豆论”,主张从能源基础设施端压降Token成本,而非只盯芯片和算法。其乌兰察布星河基地今年8月投产,园区总规划容量超2GW,通过绿电直连、气象大模型预测调度、固态变压器(SST)供电与储能协同四道系统工程,目标实现同等面积下算力输出规模达传统数据中心的10倍。
OpenAI 发文阐述其对前沿 RL 训练运行安全防护的思路,说明如何在训练过程中保护模型权重、基础设施与相关资产。文章发布于 OpenAI 官网,标题为 "How we think about securing frontier RL training runs"。
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。
AMD 与 World Labs 达成收购协议,交易金额 82 亿美元,交易预计今年年底前完成,仍需获得监管批准;World Labs 创始人李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接与 CEO 苏姿丰及团队合作。
交易把世界模型团队接入芯片研发链条,读者可以了解空间智能路线与硬件协同的动因。
Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。
LlamaIndex 探索了 Jev 及同类模型在文档解析任务上的早期方案,覆盖方向检测、语言检测、路由等场景。文档解析需要大量即时决策,这些任务正是其中的关键环节。
SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。
论文提出 FuseReg,通过正则化层融合缓解表征自编码器中的重建-生成差距。论文已在 HuggingFace 上线(huggingface.co/papers/2609.31…)。
开源模型的私有化部署正成为新趋势:隐私与合规风险凸显、开源模型能力已过可用阈值、企业 token 开销失控推动成本考量,但版本迭代投入、使用频率不足导致综合成本高于云厂商、私有化部署稳定性仍是问题。
本期 Import AI 介绍了 Michael Levin 关于心智或为 Platonic 模式空间界面的论文,认为身体与机器只是这些模式进入物理世界的接口;Anthropic 的 Perry Dong 与 Chelsea Finn 提出机器人缺少类似 LLM 的后训练通用配方,并介绍了 EXPO(-FT) 算法。
小红书直播用架构、性能、稳定性三套递进能力,在 3 周窗口内交付 40+ 世界杯需求,赛事期实现千万级 PCU 零事故。端到端进房成功率场均 99.5%+,三端异常退出率均低于万分之一,降级后 CPU 均值降幅接近 60%、温升降幅约 30%。全部赛事零事故,赛中调整全部通过配置完成、无需发版。
阿里巴巴携手清华大学、上海交通大学发布 RoboFlywheel,围绕数据生产、处理、验证与复用建设具身智能开放数据基础设施。
NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,解决 AI 工厂为应对 GPU 峰值功耗而预留保护缓冲、导致正常运行时基础设施利用率不足的问题,从而提升 AI 工厂吞吐量与效率。
图灵奖得主、Ingres 和 Postgres 创始人 Mike Stonebraker 认为,为智能体 AI 提供数据的数据源都是关系型的,而基础模型只处理纯文本将成为重大弱点。
Fireworks AI 发布新 cookbook(联合 HUD),让开发者无需自建基础设施即可在自己的任务上做 RL 训练。流程是在 HUD 中定义任务和 grader,再在 Fireworks 上采样并训练模型,同一环境同时用于训练和评估。
斯坦福团队提出 Self-Play Pretraining with Zero Data:两个模型从随机初始化出发,一个生成器为通用图灵机提出程序,一个学习器只在这些输出上训练,全程不接触真实数据。该设置下模型在图像、文本、音频和旋律上的零样本验证损失随自博弈算力可预测地下降,且学习器涌现出上下文学习能力。
一篇题为 Training Object Permanence in World Models 的论文发布,聚焦在世界模型中训练客体永久性,论文可在 Hugging Face 上查阅。
HuggingFace 发布 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,用于提升小模型在代码和数据科学领域的爬山训练。环境、评测和训练代码 100% 开源,数据集已上线 huggingface.co。
Replit 宣布收购 Atta,将其专为图表打造的能力直接集成进 Replit 对话中。用户只需向 Replit 提问,就能获得可交互的内联图表,无需写 SQL,也不必反复重建,生成的图表可直接用于董事会汇报或销售演示。
SemiAnalysis 推出 SemiAnalysis China Datacenter Model,追踪中国 60 多家运营商的 1000 多个数据中心设施,显示中国数据中心容量超过 24GW,超过 EMEA 和亚洲其他地区。
Qdrant 在 Hugging Face 上免费开源了嵌入向量生成工具 Supernova 和 10B 数据集 Qdrant-FineWeb-10B,可用于评估、测试和配置向量搜索基础设施。BetterStackHQ 还发布了讲解这些资源的高质量视频。
LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。
Bridgewater 应用 AI 团队负责人 Sam Green 将在 AI Engineer New York 带来演讲“Vault: When Fifty Years of Structured Data Isn't Enough”,介绍 Bridgewater 如何构建共享非结构化数据平台,为投资研究与生产环境中的 AI 智能体提供支撑。会议于 10 月 12–14 日举行。
花叔正在独立进行模型后训练,目标是训出一个具备多模态能力、且在基本文本分类能力上超越 Jev 的开源模型,算是对小米 Mimo-V2.6 公开训练过程的模仿。他预计次日完成全部训练和开源,届时会在 Hugging Face 和 GitHub 上开源模型,并称无论成败都是有趣的尝试。
NVIDIA 技术博客讨论了如何为生物基础模型高效训练 MoE 架构。相比每个 token 都经过全部层的稠密 Transformer,MoE 使用多个专家子网络、每个 token 只激活其中一小部分,从而在大模型扩展时降低训练与推理算力开销。