NanoGPT 训练记录降至 39.9 秒,提出「按 flop 价值取舍」新范式
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。
LlamaIndex 探索了 Jev 及同类模型在文档解析任务上的早期方案,覆盖方向检测、语言检测、路由等场景。文档解析需要大量即时决策,这些任务正是其中的关键环节。
SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。
论文提出 FuseReg,通过正则化层融合缓解表征自编码器中的重建-生成差距。论文已在 HuggingFace 上线(huggingface.co/papers/2609.31…)。
有网友在 Qwen 上跑测试集发现,要求模型诚实作答、对自己说出的话负责,并在实验中压低 "wait / maybe / perhaps" 这几个词的概率后,Qwen 的准确率反而提高了。该实验由 Reddit 网友完成,相关帖子获得 2 条评论、2 次转发、7 个赞和 4109 次浏览。
ProgramDistill 提出从交互式 Web 应用出发,构建可验证、参考引导的软件工程(SWE)任务。论文已发布在 Hugging Face Papers(编号 2609.18…),原始公告由 AK 在 X 上分享。
Aditya Bhatt 等人的最新博士论文提出 Blind Dexterity,首次仅靠关节编码器实现抗推的人形机器人行走,无需 IMU 和力/力矩(F/T)传感器。该工作由 DFKI 与达姆施塔特工业大学(@ias_tudarmstadt)团队完成,论文已被 IROS 2026 接收。
Niket Patel 展示了一种教 LLM 自主发现有趣定理的方法,提出可量化的"有趣度"指标,使发现结果的有趣度提升 4.3×,并形成自我扩展的发现循环。研究者指出,LLM 已能证明困扰数学家数十年的结果,而无需人类引导地找到有趣定理正成为新的瓶颈。
Anthropic 科学博客称 Claude 在平面 N=4 超对称杨-米尔斯模型中完成了九圈计算,此前该模型的纪录是 SLAC 的 Lance Dixon 及合作者做出的八圈。
Stanford AI Lab 发布了一项由 @AdityaCowsik、@KfirDolev 和 @michaelyli_ 共同领导的新研究,合著者包括 @gbruno_dl、@ANourya、@noahdgoodman 和 @YoavLevine。目前公开信息仅为作者署名,研究主题、方法与结果尚未披露。
斯坦福团队提出 Self-Play Pretraining with Zero Data:两个模型从随机初始化出发,一个生成器为通用图灵机提出程序,一个学习器只在这些输出上训练,全程不接触真实数据。该设置下模型在图像、文本、音频和旋律上的零样本验证损失随自博弈算力可预测地下降,且学习器涌现出上下文学习能力。
Anthropic 在 Science Blog 发文称,Claude 在 Claude Science 中仅凭一条描述九圈问题的提示词,基本无监督运行数天,完成了平面 N=4 超杨-米尔斯模型中的九圈散射振幅计算,总成本数千美元。
一篇题为 Training Object Permanence in World Models 的论文发布,聚焦在世界模型中训练客体永久性,论文可在 Hugging Face 上查阅。
HuggingFace 发布 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,用于提升小模型在代码和数据科学领域的爬山训练。环境、评测和训练代码 100% 开源,数据集已上线 huggingface.co。
Vercel 基于 skills.sh 注册表的聚合数据发布报告,该注册表在七个月内积累 100 万个 agent skills,记录近 2.8 亿次安装。分类样本显示供给偏技术,超过一半的条目集中在软件工程、agent 工作流、数据、基础设施或安全;需求更分散,软件工程占安装量 18%,agent 工作流 15%,业务运营和写作各近 11%。
论文《On the Diffusibility of High-Dimensional Latents》已在 Hugging Face Papers 上线,聚焦高维潜变量的可扩散性问题。原文未披露模型、参数规模或 benchmark 数据等具体信息。
Meta AI 把主行动智能体与专门的记忆智能体配对,用来解决长上下文导致的上下文腐化问题:记忆智能体记录工具和过往错误的结构化笔记,只在关键时刻注入简短提醒,使 Claude Sonnet 4.5 的基准成绩从 37.6% 提升到 45.9%。DeepLearning.AI 转述了这项技术分析,并附上全文链接。
NVIDIA 技术博客讨论了如何为生物基础模型高效训练 MoE 架构。相比每个 token 都经过全部层的稠密 Transformer,MoE 使用多个专家子网络、每个 token 只激活其中一小部分,从而在大模型扩展时降低训练与推理算力开销。
腾讯混元(Hunyuan)将经典临界批次规模理论扩展到在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重调学习率可在一定批次规模范围内保持每条回复的学习效果。在固定硬件下,扩大批次规模使 PPO 生成阶段吞吐最高提升 2.29 倍,其最佳 GRPO 配置则以少 29% 的时间达到相同验证目标。
腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。
Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。
Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。
MentalHealthBench 是 OpenAI 推出的心理健康评测基准,覆盖人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不像多数同类基准只聚焦紧急情况。
Anthropic 公布其新建分子生物学实验室的首个研究结果,团队中的生物学家用 Claude 梳理数据与文献,生成研究假设和候选生物系统。科学家审核这些假设后,自行完成全部实验验证最有前景的想法,实验室工作均由 Anthropic 科学家完成。该团队希望把这一方式扩展到基因组学及其他领域,并公开征集研究问题提案。
Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,该酶基因旁有一段类似 CRISPR 的长重复 DNA 序列。团队目前尚不清楚该系统的功能,已知具备类似特征的系统都能剪切、复制和粘贴 DNA;CRISPR 正是这类可编程系统走向基因药物的先例,但弄清该系统的作用并判断能否有类似用途还需更多研究。
Microsoft Research 新研究显示,将 AI 推理从机器人本体移出可提升任务成功率、提高效率,并支撑更先进的物理 AI 工作负载。该结论指向机器人硬件与智能增长不匹配的问题,即算力从机器人端外移是可行路径。
微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。
vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。
字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
Perplexity 公布其 Computer 智能体后训练方法,结合拒绝采样微调(RFT)与提示引导自蒸馏,让模型模仿优质轨迹并显式纠正错误工具调用。在线 A/B 测试中,后训练 checkpoint 将工具调用失败率相对降低 21.2%。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一项实时 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。
onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。
论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》已在 Hugging Face 论文页发布,提出对 Agent Harness 进行正则化递归自我改进的方法。该工作由 AK(@_akhaliq) 分享,发布当日在社交平台获得 8 条回复、21 次转发和 80 次点赞。
Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。
10,000 个 AI 智能体耗时 88 小时在 Lean 中形式化 Navier-Stokes 方程相关证明,由此引发的争议为 AI 开发者提供了重要经验:智能体能大规模形式化复杂数学证明,但人类评估仍是解释证明为何成立的关键,企业数据隐私与零数据保留设置也属必需。
腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。
METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。
WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。