LIFT:用 On-Policy 自蒸馏实现大视角变化下的 Layout-In-Future 视频生成
LIFT 提出一种 On-Policy 自蒸馏方法,用于在大视角变化下生成 Layout-In-Future 视频。论文已发布在 Hugging Face Papers(2609.38)。
LIFT 提出一种 On-Policy 自蒸馏方法,用于在大视角变化下生成 Layout-In-Future 视频。论文已发布在 Hugging Face Papers(2609.38)。
Thomas Wolf 与 Joel Niklaus、Lewis Tunstall 将在 CoLM 2026 带来一场 oral spotlight 报告,他发帖邀请参会者到场交流。
Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。
一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。
论文《Octrees as an Explicit 3D Language》提出将八叉树作为显式的 3D 语言表示,论文页面已在 Hugging Face Papers 上线(huggingface.co/papers/2610.02…)。该工作由 AK 在 X 上分享,附带的演示视频因浏览器不支持 video 标签未能直接播放。
DepthART 将单目深度基础模型压缩到 6.0M 参数:用抗偏置数据采样从约 4400 万张候选图像筛出约 170 万张均衡数据,再以 Depth Anything V2-L 伪深度蒸馏到 TinyViM+DPT。
HuggingFace 和 LiquidAI 团队提出一种多 Harness 强化学习训练方案,不改框架代码,在框架与模型之间加一个记录代理,让同一模型同时在四个真实框架里做 RL。
Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。
论文 EgoTools 提出面向真实第一人称视频的工具中心推理,论文已在 HuggingFace 上线(编号 2609.39…)。目前仅有论文链接与演示视频,未披露模型规模、benchmark 分数或开源情况。
LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。
Hugging Face 团队发布多 harness RL 实践指南,指出同一模型同一权重在一个 agent harness 中得分 62%,在另一个中仅 33%。
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。
论文提出 FuseReg,通过正则化层融合缓解表征自编码器中的重建-生成差距。论文已在 HuggingFace 上线(huggingface.co/papers/2609.31…)。
Perplexity 安全团队花一个月攻击其运行 Perplexity Computer 的沙箱平台 SPACE,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,部分测试还提供完整沙箱源码,要求它们逃逸到宿主机或访问被网络策略拦截的 URL。
一篇题为 Training Object Permanence in World Models 的论文发布,聚焦在世界模型中训练客体永久性,论文可在 Hugging Face 上查阅。
HuggingFace 开源 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,面向代码和数据科学领域的小模型能力爬坡,环境、评测与训练全部开源。该数据集由 @adithya_s_k 贡献,已在 HuggingFace 上发布。
论文《On the Diffusibility of High-Dimensional Latents》已在 Hugging Face Papers 上线,聚焦高维潜变量的可扩散性问题。原文未披露模型、参数规模或 benchmark 数据等具体信息。
Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。
一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。
onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。
WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。
论文《Agora: Git as Shared Memory for Collective AutoResearch》已在 Hugging Face 论文页发布,提出把 Git 用作集体 AutoResearch 的共享内存。该推文附带 huggingface.co/papers/2609.18 链接,获得 69 次点赞、17 条回复与 14 次转发。
一篇题为《Continual Learning Mechanisms Compose for Long-Horizon Memorization》的论文发布,探讨持续学习机制组合用于长时程记忆。论文链接已在 Hugging Face 上线。
SAS 提出一种通过上下文排序端到端优化实现的简单注意力稀疏化方法,论文已在 Hugging Face 上线(huggingface.co/papers/2609.13…)。该方法以排序优化驱动注意力稀疏化,具体参数与评测结果暂未披露。
Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。
Marigold V2 提出用扩散 Transformer 重做单目深度估计,论文已发布在 Hugging Face Papers(2609.08…)。该工作重新审视扩散 Transformer 在这项任务上的表现,具体指标与可用性原文未披露。
NeoHorse-1 提出通过带 Routing Harness 的智能体后训练实现递归自我改进,论文已发布在 Hugging Face Papers(编号 2609.08)。该工作围绕 agentic post-training 与递归自我改进两个方向展开。
一篇题为《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》的论文发布,提出用离散扩散为 LLM 带来无损加速,论文已在 Hugging Face Papers 上线。该工作聚焦大语言模型的推理提速,具体方法细节与实验数据见原文。
论文 HarnessDev 探讨 LLM 能否自行创建并演化其 Agent Harness,论文地址已发布在 Hugging Face。原文未给出模型版本、参数规模或 benchmark 分数等具体结果。
论文提出 Repo-To-Skill,将 GitHub 仓库蒸馏为 AI4AI 技能,论文已发布在 Hugging Face Papers 上。该工作探索把代码仓库转化为可供 AI 使用的能力形式,展示了从仓库到技能的蒸馏路径。
Hailuo AI 转述团队工作 H3-World,称其首次把 MiniMax-H3 本身变成世界模型,无需新增动作模块,直接把 H3 预训练的语言理解转换为角色与镜头控制,仅用 8K 样本和 0.199% 可训练参数。团队表示,最值得关注的不只是 H3 也能成为世界模型,而是所需新增的部分极少,并给出论文与项目主页链接。
HuggingFace 随模型发布两个配套数据集:PubMed-Multi-Vector 在同一语料上提供 dense、sparse 和 ColBERT 式多向量表示,共 8.37B 多向量 token;Coyo-Vector-Embeddings 则提供 2,048 维的多模态图文嵌入。
Qdrant-FineWeb-10B 已在 Hugging Face 上线,号称最大的开源向量检索基准数据集。该数据集包含 10B 篇 FineWeb 文档、gte-multilingual-base 生成的稠密与稀疏向量,向量规模 24.47 TB,文本与元数据 28.66 TB,并为 120,000 条查询提供精确 top-1,000 真值。
Qdrant 与 Vultr 解决了十亿级向量检索的精确 ground truth 计算难题:在 10B 文档规模下,逐一比对每个查询与每个向量意味着超过千万亿次距离计算。双方承担了这一算力成本,让社区无需自行负担。
Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。
LlamaIndex 发布 ExtractBench,用于评测复杂企业文档的信息抽取能力,测试覆盖 14 个系统(前沿 VLM、编程智能体和抽取 API)、370 份企业文档、4,869 页、67 种文档类型,全程无 LLM 评判、完全确定性。
Hugging Face 发布内容展示 AI 智能体如何复现 ICML 2026 的论文。该内容以直播形式呈现,配文附带 x.com 直播链接,未披露所用模型、复现数量或评测分数等具体细节。
Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。
Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。
Jina AI 发布 jina-embeddings-v4 向量的可视化结果,显示指数集中塌缩到 127 这一单一主值,指数熵从 2.6 降至 0.03 bits/byte。仅靠指数压缩只能得到 1.1x 压缩,额外收益来自高阶尾数字节:当角度聚集在 π/2≈1.5708 附近时,其熵从 8.0 降至 4.5 bits,两者合计实现 1.5x 压缩。