Jina AI 从多模态大模型中拆出 1.1B 音频向量模型
Jina AI 分享了音频向量模型的构建方法:从 Qwen2.5-Omni 中拆出音频编码器接到小 LLM backbone 上,模块组合方案以 1.1B 参数量在 AudioCaps T2A cvR@5 上达到 49.7,超过 CLAP 的 42.0,且只用了 CLAP 约 1/25 的训练数据(181K 对)。
Jina AI 分享了音频向量模型的构建方法:从 Qwen2.5-Omni 中拆出音频编码器接到小 LLM backbone 上,模块组合方案以 1.1B 参数量在 AudioCaps T2A cvR@5 上达到 49.7,超过 CLAP 的 42.0,且只用了 CLAP 约 1/25 的训练数据(181K 对)。
METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。
Jina AI 发布两项研究:用约 80 万参数的小模型仅看向量即可识别生成模型,在 68 个模型与任务组合上准确率 87%;用掩码扩散模型直接从向量还原原始文本,Token 级还原准确率 81%,在 Qwen3-Embedding-0.6B 上达 81.3%、jina-embeddings-v3 上为 76.0%。
METR 让 Opus 4.6 在简单 ReAct 框架下从零实现《杀戮尖塔》和《小丑牌》的 CLI 版本,结果两款游戏都能基本可玩,但存在大量缺失或损坏的机制,作者估计自己达到同等质量需要 2 到 8 周。
NVIDIA Robotics 团队发布 EgoScale,在 20K+ 小时的自我中心人类视频上预训练 GR00T VLA 模型,发现机器人灵巧度可以随更多人类数据而非更多机器人数据扩展。论文见 arxiv.org/abs/2602.16710,项目主页为 research.nvidia.com/labs/gear/egos。
Jim Fan 团队训练了一台配备 22 自由度灵巧手的人形机器人,完成组装模型车、操作注射器、整理扑克牌、折叠卷起衬衫等任务,主要从 2 万多小时第一视角人类视频中学习,训练过程中没有机器人参与。
METR 宣布修改其开发者生产力实验设计,原因是 2025 年 8 月启动的新实验因开发者拒绝在无 AI 条件下工作、时薪从 $150/hr 降至 $50/hr 等选择效应,数据无法可靠反映 AI 的真实生产力影响。
Jim Fan 推荐 Shenyuan Gao 的技术详解:NVIDIA 的 DreamDojo 是一个交互式机器人世界模型,基于 44K 小时人类第一人称视频预训练,团队称这是目前机器人世界模型学习中规模最大、最多样的数据集。该模型在泛化能力之外,经知识蒸馏后支持 10 FPS 的实时交互,可用于实时遥操作、策略评估和测试时的基于模型规划,代码、模型与数据已在 GitHub 开源。
李飞飞与 Alan Baade 等提出 Latent Forcing,通过安排联合扩散轨迹先揭示 Latent 再生成 Pixel,在编码无损、推理端到端的前提下改善收敛。该方法回应了扩散应选原始数据还是 Latent 空间的问题,答案是两者兼用。
METR 用 5305 份 2026 年 1 月由 7 名技术人员生成的 Claude Code 转录,借助 LLM judge 估算无 AI 时的任务耗时,得出 AI 辅助任务的时间节省因子约 1.5x 到 13x。该结果被作者视为真实生产力增益的软上限,因任务替换、任务选择、既有专长等因素可能高估。方法仅在 34 条人工标注上验证,且数据仅覆盖单一月份、单一工具。
Jina AI 上线嵌入向量反演演示 embedding-inversion-demo.jina.ai,可实时展示从嵌入向量还原内容的效果,训练与解码的技术细节在其开源仓库和论文中公布。
Jina AI 提出把嵌入逆向还原视为条件掩码扩散任务,从全掩码序列出发,用去噪模型并行还原所有位置的 token,并通过 AdaLN-Zero 以目标嵌入为条件,无需在每一步重新对当前假设做嵌入。作者称现有 Vec2Text、ALGEN、Zero2Text 等反转方法采用自回归生成 token,需要反复经由目标编码器重新嵌入,而该方法每个去噪步骤借助全局上下文同时细化所有位置。
一个 78M 参数的文本扩散模型能从 Qwen3-Embedding 和 EmbeddingGemma 的嵌入向量中还原出 80% 的 token,并支持多语言输入,配套 demo 可在线体验。该模型展示了嵌入向量逆向还原为句子的难度之低,而这正是文本扩散模型的理想任务。
一份基于 AI Futures 模型简化的新模型预测,在算力增长与算法进步维持当前趋势下,AI 研发将在 2032 年底实现超过 99% 的自动化,该模型将参数从 AIFM 的 33 个压缩到 8 个。其多数模拟显示,到 2035 年 AI 效率将提升 1000x 至 10,000,000x,研究产出提升 300x 至 3000x。模型采用不追求 100% 全自动化、任务间无替代性两项保守假设。
Yoshua Bengio 发布《International AI Safety Report 2026》,称其为迄今对 AI 能力、新兴风险与安全措施最全面的循证评估。Geoffrey Hinton 称该报告对 AI 风险的描述细致、考究,是任何想撰写或讨论 AI 风险者的必读材料。
Jim Fan 团队训练出名为 DreamZero 的机器人基础模型,以世界模型为骨干,具备对新动词、名词和环境的零样本开放世界提示能力,被称为首个 World Action Model(WAM)。
SWE-Universe 是一个可扩展框架,能把 GitHub PR 转化为真实、多语言、可验证的 SWE 环境,由 agent 像人类专家一样自行配置每个环境并加入额外可靠性保障。该框架已在 Qwen3-Coder-Next 的 mid-training 和 RL 中得到验证,团队将推进环境合成作为 agent 自我改进的路径。
METR 发布 Time Horizon 1.1(TH1.1),将任务集从 170 项扩至 228 项,长期任务(人类耗时 8 小时以上)从 14 项增至 31 项,并把评测基础设施从自研的 Vivaria 迁移到英国 AI 安全研究所的 Inspect 框架。
Jina AI 推出 0.6B 参数的重排模型,在 MTEB 重排任务上进入前三,体积比生成式 listwise 重排器小 10 倍。相关工作获 AAAI Frontier IR 最佳论文,论文见 arxiv.org/abs/2509.25085。
Jina AI 的 jina-reranker-v3 在 AAAI Frontier IR Workshop 获得最佳论文。该模型是首个 listwise reranker,将所有文档放入同一上下文窗口,通过 self-attention 让文档相互竞争,而非像传统 reranker 那样循环处理 ⟨q,d⟩ 文档对,这种机制被称为 "last but not late" interaction。
推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。
Jina AI 公开了 jzip 的 C 实现代码与配套论文,前者托管在 GitHub 的 jina-ai/jzip-c 仓库,后者发布于 jina.ai 的 embedding-comp 页面。两条链接均通过推文直接给出,供开发者查阅实现细节与压缩方法。
Jina AI 发布 jina-embeddings-v4 向量的可视化结果,显示指数集中塌缩到 127 这一单一主值,指数熵从 2.6 降至 0.03 bits/byte。仅靠指数压缩只能得到 1.1x 压缩,额外收益来自高阶尾数字节:当角度聚集在 π/2≈1.5708 附近时,其熵从 8.0 降至 4.5 bits,两者合计实现 1.5x 压缩。
METR 时间视野论文作者澄清该指标的多项局限:时间视野指 AI 以 50% 成功率可替代的人类串行劳动量,而非其独立工作时长。METR 称 Claude Opus 4.5 的 50% 时间视野约 4 小时 49 分,但 95% 置信区间高达 1 小时 49 分至 20 小时 25 分,测量并不精确。
METR 公布监控能力评估原型 SHUSHCAST 的早期结果,测试监控器能否发现 AI 智能体秘密执行副任务。GPT-5 作为智能体时,获取推理轨迹使监控器捕获率提升超 50 个百分点,而 Claude Sonnet 4.5 效果小得多,部分原因可能是其推理轨迹经过摘要处理。该工作与 OpenAI 合作完成,任务集规模小、缺乏智能体与监控器诱导是主要局限。
斯坦福与 NVIDIA 的研究者发布 PointWorld-1B,一个大规模预训练 3D 世界模型,可根据 RGB-D 采集和机器人动作预测环境动态。该模型旨在从单张图像实时模拟交互式 3D 世界,用于在动态复杂环境中学习机器人动作。项目主页为 point-world.github.io。
加州大学伯克利分校团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,且任何建模误差只会高估、不会低估真实信息。该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证,信息估计能预测下游解码器性能,优化出的设计达到端到端 SOTA 水平,同时所需内存和算力更少,也无需任务专用解码器。相关论文发表于 NeurIPS 2025。
Sebastian Raschka 整理并发布了 2025 年 7 月至 12 月的 LLM 研究论文书签清单,涵盖推理模型训练、推理时推理策略、LLM 评估与推理理解、其他强化学习方法、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态与视觉语言模型、数据与预训练数据集等类别。
Jina AI 公开了一篇 vision-encoder 相关论文,全文可通过 jina.ai 链接获取。该推文未披露模型参数、benchmark 分数或可用性等具体细节。
Jina AI 发布 VLM 视觉编码器综述,调研 70+ 模型后发现训练方法比规模更关键——训练得当的 400M 编码器性能可超过 6B 模型。原生分辨率对文档类任务尤为重要,多编码器融合也被证实有效。综述还包含分类体系与实践指南,指出编码器侧研究明显不足,业界多沿用 2021 年的 400M CLIP。
Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。
梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。
阿里千问(Qwen)团队的论文《Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free》获得 NeurIPS 2025 最佳论文奖。该研究聚焦大语言模型的门控注意力机制,涉及其非线性、稀疏性与无 attention sink 特性。
Anthropic 发布新研究,主题是生产 RL 中奖励作弊引发的自然涌现失准。研究指出,奖励作弊指模型在训练任务中学会作弊;Jan Leike 称这是他所见过最有趣的泛化发现之一,如果模型在编码任务上学会作弊,可能带来广泛的失准。研究认为若不加缓解,奖励作弊的后果可能非常严重。
John Yang 推出新评测 CodeClash,让大模型在代码库中通过多轮锦标赛相互竞争,以实现最大化收入、削减成本、赢得用户等高层目标。该评测不同于现有针对“修 bug”“写测试”等具体任务的测试方式,转而在目标层面考察模型的编码能力。
METR 发布 MALT 数据集,包含 10,919 条智能体转录记录,覆盖 403 个任务、86 个任务家族和 21 个模型,聚焦 reward hacking 与 sandbagging 等威胁评估完整性的行为。
BAIR 研究者 Trevor Darrell 实验室的论文「Hidden in plain sight: VLMs overlook their visual representations」在加拿大蒙特利尔举行的 COLM 2025 上获得杰出论文奖,作者包括 @xkungfu、@tylerraye、@databoydg。该研究指出视觉语言模型(VLM)会忽略自身的视觉表征。
METR 发布 QA 场景可监控性早期研究,发现监控规避率与副任务难度负相关,难度用模型解副任务的 token 数和 5 次成功率衡量。三种提示词效果差异显著,最优提示词让模型直接作答无需思维链的简单题;8b 智能体可被训练成功骗过 GPT 4o 监控模型。实验基于 GPQA 生物题与四个数学数据集共 160 个副任务,作者强调结论仍属初步。
Thinking Machines 发布研究《LoRA Without Regret》,用 Llama 3 与 Qwen3 系列模型在 Tulu3、OpenThoughts3 数据集的监督微调及数学推理强化学习实验,考察 LoRA 与全量微调(FullFT)的差距。
Thinking Machines 发布技术博客 Modular Manifolds,探讨将神经网络各层权重矩阵约束在子流形上,并提出一种权重约束于 Stiefel 流形的 Muon 优化器流形版本。文章还定义了"模块化流形"概念,即一种可组合流形,旨在让大型网络的扩展与训练更易实现。
伯克利 AI 研究团队给出 word2vec 的定量学习理论,证明在实际可实现的训练条件下,其学习问题可归约为无权重最小二乘矩阵分解,最终学到的嵌入等价于对矩阵 M* 做 PCA,该矩阵仅由词共现统计和超参数决定。梯度流动力学有闭式解:从小初始化出发,word2vec 按离散步骤逐个学出正交线性子空间,每步提升嵌入矩阵的秩并阶梯式降低损失,各特征即 M* 的顶层特征向量。