CodeMidas:从代码本身扩展智能体编程 RL 环境
论文提出 CodeMidas,一种从代码本身扩展智能体编程强化学习(RL)环境的方法,论文已发布在 HuggingFace Papers 上。
论文提出 CodeMidas,一种从代码本身扩展智能体编程强化学习(RL)环境的方法,论文已发布在 HuggingFace Papers 上。
Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。
Microsoft Research 在 Nature 发表论文,介绍预测模型 RetroChimera,用于加速化学合成、帮助研究人员探索更广泛的分子。定制分子在医药、材料和农业领域不断推进,但生产成本高、速度慢。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。
Science 刊发阿里巴巴达摩院通用医疗影像模型 DAMO RADAR 论文,针对腹部增强 CT,同一模型可识别 18 个腹部器官上的 146 种病症,突破一病一模限制。
腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。
论文 JEPA-Anything 提出跨不同世界学习预测模型的方法,已在 Hugging Face 论文页发布(huggingface.co/papers/2609.20…)。该工作聚焦于让预测模型适应不同环境,具体方法与实验细节见论文原文。
一篇关于编码智能体 Harness 设计的实证研究论文发布在 Hugging Face,论文链接已公开。原文未披露具体模型、benchmark 分数或实验结果。
Stanford AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,训练加速随上下文长度增长而提升。
SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。
阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上《科学》(Science),面向腹部增强CT诊断,可一次识别超过146种病症、覆盖18个器官,平均AUC达0.913,现已正式开源。
分享了一篇 arxiv 论文(编号 2609.14858)。原文未提供更多细节,暂无模型、参数或评测信息可述。
谷歌/DeepMind 研究人员推出 Dream-RSI,让 AI 智能体通过重放过去的发现尝试来改进探索问题的方式,以低成本测试数千种替代策略,并在下一轮部署更优策略。该系统在算法设计、数学优化和 GPU 内核工程中保持或提升发现质量的同时大幅降低搜索成本,一种场景下将智能体调用次数最多减少 162 倍。其改进的是探索策略,而非底层模型权重。
Epoch AI 基于 2025 年 1 月至 2026 年 8 月的全部数学 arXiv 预印本分析发现,致谢 AI 使用的论文比例从 4 月的 4% 升至 8 月的 25%。
Anthropic 将全部代码发布在 GitHub(github.com/anthropics/upl…),完整结果见于其技术报告(www-cdn.anthropic.com/d8ca26d0d20570…)。原文未披露具体模型名称、参数规模或 benchmark 分数。
论文《Agora: Git as Shared Memory for Collective AutoResearch》已在 Hugging Face 论文页发布,提出把 Git 用作集体 AutoResearch 的共享内存。该推文附带 huggingface.co/papers/2609.18 链接,获得 69 次点赞、17 条回复与 14 次转发。
LimiX-2 提出上下文机制网络,目标是通用结构化数据智能,论文已发布于 Hugging Face。该工作聚焦结构化数据场景下的通用建模能力,具体参数规模、benchmark 分数与开源情况原文未披露。
Google DeepMind 与 ScienceStowers 合作构建 Atlas,绘制了 2500+ 调控模式,找到充当生物开关和音量旋钮的 DNA 序列,可在数百种细胞类型中上调或下调基因活性。
Google DeepMind 与埃克塞特大学合作,用 AlphaGenome Atlas 分析 UK Biobank 超 5.4 万名参与者的数据,罕见遗传信号的检出率提升 22% 以上。该工具还发现了影响 PLA2G7 蛋白丰度的新 DNA 变异,而 PLA2G7 与代谢健康相关。
Melissa Pan 在 Claude Code、Codex 和 Pi 上评测了 7 个模型,得出三点发现:harness 选择对任务成功率影响不大,但会显著影响成本;简单的 harness 也具竞争力;原生 harness 并不总是最佳选择。Harrison Chase 引用该结论指出,模型可能未必真正受益于原生 harness。
Epoch AI 分析海关贸易数据发现,2024 年 4 月至 2025 年 6 月中国记录进口了 37.5 亿美元的马来西亚原产服务器,均价 10.6 万美元一台,明显高于平时水平。
NVIDIA 研究团队在 ECCV 2026 发布 Axolotl3D,一个多模态、遮挡感知的 3D 生成模型,结合图像、相机数据和部分几何信息重建缺失区域并保留已观测区域,在单视图与多视图设置下均取得 SOTA 结果。
阶跃星辰发布 StepAudio 3 Realtime 技术报告,论文已在 Hugging Face 上线。
一篇题为《Continual Learning Mechanisms Compose for Long-Horizon Memorization》的论文发布,探讨持续学习机制组合用于长时程记忆。论文链接已在 Hugging Face 上线。
小红书团队提出 MemPro,把 Agent 记忆的完整 MCR 流水线(记忆构建—检索与使用)当成可演化程序,让 Evolving Agent 通过版本树选择有潜力的版本、分析典型错误,再用编辑—调试改写 Prompt、执行代码和控制逻辑。
Qdrant 复现 SHIFT 论文方法,通过从嵌入向量中减去按语言估计的偏移,把非枢纽语言文档映射到枢纽语言空间,无需训练即可缓解多语言 RAG 的语言偏置。
Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。
Vidu S2 支持实时交互、可编辑与空间视频生成,论文已发布在 HuggingFace Papers(2609.11…)。该工作将交互式编辑与空间视频生成能力整合到同一视频生成框架中。
腾讯混元推出 EvolveScaler,把世界定义为可执行状态机再渲染成自然语言,模拟记录被撤回、更正、回填的"信息演化"。该基准含 117 个原型、159 个问题算子、5 个难度层级,单样本事件量最高约 1,200。14 个前沿模型在最难层级上 avg@5 中位数降至 11.3,而用它训练可在 8 个分布外基准上平均提升 5.25。
SemiAnalysis 用自研 AgentX 智能体推理基准实测 NVIDIA Vera Rubin NVL72,在 Apples to Apples TRTLLM NVFP4 Dense 配置下。
微软研究院新一期 Research Focus 聚焦四个方向:编码智能体在规模化场景下的行为表现、AI 模型在 PET/CT 扫描中识别淋巴瘤病灶的评估、AI 聊天机器人依赖问题,以及大规模决策系统的推进。
SAS 提出一种通过上下文排序端到端优化实现的简单注意力稀疏化方法,论文已在 Hugging Face 上线(huggingface.co/papers/2609.13…)。该方法以排序优化驱动注意力稀疏化,具体参数与评测结果暂未披露。
Naval 在 X 上发布了 Catalini 研究论文的原文链接,指向 catalini.com/research/some。该帖未附更多说明,仅给出论文地址供读者查阅。
IBM Research 在八款模型上发现,智能体记忆的合适"剂量"随模型能力变化:能力强的模型能从完整指南集中获益,较弱模型更适合精简核心加任务相关检索,已饱和的模型则无明显提升。
Google DeepMind 研究者把 100 个 Gemini 智能体放进同一个共享仓库求解 71 道数学定理。
NeoCognition 推出 ApprenticeBench,用于评测 AI 在真实工作中的电脑操作与持续学习能力。Fable 5.1 和 GPT-6 Astra 在该基准上能一边工作一边持续学习,并超越人类专业者,无需 FDE 介入,智能体可自行部署到岗位中。
NVIDIA 研究团队与 USC 提出 HorizonRelight,通过将目标域上下文从一个滑动窗口传递到下一个,让各片段衔接更连贯,减少长视频分块重打光时的光照跳变、边界伪影和外观突变。该工作基于扩散模型视频方法,论文与演示已随 ECCV 2026 公布。
Google 参与的一项社区协作项目完成了雄性果蝇全部 166,000 个神经元的图谱绘制,用以展示这种微小果蝇大脑的能力。该成果由 Google AI 对外分享。
AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。
Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。