TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番
德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。
德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。
JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,提出一套审查 AI 生成代码的概念框架,核心观点是审查 AI 生成代码的关键问题是"信任校准",而非传统的 diff 比对。
微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表 Agent 研究中提取改进思路,写入运行框架 Harness,再用真实任务检验,执行任务的模型本身保持不变。
一个机器学习系统能在极端空间天气风暴抵达前 30-60 分钟预测破坏可能发生的位置。极端空间天气事件会损坏地球电力系统,并降低 GPS 精度与卫星运行能力。
微软研究院启动早期研究项目 Quine,一个面向生物学的多模态世界模型,通过跨生物尺度与模态连接洞察,帮助科学家在远超直觉可及的空间中进行计算搜索,并在进入实验室前对假设排序。实验结果会作为反馈,帮助研究者校准后续研究方向。
微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。
Microsoft Research 新研究显示,将 AI 推理从机器人本体移出可提升任务成功率、提高效率,并支撑更先进的物理 AI 工作负载。该结论指向机器人硬件与智能增长不匹配的问题,即算力从机器人端外移是可行路径。
微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。
Microsoft Research 在 Nature 发表论文,介绍预测模型 RetroChimera,用于加速化学合成、帮助研究人员探索更广泛的分子。定制分子在医药、材料和农业领域不断推进,但生产成本高、速度慢。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。
微软研究院新一期 Research Focus 聚焦四个方向:编码智能体在规模化场景下的行为表现、AI 模型在 PET/CT 扫描中识别淋巴瘤病灶的评估、AI 聊天机器人依赖问题,以及大规模决策系统的推进。
微软研究院的 Garnet 获最佳论文奖,这是一个面向现代应用与云服务的新一代缓存存储层,可在无需修改任何应用的前提下带来数量级更高的性能与效率。Garnet 已作为开源软件开放使用。
Microsoft Research 宣布其两篇论文在 VLDB 2026 上获得表彰,并向相关研究人员致意。帖文未披露论文题目与具体获奖类别。
微软研究院发布深度学习交换相关泛函 Skala 1.1,在提升精度的同时扩展了对计算化学生态系统的可及性,并引入可持续跟踪计算性能的 living benchmark。该版本为 Skala 的更新版本。
Microsoft Research 发布更新版深度学习交换关联泛函 Skala 1.1,精度更高,并扩展了对计算化学生态的兼容性。该版本同时提供一个持续更新的基准,用于追踪计算性能。
Microsoft Research 推出 MindTopo 基准,用于测试 AI 对路径、栅栏、绳结等拓扑关系的理解能力。该基准揭示 AI 在空间推理与规划方面仍有提升空间,并指出新的改进机会。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。
Microsoft Research 提出 CARE-X,探索将灵活推理、校准预测与基于测量的工具统一用于胸部 X 光解读,让放射学 AI 不再局限于生成报告。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可兼顾报告生成与结构化诊断预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。另一项独立实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,检验直接计算能否改善心脏增大等依赖测量的病变判断。
微软研究院介绍多项成果:小语言模型通过 SocialRL 学习谈判,PazaBench V2 将语音 AI 评测扩展到多种非洲语言,EvoLib 则帮助智能体把经验转化为知识。此外还包括更可靠的 A/B 测试方法以及 AI 驱动精准肿瘤学的进展。
Microsoft Research 提出 Echoverse,用于训练计算机操作 AI 智能体,让它们在真实环境中随任务、测试和环境的变化持续提升,而非单纯增加训练任务量。这类智能体目前在多步工作流(如邮件处理、客户支持)中仍表现吃力。
微软推出 EvoLib,将模型部署后积累的经验转化为可复用的技能与洞察,形成持续演化的知识,帮助 LLM 跨任务学习与适应,而非仅靠记住更多内容变聪明。
微软研究院(MSR)牵头的 AI Foundations for Power Grids 研讨会已获 NeurIPS 2026 接收,正在征稿,截止 8 月 29 日。征稿方向包括 benchmark、模型训练、可靠性、基础模型与真实部署。
PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。
Microsoft Research 发布 PazaBench 第二版,这是一个用于评估自动语音识别(ASR)模型在非洲语言上表现的 benchmark。该版本延续其对多语言 ASR 能力的评测定位,具体模型、语言覆盖与分数尚未在原文中披露。
Microsoft AI Futures 团队在 Nature Health 发表新论文,审查了覆盖 109 个国家的 170 万次对话,发现 Copilot 对本国卫生系统信心较低的人群尤其有价值。团队称这是 AI 为全球服务不足人群提供支持的进一步证据。
微软研究院提出一种新方法,可在开发者编写密码学代码的过程中同步验证代码,并在实现与演进过程中兼顾速度与适应性。密码学代码支撑着现代计算系统的关键防护,该方法的细节尚未在公开信息中展开。