跳到正文

#开源生态

今日 1 条
今天10月10日周六
  1. 创业邦AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇数学手稿,声称证明三维挂谷极大函数与四维挂谷猜想

    OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。

10月9日周五
  1. 字节跳动技术团队AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenViking 团队三篇论文拆解其上下文数据库核心技术

    OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。

  2. AI科技评论AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元 VPP2 登顶 RoboDojo,14B 参数无额外数据开源可复现

    星动纪元(清华唯一持股的具身公司)推出世界动作模型 VPP2(Video Prediction Policy 2),以平均成功率 32.26%、平均得分 39.26 登顶 RoboDojo 榜首,超过此前 GPT-6-Astra 的 22.48% 和 28.97%,并拿下 generalization、precision、memory 三项第一。

  3. DatawhaleAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI公布722份由前沿模型产出的数学手稿

    OpenAI公布了一批由内部前沿模型产出的数学研究成果,包括722份数学手稿和372组相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等多个方向。部分成果附有可由计算机核验的Lean形式化证明,社区初步核查发现其中涉及多个长期未解的开放问题,但具体结论仍需数学界进一步审阅与验证。OpenAI表示,AI正在从辅助解题走向参与真正的数学研究与发现。

  4. 美团技术团队AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"

    美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。

  5. 美团技术团队AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团开源 LoHoSearch 搜索智能体评测基准,用知识图谱让机器自动出题

    美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。

  6. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番

    德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。

  7. 量子位AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元VPP2登顶RoboDojo仿真榜单并开源

    星动纪元自研的世界动作模型VPP2登顶RoboDojo仿真榜单,平均成功率32.26%、平均得分39.26分,两项均列第一,领先GPT-6-Astra。该模型未额外加数据、未用Agent RSI等增强手段,仅靠标准数据集,在泛化、精细操作、记忆三个维度也拿下第一。团队将视频预测与动作学习分阶段训练,真机ALOHA零样本操作平均成功率58.5%,高于π0.5的40%,现已在GitHub开源。

10月8日周四
  1. Perplexity(@perplexity_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-OSS-120B 智能体用 9B 模型在 BrowseComp+ 上取得 64.0%

    在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。

10月3日周六
  1. meng shao(@shao__meng)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HuggingFace 与 LiquidAI 发布多 Harness 强化学习训练指南

    HuggingFace 和 LiquidAI 团队提出一种多 Harness 强化学习训练方案,不改框架代码,在框架与模型之间加一个记录代理,让同一模型同时在四个真实框架里做 RL。

10月2日周五
  1. Hugging Face(@huggingface)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 发布多 harness RL 指南:同一模型在不同 harness 得分 62% 与 33%

    Hugging Face 团队发布多 harness RL 实践指南,指出同一模型同一权重在一个 agent harness 中得分 62%,在另一个中仅 33%。

10月1日周四
  1. Demis Hassabis(@demishassabis)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 SynthID Bio 为 AI 设计蛋白加水印

    Google DeepMind 将 SynthID 引入生物学领域,推出蛋白质水印方法 SynthID Bio,让 AI 生成的蛋白质可以被水印标记。相关成果发表在 Nature 上,团队还实现了兼具功能性与水印的 AI 设计蛋白质的成功合成,并将 SynthID Bio 工具开源供研究社区使用。Demis Hassabis 称这是 AI 时代生物安全的关键一步。

9月18日周五
  1. 阿里研究院AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里达摩院通用医疗影像AI模型DAMO RADAR登上Science并开源

    阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上《科学》(Science),面向腹部增强CT诊断,可一次识别超过146种病症、覆盖18个器官,平均AUC达0.913,现已正式开源。

9月10日周四
  1. AK(@_akhaliq)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AuK 技术报告:开源语音生成与编辑基础模型

    AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。

9月1日周二
  1. Qdrant(@qdrant_engine)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant-FineWeb-10B 发布:最大开源向量检索基准数据集上线 Hugging Face

    Qdrant-FineWeb-10B 已在 Hugging Face 上线,号称最大的开源向量检索基准数据集。该数据集包含 10B 篇 FineWeb 文档、gte-multilingual-base 生成的稠密与稀疏向量,向量规模 24.47 TB,文本与元数据 28.66 TB,并为 120,000 条查询提供精确 top-1,000 真值。

8月24日周一
  1. SemiAnalysisAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 开源 AgentX 1.0:百万上下文多轮智能体编码推理基准,CUDA 护城河在智能体推理下还成立吗?

    SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。

8月22日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 转发 T-Rex 触觉反应式灵巧操作研究

    Jim Fan 转发 Dantong Niu 等人的 T-Rex 触觉反应式灵巧操作研究,该工作针对多数 VLA 模型忽略触觉反馈或无法响应高频接触信号的问题,从数据和架构两方面入手。

  2. Jim Fan(@DrJimFan)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 T-Rex 触觉方法并发布 50 小时触觉数据集

    Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。

8月8日周六
  1. Hugging Face(@huggingface)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 智能体如何复现 ICML 2026 论文

    Hugging Face 发布内容展示 AI 智能体如何复现 ICML 2026 的论文。该内容以直播形式呈现,配文附带 x.com 直播链接,未披露所用模型、复现数量或评测分数等具体细节。

7月10日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 TRACE:让智能体自我训练补齐能力短板,Qwen3.6-27B 在 SWE-bench Verified 达 73.2%

    Stanford AI Lab 提出智能体自我改进方法 TRACE,让模型自己找出失败背后的缺失能力并针对性自我训练。TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,超过体量更大的 Codex 5.2 和 GLM 5,并以不到 1/4 的训练 rollout 击败 GRPO 和 GEPA。

7月6日周一
  1. Import AI — Jack ClarkAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 464:Fable 编写 GPU kernel、AI 自动化与模拟计算

    Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。

7月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队发布 ASPIRE:机器人用技能库实现持续学习

    Jim Fan 公布 Physical AutoResearch 系列第二项工作 ASPIRE,让机器人通过自进化技能库实现持续学习,解决第 100 个任务时不再像第一个任务那样毫无头绪。

6月29日周一
  1. AI at Meta BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Brain2Qwerty v2,非侵入式脑电实时解码词准确率达 61%

    Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。

6月26日周五
  1. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

6月25日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenThoughts-Agent-v2 在所有训练集规模上领先,跨七个 Agentic benchmark 泛化

    OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。

6月12日周五
  1. Richard Socher(@RichardSocher)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive 发布自动化科研系统成果,在 NanoGPT speedrun 等三个基准取得 SOTA

    Richard Socher 宣布 Recursive 公开其自动化开放式发现系统,作为迈向递归自我改进超级智能(RSI)的 v0.1 版本。该系统在 NanoGPT speedrun、NanoChat 和 NVIDIA Sol-ExecBench 三个 AI 任务上均取得 SOTA,且取得这些结果的代码和思路由 AI 系统自身提出,而非团队发明。

6月11日周四
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Crownlands 开源 Gateway 4M,迄今最大活体人类单细胞组织数据集

    Crownlands 开源 Gateway 4M,这是迄今从活体人类中发布的最大单细胞组织数据集,用于推进大脑衰老与神经退行性研究。人类生物学数据对科学家和 AI 理解健康与疾病至关重要,Kevin Weil 称此举对加速 AI 在科学与健康领域的影响意义重大。

6月9日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出编码评测 FrontierCode,最高分 Opus 4.8 仅 13%

    Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。

6月8日周一
  1. Import AI — Jack ClarkAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 460:社会可被 reward hacking、Anthropic 的 RSI 数据、RL 无人机竞速

    Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。

6月6日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 研究论文清单:2026 年 1 月至 5 月

    Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等推出 CaP-X:面向机器人 coding agent 的开源框架与基准

    NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。

  2. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 CaP-X:让智能体在真实机器人上运行

    Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。

  3. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 实验:少量微调即可提升推理模型 CoT 可控性

    METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。

3月9日周一
  1. Jina AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 从向量中逆向出原始文本与模型来源

    Jina AI 发布两项研究:用约 80 万参数的小模型仅看向量即可识别生成模型,在 68 个模型与任务组合上准确率 87%;用掩码扩散模型直接从向量还原原始文本,Token 级还原准确率 81%,在 Qwen3-Embedding-0.6B 上达 81.3%、jina-embeddings-v3 上为 76.0%。

2月21日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA DreamDojo 机器人世界模型:44K 小时视频预训练,蒸馏后达 10 FPS

    Jim Fan 推荐 Shenyuan Gao 的技术详解:NVIDIA 的 DreamDojo 是一个交互式机器人世界模型,基于 44K 小时人类第一人称视频预训练,团队称这是目前机器人世界模型学习中规模最大、最多样的数据集。该模型在泛化能力之外,经知识蒸馏后支持 10 FPS 的实时交互,可用于实时遥操作、策略评估和测试时的基于模型规划,代码、模型与数据已在 GitHub 开源。

2月4日周三
  1. Binyuan Hui(@huybery)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-Universe:让 coding agent 自己构建训练环境,GitHub PR 变身可验证 SWE 环境

    SWE-Universe 是一个可扩展框架,能把 GitHub PR 转化为真实、多语言、可验证的 SWE 环境,由 agent 像人类专家一样自行配置每个环境并加入额外可靠性保障。该框架已在 Qwen3-Coder-Next 的 mid-training 和 RL 中得到验证,团队将推进环境合成作为 agent 自我改进的路径。