跳到正文

#数据/训练

今日 40 条
10月8日周四
  1. Microsoft Research BlogAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软亚洲研究院开源 Agent Lightning v1.0:约 3500 行的智能体 RL 框架

    微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。

  2. 大模型智能AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 TIS 到 score centering,重新理解 LLM RL 中的训推不一致

    文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。

10月7日周三
  1. WSJ-TechnologyAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    扎克伯格 Biohub 联手 DOE 与 NIH,投 18 亿美元为 AI 模型构建生物数据

    扎克伯格的 Biohub 宣布与美国能源部(DOE)和美国国立卫生研究院(NIH)合作,投入 18 亿美元建设生物数据集,供研究人员用 AI 模型寻找预防和治疗疾病的新方法。

  2. DatawhaleAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 十月组队学习开放报名,首次开设 Jev 课程共 11 门

    Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。

  3. 笔记侠AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊 Rufus 创始成员:5年后手机购物 App 会消失

    前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。

  4. WSJ-TechnologyAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Moët Hennessy 用 AI 攻克酿酒中的顽固难题

    Moët Hennessy 正将 AI 用于解决酿酒过程中一个长期存在的顽固问题。另据消息,新兴云厂商 Lambda 正在融资 40 亿美元。

  5. 新智元AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026年诺贝尔化学奖揭晓:95岁 Henri Kagan 与 Kenso Soai 破解生命同手性之谜

    2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。

  6. ChinaTalkAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FCC 拟禁中国光模块:光收发器供应链为何难以简单替代

    继无人机、路由器和逆变器、机器人之后,FCC 正考虑把光收发器纳入限制清单,路透社报道的禁令草案一度令中际旭创股价跌 10%、Coherent 涨 17%。FCC 的网络安全逻辑成立,但其8月14日生效的组件规则只覆盖 Covered List 企业,并不包含最大中国光模块厂商。中国厂商主导模块与激光器环节,中段仍依赖西方供应商,而底层材料美国短期内难以摆脱依赖。

  7. Julien Chaumond(@julien_c)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 4 用 3.8% 的 GPU 实现 GPT-6 Astra 72% 的智能水平

    Mistral 4 仅用 3,800 块 Grace Blackwell 就达到 GPT-6 Astra 72% 的智能水平,后者使用超过 100,000 块 Grace Blackwell。按"每 GPU 智能"计算,Grok 4.7 约用 200,000 块 GPU,Claude Opus 5.5 约用 500,000 块 Trainium2,凸显 Mistral AI 团队的效率优势。

  8. 投资融资AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    派拉蒙 1100 亿美元收购华纳兄弟探索完成;月之暗面完成 500 亿美元估值 Pre-IPO 融资;Mistral 发布万亿参数 Large 4|极客早知道

    Mistral 发布旗舰模型 Mistral Large 4 公开预览版,采用 MoE 架构、总参数 1 万亿、每次推理激活 490 亿参数,支持 100 万 Token 上下文窗口,权重计划 10 月 27 日开放。派拉蒙天空之舞以约 1100 亿美元完成对华纳兄弟探索的收购,合并后更名 Skydance。月之暗面完成最后一轮私募融资,估值约 500 亿美元,拟明年第一季度在香港 IPO。

  9. 投资融资AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    培生收购 AI 原生技能平台 Workera,金额未披露

    培生已同意收购 AI 原生技能平台 Workera,交易金额未披露,预计 2026 年下半年完成交割。Workera 结合代理式 AI、心理测量学和自适应评估衡量员工技能,已验证超 1 亿项技能,收入接近 100% 同比增长,客户包括 ServiceNow、埃森哲和美国太空军。交易完成后 Workera 将并入培生企业学习与技能部门,其 CEO Kian Katanforoosh 加入培生。

  10. 国际大厂AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部模型 722 篇数学论文,攻克 500 个公开数学难题中的 90 个

    OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。

    为什么值得看

    汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。

  11. 赛博禅心AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇数学论文,第 003 号为准黎曼假设

    OpenAI 将内部前沿模型产出的数学成果放到 GitHub 仓库 openai/math,共 722 篇论文、归为 372 个族,涉及约 4000 道问题,平均每个结果消耗约 3 小时 ChatGPT Pro 的思考算力。

  12. AI科技评论AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    至简动力冯宗宝 IROS 2026 演讲:在 0.5 毫米间隙下用机器人造机器人

    至简动力强化学习负责人冯宗宝在 IROS 2026 介绍,其团队让机器人单机自主值守两台 CNC 机床,在工件与卡盘间隙仅 0.5 毫米的条件下完成抓取、上料、插入、取件与放置,精密插入任务成功率达 100%,训练仅用 600 条真实机器人轨迹。

  13. meng shao(@shao__meng)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    别让 LLM 既当运动员又当裁判:数据分析 Agent 引入独立审查层

    Sumanth 构建的数据分析 Agent 采用三层职责分离架构:Qwen(经 Vercel AI Gateway 调用)只负责理解问题、生成只读 SELECT 并解释结果。

  14. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 InnovationEval:AI 能自动完成 AI 研发吗?

    Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。

  15. AI寒武纪AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇 AI 撰写数学论文,单题消耗约 3 小时 Pro 算力

    OpenAI 发布了 722 篇由 AI 撰写的数学论文,成果已打包上传至 GitHub 仓库,但这些声明尚未得到外部数学家证实。平均每道难题的解法消耗 ChatGPT Pro 深度思考约三小时算力,OpenAI 同步给出大量 Lean 代码用于机器核验证明,并开源技术细节与模型推理过程。

  16. 宝玉(@dotey)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇 AI 数学论文并回应学界发布建议

    OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。

  17. a16z(@a16z)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Valon 完成 1.5 亿美元 D 轮融资,估值 23 亿美元

    抵押贷款服务软件公司 Valon 完成 1.5 亿美元 D 轮融资,估值 23 亿美元;开始卖软件六个月内签约额超 2 亿美元。该公司把联邦和州监管规则转成代码,自营服务商的效率达到行业约 3 倍,目前美国一家大型服务商正将 400 万笔贷款迁移到其平台,约占市场近 10%。

  18. The Rundown AI(@TheRundownAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未公开内部模型发布 722 篇数学论文

    OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。

  19. Fireworks AI(@FireworksAI_HQ)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 用纯 SFT 微调 9B Jev 分类器,完整配方开源

    Fireworks 的 AI 开发者教育负责人用纯 SFT、公开数据集和两个简单技巧,在 Fireworks 上微调出一个 9B Jev-style 决策分类器,无需前沿实验室级别的预算。完整训练配方已开源,可自行训练同类模型。

  20. DeepLearning.AI(@DeepLearningAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo-V2.6-Pro RL 用质量清单加权修复应试模型,登顶开源模型智能指数

    小米发现只以通过测试为目标的模型会添加未被要求的代码并让错误静默通过,于是将每项测试结果乘以质量清单评分来修正。结果 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。

  21. NVIDIA Technical BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Megatron Core 实现可扩展的比特级确定性预训练

    NVIDIA Megatron Core 支持比特级确定性预训练,让大规模预训练更易调试、验证和可复现地恢复。在数千块 GPU 上训练万亿参数模型时,多维并行、低精度计算和分布式检查点会让故障复现与修复验证变难,比特级确定性可应对这一问题。

  22. elvis(@omarsar0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Overmind 开源:从 agent traces 构建数据集并训练自有专用小模型

    作者推荐开源项目 Overmind,认为应通过挖掘 agent traces 中的知识来掌控自己的智能栈。Overmind 能从代码和 traces 构建上下文图、整理训练与评估数据集、评估提示词和模型,并训练出用户自己拥有的更小专用模型。项目地址为 github.com/overmind-core/。

  23. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文提出 Harness-Aware Distillation:为小语言模型智能体做 harness 感知蒸馏

    一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。

10月6日周二
  1. Firecrawl(@firecrawl_dev)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 在 Alexandria 推出梦幻体育数据,ChatGPT 或 Claude 可接入

    Firecrawl 在 Alexandria 上线梦幻体育数据,让 ChatGPT 或 Claude 接入球员与球队数据、梦幻分析、新闻和赔率等数百万数据点。用户可通过 Firecrawl 插件用 100 倍于以往的研究量来构建阵容。

  2. The Keyword (blog.google)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Earth AI 用地理空间智能体推进公共卫生预测

    Google Research 与 Google Health 发布研究,展示 Google Earth AI 结合卫星影像、移动性数据与基础模型(AlphaEarth Foundations、Population Dynamics Foundation Model),并配合 Geospatial Reasoning 智能体原型,帮助公共卫生机构预测疾病暴发。

  3. NVIDIA AI(@NVIDIAAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 2026 电信 AI 调研:89% 受访者称开源模型与软件对 AI 战略重要

    NVIDIA 2026 电信 AI 调研显示,89% 受访者认为开源模型和软件对其 AI 战略重要,66% 表示公司正在积极使用 AI,高于去年的 49%。

  4. 十字路口CrossingAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    他们的新工作,是教 AI 取代自己:AI 训练数据供应链里的劳动者

    Mercor 等数据公司正以时薪低至 45 美元起的零工,雇人编写评分细则、标准答案和推理轨迹来训练 AI,部分项目任务量骤减、时薪下调 8 美元,劳动者还被 Insightful 软件逐秒监控。Mercor 由三名 19 岁创始人于 2023 年创办,去年估值达 100 亿美元,每周约 3 万名专业人士在其平台工作,OpenAI 和 Anthropic 都曾是客户。

  5. 百度AIAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    第十三届百度奖学金申报倒计时3天:20万元科研奖金,10月8日截止

    第十三届百度奖学金申报通道将于2026年10月8日23:59(北京时间)关闭,面向全球高校华人在校本科生、硕士和博士生,提供20万元科研奖金。重点研究方向包括大语言模型、多模态理解与生成、AI系统与基础设施、机器学习等,获奖者可与百度科学家交流并优先对接百度AIDU顶尖人才计划。

  6. 数字生命卡兹克AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    聊聊 A16Z 两份 AI 报告,以及一些反常识的真相

    作者卡兹克解读 A16Z 第七版《Top 100 消费级 AI 应用》与 9 月底更新的《市场状况 II》两份报告,整理出其中的反常识数据。

  7. Epoch AIAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谁最容易受到芯片供应冲击?Epoch AI 拆解半导体投入产出数据

    Epoch AI 将半导体从国际投入产出表的宽泛电子类别中拆分出来,测算各国对芯片供应链冲击的暴露程度。2022 年每 1000 美元中国最终需求为半导体生产商带来 15.2 美元收入,是美国的 2.7 倍(美国为 5.7 美元)。在台湾供应中断叠加中西脱钩的模拟情景中,中国先进处理器价格上涨 17 倍、实际国民总支出下降 3%,美国则约为 20% 涨幅和 0.6% 降幅。

  8. QdrantAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google EmbeddingGemma 2 能压到多小?1-bit 量化省 30 倍向量内存

    Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。

  9. a16z(@a16z)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z:AI 支出前 1% 用户月均 903 美元,超过后 50% 总和

    a16z 的 Top 100 Consumer AI Apps 分析显示,AI 支出前 1% 的用户月均花费 903 美元,已超过后 50% 用户的总和,而后者的中位数支出仅 25 美元。

  10. 大模型智能AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton等22人发布首篇RSI论文,讨论AI研发自动化是否触发智能爆炸

    Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?

10月5日周一
  1. clem 🤗(@ClementDelangue)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 用代理把 Claude Code、Codex 等 10 个编码 harness 变成 RL 训练环境

    Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。

  2. freeCodeCamp.orgAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如何改变邮件送达率:发件人声誉与收件箱放置的技术指南

    邮件服务商正用机器学习取代固定规则来判定发件人声誉,模型会同时分析正文措辞、链接与附件特征、发送频率突增,并结合历史发件行为和收件人实时互动做出整体判断,因此上下文比单个关键词更重要。

  3. 硅星人ProAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 领投 Sigil Wen 的 Conway Research,Underdog 首轮融资获硅谷豪华阵容参投

    a16z 领投 Conway Research 首轮融资,核心产品为 Underdog,金额未公布,参投方包括 Khosla Ventures、Hummingbird、Anthropic 与 Menlo Ventures 联手设立的 Anthology Fund,个人投资人含 Naval Ravikant、Noam Brown、Logan Kilpatrick。

  4. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    递归自改写实现复杂任务的扩展轨迹

    一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。

  5. Z PotentialsAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harvey 联创 Gabe Pereyra:应用公司如何借助开源与评测建立研究能力

    法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。