跳到正文

#数据/训练

今日 36 条
10月9日周五
  1. DatabricksAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    生物医学影像的真正瓶颈是数据,而不是模型

    生物医学影像领域的真正瓶颈在于数据而非模型。文章指出医院与卫生系统产生的数据虽多,但四个相关领域都卡在同一个数据环节上。

  2. Anthropic(@AnthropicAI)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    天体物理学家用 Claude Science 绘制首张完整紫外天图

    天体物理学家 Brice Ménard 借助 Claude Science 制作出首张完整的紫外天空图,填补了此前大片天空从未在 UV 波段被观测的空白。他引导 Claude 找到已有数据集、将其合并,并用统计推断补全缺口,这项工作原本需人类数周,用 Claude 仅花几天,期间他还能处理其他项目。该图可作为教学工具,也说明 AI 让这类低优先级、科学家一直无暇推进的慢工变得可行。

  3. THE DECODERAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Claude 推出 Dashboards 与 Motion 两项 beta 功能

    Anthropic 为 Claude 上线两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。

  4. Notion(@NotionHQ)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 推出数据智能体 Data Scout,可连接 Snowflake 与 Slack

    Notion 内部使用最频繁的智能体之一名为 Data Scout,可将 Snowflake 与 Notion、Slack 等数据源连接,让任何人用自然语言提问数据,并展示答案来源以便核实与深挖,还能被其他智能体调用生成周期性报告。Notion 同时正帮助一小批客户构建他们自己的数据智能体。

  5. NVIDIA Technical BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获亚军

    NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,其系统核心思路是让智能体的 harness 更小、更清晰、更易于验证。该竞赛要求智能体针对数据库、CSV 和 JSON 文件、散文文档、PDF 及简报视频等异构数据源回答自然语言问题。

  6. Jerry Liu(@jerryjliu0)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex:Markdown 成为人与智能体之间的通用信息表示,并推出非结构化文档转 Markdown 模型

    LlamaIndex 称 Markdown 已成为人与 AI 智能体之间的通用信息表示,它保留标题、列表等结构原语,让智能体能按语义读懂内容,并支持表格、图表,还可原生嵌入 HTML。由于多数非结构化数据尚不原生以 Markdown 存在,难点落在转换层,LlamaIndex 表示已打造最优模型,可将任意非结构化文档容器转为 Markdown,表格合并表头时改用 HTML。

  7. SemiAnalysisAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:北京不会为前沿AI放慢脚步,中国采取速度优先的安全监管

    SemiAnalysis 统计 2021 年至 2026 年 9 月 15 日 9 家中国头部开发商的 857 个模型发布,仅 31 个(3.6%)附带开发者公布的安全评估结果,其中只有 9 个(1.1%)在发布时或之前公布。

  8. Hugging Face(@huggingface)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 在 Paper Pages 推出论文复现功能

    Hugging Face 在 Paper Pages 上线论文复现功能,可用 ML Intern 对已发表论文发起复现任务。Hugging Face 的 Abubakar Abid 指出,随着智能体在算力驱动下加速科研发现,发现被商品化、低质量论文泛滥、企业倾向于保密,开放共享科学的激励正在瓦解,因此需要新工具来奖励知识公开。

  9. 投资融资AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Field AI 完成 7 亿美元 B 轮融资,机器人控制模型已落地;白犀牛获数千万美元 C+ 轮,韩国友利金融集团入局无人配送

    Field AI 完成 7 亿美元 B 轮融资,其可跨场景快速迁移的机器人控制模型已在全球数百个复杂工业场景完成测试与部署,客户无需二次开发即可规模化部署。白犀牛获数千万美元 C+ 轮融资,由湖南财信、博正资本、隐山资本、深重投、湘潭国资、韩国友利金融集团等联合投资,专注城市公开道路 L4 自动驾驶无人配送。

  10. elvis(@omarsar0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSIGym:Evolvent AI 发布 AI 研究智能体训练环境,Opus 5 在 SWE-bench Verified 提升至 50.33%

    Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。

  11. LlamaIndex 🦙(@llama_index)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 解析默认输出 Markdown,合并表头场景改用 HTML

    LlamaIndex 将 Markdown 作为解析的默认输出格式,因为 Markdown 能保留标题、列表和表格结构,避免解析器读对每个词却丢失数字所属列、迫使模型猜测的问题,且调试错误答案时仍可读。对于存在合并表头的表格,则改用 HTML 输出。

  12. andrew chen(@andrewchen)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kenan Saleh:一家公司 3 个月从 $0 做到 $60M,本月将达 $100M run-rate

    Kenan Saleh 称其合作的一家公司 3 个月内从 $0 增长到 $60M,本月将触及 $100M run-rate,是他见过增长最快的公司。该公司向 AI 实验室和模型开发者售卖前沿数据(frontier data),他认为外界尚未充分认识到数据与算力、算法并列成为一等公民。

  13. AI Breakfast(@AiBreakfast)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voice Arena 发布覆盖 50 种语言的 Monsoon ASR 语料库

    Voice Arena 发布 Monsoon ASR 语料库,目前已覆盖 50 种语言、100,000 小时数据,其中多为长尾语言,计划 2027 年底扩展到 1,000 种语言。

  14. Latent Space [Youtube]AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Synthesis Superintelligence:从半导体到超导体——Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk

    Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出“synthesis superintelligence”,主张让模型在真实物理实验中做强化学习,而非只训练互联网数据。他们认为科学发现不同于数学与编程,物理实验才是最终基准,失败实验可能是最有价值的训练数据,目标是让每台实验仪器具备“140 IQ”并压缩数十年的试错。

10月8日周四
  1. InfoQ 中文AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TanStack Charts 发布 Alpha 版:框架无关的 TypeScript 图形语法,周下载量约 16 万

    TanStack 团队推出 TanStack Charts,为 TypeScript 提供框架无关的可视化图形语法,目前仍标记为 Alpha,每周下载量约 16 万次。

  2. 地缘政治AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hertha Metals 瞄准打破中国对关键金属的掌控

    休斯顿初创公司 Hertha Metals 开发出一种生产稀土磁体所需高纯度铁的方法,目标是松动中国在关键金属领域的掌控。该技术瞄准稀土磁体供应链上游的高纯度铁环节。

  3. DeepTech深科技AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Biohub 联合美国能源部、NIH、Google DeepMind 等扩容虚拟生物学计划,投入约 18 亿美元

    10 月 7 日,扎克伯格与普莉希拉·陈支持的 Biohub 宣布扩大虚拟生物学计划,联合美国能源部、NIH、Google DeepMind、Isomorphic Labs 和 Meta 等,汇集约 18 亿美元资金、数据、算力与实验测量资源,建设面向下一代生物学 AI 模型的开放数据基础设施。

  4. 划重点KeyPointsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    聚光灯之外:传统行业拥抱AI的真实落地图景

    养猪业连亏超10个月,佛山50人养猪设备公司老板刘文用AI重写卖了十年的软件;牧原与阿里云共建养猪大模型,一秒出诊断结果并铺设至1000多个猪场。一线从业者的阻力多来自数据割裂与部门墙,而非模型本身;刘文每月花不到6000元订阅AI,靠内容矩阵每月稳定获客30个。

  5. AI科技大本营AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多加 50% GPU,Rollout 只快 10.3%:Agent 训练的瓶颈开始从模型转向系统

    中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。

  6. WSJ-TechnologyAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Samsung 预计营业利润首次突破 800 亿美元

    Samsung 预计营业利润将首次超过 800 亿美元。作为存储芯片巨头,Samsung 持续受益于全球对先进芯片的需求,各公司正大举投资 AI 基础设施与应用。

  7. AINLPAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Unsloth 发布本地训练决策模型教程与开源仓库

    Unsloth 发布本地训练教程与开源仓库,可将 Qwen3.8、Gemma 4 等 LLM 微调为输出选项概率的决策模型。Unsloth 报告,Qwen3.5 0.8B 在三个决策基准上的合计准确率从 20.7% 提升至 74.3%,并称仅需 4GB 显存。

  8. AING硬迹AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    同济博士团队景立构(ScanArk)让原生3DGS成为可交互真实世界,4个月完成三轮融资

    面向 Physical AI 的 Reality-to-Sim 具身智能基础设施公司景立构(ScanArk)完成 Pre-天使轮融资,4个月内累计完成种子轮、种子+轮及 Pre-天使轮三轮融资,累计数千万元人民币,投资方包括小苗朗程、国海创新资本、头部具身机器人公司及知名产投机构等。

  9. 智能涌现AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    同济博士团队景立构让原生3DGS成为可交互真实世界,4个月完成3轮融资

    面向Physical AI的Reality-to-Sim具身智能基础设施公司景立构(ScanArk)宣布完成Pre-天使轮融资,4个月内累计完成种子轮、种子+轮及Pre-天使轮三轮融资,累计数千万元人民币。

  10. 硅星人ProAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 ZooWork 创始人 Ning Hu:企业 AI 最大的跃升,发生在硅谷之外

    ZooWork 创始人兼 CEO Ning Hu 在 Assembling 2026 AI 峰会炉边对谈中提出企业 AI 的 L1 到 L4 分级:L1 是人用 AI 提效,L4 是 AI 在岗位上执行并递归学习,目前多数企业仍停留在 L1。

  11. Z PotentialsAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    厘清智能完成两轮数亿元融资,加速建设Physical AI平台级底座

    厘清智能近日完成天使轮及天使+轮数亿元融资,蚂蚁集团连续两轮加码并领投天使+轮,CMC资本、国汽投资、中金资本旗下基金等跟投。融资将用于物理世界数据管线、模型研发、物理仿真、能力评测、跨本体适配与部署系统。公司已推出T1系列数采手套和Ego数采设备,为模型厂商与AI研发团队提供多模态数据采集、加工标注与专项数据集建设服务。

  12. 多维资本AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    北卓医疗完成近亿元Pre-A轮融资,加速无创脑机商业化落地

    北卓医疗宣布完成近亿元Pre-A轮融资,由元明资本与中关村资本联合领投,多维资本担任财务顾问,资金将用于核心技术迭代、临床管线推进与医疗器械注册申报。

  13. 线性资本AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本溯智能BASAL完成种子轮融资,五源资本领投、线性资本参投

    本溯智能BASAL完成由五源资本领投、常春藤资本、线性资本、华山资本参与的种子轮融资,公司由清华AIR首届博士生李健雄带领八名具身智能研究者创立于2026年7月。

  14. freeCodeCamp.orgAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 CPU 上从零构建并训练 2500 万参数 LLM

    freeCodeCamp.org 发布一小时视频教程,演示在笔记本或普通 CPU 上从零构建、预训练并微调一个 2500 万参数语言模型。课程涵盖混合线性/稀疏注意力、MoE、绑定嵌入权重和多模态图像 patch 输入等现代架构,并搭建轻量 RL 循环让模型写代码、跑单元测试、拿奖励,任务成功率从 0% 提升到通过多数评测。教程还讲解如何形成可检验假设、调节温度与奖励结构并检查统计显著性。

  15. 硬氪AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    卫澜深海 9 个月内完成 5 轮融资,深创投、元禾原点押注水下具身智能机器人

    海洋具身智能公司卫澜深海在 9 个月内完成 5 轮融资,轮次推进至天使++++轮,核心股东包括深创投、元禾原点,资金用于训练水下具身智能模型、建设水下具身智能训练中心及深化海洋油气能源场景应用。

  16. 硬氪AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星火传明完成A轮融资,推进红外卫星批产与太空私有云SaaS

    商业红外遥感企业星火传明完成A轮融资,资金将用于高分辨率红外载荷与星地激光通信地面站产线建设及批产、在轨星座组网和星上AI算法迭代。公司已有T0、T1、T2三颗红外遥感卫星在轨,T2中波分辨率达5米并验证端到端时延控制在1分钟以内,正研制3米中波载荷,规划年产100套红外载荷与50套激光地面站产线。公司还规划太空私有云SaaS,将卫星在轨算力按时间和区域切片供客户自主调用。

  17. 地缘政治AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国加速建设数据中心以争夺AI优势

    英国《金融时报》报道,中国正以极快速度推进算力基础设施建设,内蒙古是其中重点布局区域。报道将这一动作放在中国争夺AI优势的背景下描述。

  18. TechcrunchAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    机器人数据初创公司 Mecka AI 获 Sequoia 6000 万美元融资

    机器人数据初创公司 Mecka AI 从 Sequoia 获得 6000 万美元融资。该公司通过付费让人录制日常任务,采集并分析人体运动数据,用于训练人形机器人及其他类型机器人。

  19. Simon Willison's WeblogAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ben Affleck 谈影视特效中的机器学习与 Python

    Ben Affleck 自称会写"相当糟糕的" Python 脚本,长期关注计算机与电影从模拟向数字的转变。他提到视觉特效流程多年来已用到机器学习,用卷积神经网络(Transformer 的前身)在 tensor 上做边缘检测和特征提取,从而更轻松地抠掉绿幕画面并替换背景。

  20. 技术前沿AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何将 dbt ETL 管道迁移到 Databricks

    把已在运行的 dbt 项目迁移到 Databricks 无需重写业务逻辑,只需更换 dbt-databricks 适配器和连接配置,再处理少数 SQL 方言差异。

  21. Perplexity(@perplexity_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    9B 与 0.6B 模型在 Q2D-Web 检索基准上超越 nemotron-embed-8b

    在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。

  22. Microsoft Research BlogAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软亚洲研究院开源 Agent Lightning v1.0:约 3500 行的智能体 RL 框架

    微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。

  23. 大模型智能AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 TIS 到 score centering,重新理解 LLM RL 中的训推不一致

    文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。

10月7日周三
  1. WSJ-TechnologyAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    扎克伯格 Biohub 联手 DOE 与 NIH,投 18 亿美元为 AI 模型构建生物数据

    扎克伯格的 Biohub 宣布与美国能源部(DOE)和美国国立卫生研究院(NIH)合作,投入 18 亿美元建设生物数据集,供研究人员用 AI 模型寻找预防和治疗疾病的新方法。

  2. DatawhaleAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 十月组队学习开放报名,首次开设 Jev 课程共 11 门

    Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。

  3. 笔记侠AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊 Rufus 创始成员:5年后手机购物 App 会消失

    前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。