跳到正文

#数据/训练

今日 43 条
9月23日周三
  1. Perplexity(@perplexity_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 研究:用提示引导自蒸馏后训练 Computer 模型,工具调用失败率降低 21.2%

    Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在线 A/B 测试中,较晚训练出的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。

  2. NVIDIA AI(@NVIDIAAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 NVIDIA Nemotron 3 Ultra 打造 AI 供应商智能体 Lucy,核算数据中心碳足迹

    Sluicebox 构建了名为 Lucy 的 AI 供应商智能体,用于梳理零部件清单、文档和供应商邮件等数据,帮助工程师在设计阶段就了解数据中心碳足迹。Lucy 基于 NVIDIA Nemotron 3 Ultra,在 Sluicebox 测试中提升了准确率,成本降低 51–80%,响应速度最高提升 2 倍。

  3. AK(@_akhaliq)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    onPanda:通过 Token 级纠正高效标注 LLM 与智能体的 on-policy 对齐数据

    onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。

  4. Taranjeet(@taranjeetio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DolphinBench 发布:面向智能体记忆的动作评测基准,同时衡量准确率、成本与延迟

    DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。

  5. 屠龙之术AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AICC2026 观察:从 Chat 到 Agent,智能、算力与芯片走向何处

    AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。

  6. mem0(@mem0ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Memory Benchmarks 对比:智能体记忆评测的三个关键属性

    一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。

  7. Anthropic NewsAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 用 Claude 发现类 CRISPR 的新型酶系统 ART

    Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。

9月22日周二
  1. Firecrawl(@firecrawl_dev)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 为 Alexandria 提供资金,让内容生产者从 AI 智能体获取信息中获益

    Firecrawl 宣布将这笔资金用于 Alexandria,帮助研究者、出版商、专家、内容创作者和数据提供方获得报酬,以便为 AI 智能体提供更好的信息。该平台现已开放提供方等待名单(waitlist)申请。

  2. Firecrawl(@firecrawl_dev)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 打造 Alexandria,帮 AI 利用快速增长的数据解决人类难题

    Firecrawl 正在构建 Alexandria,目标是让 AI 能够利用世界快速增长的数据,解决人类最棘手的问题。该项目被形容为"为超级智能建造的图书馆",并已通过 firecrawl.dev/careers 开放招聘。

  3. Firecrawl(@firecrawl_dev)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexandria 获 7500 万美元 B 轮融资,Smash Capital 领投,打造超智能最大知识库

    Alexandria 完成由 Smash Capital 领投的 7500 万美元 B 轮融资,目标是为超智能构建全球最大的知识库。该平台让 AI 智能体即时接入最强数据集与数据供应商。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical,临床音频转录 WER 降低 18%

    ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。

  5. 快手技术AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手联合北航提出 TB 级推荐模型 Checkpoint 系统 AdaptCP,被 EuroSys 2027 接收

    快手技术团队联合北京航空航天大学提出面向工业级推荐模型训练的自适应检查点系统 AdaptCP,相关论文已被 EuroSys 2027 接收。

  6. 晚点LatePostAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    理想推进芯片子公司首轮融资,投前估值约 150 亿元

    晚点独家获悉,理想芯片子公司正推进首轮外部融资,投前估值约 150 亿元,计划融资数十亿元。工商信息显示,Mach Intelligent Cores Limited 于 7 月 14 日在香港成立,其全资持有的上海马赫智芯智能科技有限公司于 8 月 4 日成立,理想 CTO 谢炎任法定代表人。

  7. 阿里技术AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里开源六个 AI 基础设施项目,覆盖强化学习到代码评审全链路

    阿里在云栖大会集中发布 ROLL、RTP-LLM、Atrex Kernel Agent、OpenSandbox、Open Agent Auth、OpenCodeReview 六个开源项目,分别面向大规模强化学习、生产级推理、异构算子生成优化、Agent 沙箱运行、企业级授权和智能代码评审。

  8. Hunyuan(@TXhunyuan)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4 preview 用 214 GiB 装下 770B 参数模型:STQ1_0 量化如何做到"体积更小、智能不变"

    腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。

  9. Epoch AIAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:AI 推理成本每季度下降约 47%,快于 DNA 测序与算力

    Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。

  10. 有机大橘子AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 背后的野心:用校准决策取代 RLHF,实现完全自动化

    TypeSafe 于 9 月 15 日发布首个模型 Jev,它不生成文本、只输出带置信度的判断,速度比前沿大模型快两百倍、价格便宜四百倍。CEO Diogo Almeida 认为 RLHF 把人类偏好放进训练循环,导致谄媚与幻觉,AI 因此无法离开人实现自动化,Jev 选择优化"校准的决策"这条第三条路。

  11. clem 🤗(@ClementDelangue)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HuggingFace CEO 力推 Halo:开源模型后训练框架,吞吐量达 TRL 的 2.8 倍

    White Circle 发布开源模型后训练框架 Halo,吞吐量最高达原生 TRL 的 2.8 倍,峰值内存更低,且模型保持 HuggingFace 原生格式。HuggingFace CEO Clement Delangue 转发称,借助智能体,训练模型正变得越来越容易。

  12. Thomas Wolf(@Thom_Wolf)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf:开源高质量 RL 环境是推动开源前沿最有影响力的事

    Thomas Wolf 认为,在 RLVR 新范式下,发布大量高质量开源 RL 环境相当于当年共享高质量预训练数据,是当下推动开源前沿最有影响力的事。他转述 eliebakouch 的说法称,对方将开源约 7k RL 训练数据及框架,并已发布模型与技术报告,距启动最终 RL 训练不到 1 周。

  13. SemiAnalysisAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MoE 推理的计算与数据搬运:Prefill、Midfill、Decode 四阶段解析

    SemiAnalysis 解析 MoE 推理的计算与数据搬运,将模型服务拆为 Prefill、Midfill、Decode attention、Decode experts 四种运行模式,各自对算力、内存和网络的需求不同。

9月21日周一
  1. Microsoft Research BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软在 Nature 发布逆合成模型 RetroChimera,开源实现与权重

    微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。

  2. clem 🤗(@ClementDelangue)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    eidon.ai 关停后开源 1,274 小时第一人称机器人数据

    关停的初创公司 eidon.ai 将 1,274 小时第一人称视角机器人数据开源,包含 13,451 段人类完成日常任务的录制,作为送给机器人社区的礼物。数据已发布在 Hugging Face 上。

  3. 快手技术AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手技术沙龙第五期回顾:聚焦 Data Agent,共探数据生产与智能决策新范式

    快手在第五期技术沙龙上首次系统披露 Data Agent 规模化落地数据:平台 WAU 突破 10,600,周人均对话 55 次,数据分析师与产品运营渗透率超 80%,NPS 达 73.5,单次任务提效中位数 13 倍。

  4. 暗涌WavesAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家|智冉医疗获超6亿元融资,侵入式脑机接口128通道启动GCP注册临床

    侵入式脑机接口公司智冉医疗完成新一轮融资,估算金额超6亿元,顺禧基金、君联资本、红杉资本、美团龙珠等参与投资,累计融资已超12亿元。其128通道脑机接口系统今年5月启动多中心GCP注册临床,计划年内完成30至40例患者入组,预计明年提交三类证注册申请,下一代1024通道产品已定型。

  5. 阿里研究院AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    安筱鹏:AI时代,数据如何构筑企业的护城河

    阿里云智能副总裁安筱鹏在中国国际大数据产业博览会上提出,AI时代企业护城河取决于数据从比特到Token的转化率,而非数据存量或模型强弱。他引用a16z报告称,今年2月AI智能体的Token消耗首次超过人类用户,到8月已达人类用户的5倍,前沿企业与一般企业的Token消耗差距从2.6倍扩大到8.3倍。企业需构建数据知识资产化、模型管理、智能体开发运营三大平台,以及智能体运营与模型训练两个飞轮。

  6. 十字路口CrossingAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对谈清华叉院助理教授徐梦迪:具身智能的 In-Context Learning、世界模型与 Scaling Law 信号

    清华交叉信息研究院助理教授徐梦迪的核心研究方向是机器人的 in-context learning:让机器人到新环境后通过一两次交互当场学会新任务,且越学越快。节目录制后第二周,Generalist 发布 GEN-1.5,仅给机器人看一段 3-12 秒动作示范作为 physical prompt,不做微调、不更新参数即可当场尝试新任务,10 项任务平均成功率约 59%。

9月20日周日
  1. Suhail(@Suhail)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nathan Lambert:中国头部 AI 实验室在规模化 RL 中转向华为推理、Nvidia 训练

    Nathan Lambert 猜测,在规模化强化学习上,多数中国头部 AI 实验室正开始大量用华为做推理、用 Nvidia 做训练(特殊架构可能除外)。他认为随着智能体集群和更大规模后训练成为常态,这会加速中国本土产业。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepLearning.AI 周报:OpenAI 用 1 万智能体验证 Navier-Stokes 方程,DeepSeek V4.1 Flash 发布新架构

    OpenAI 动用 10,000 个智能体证明 Navier-Stokes 方程会失效,引发关于提示词数据隐私与 AI 在数学中角色的争论。DeepSeek V4.1 Flash 则推出全新架构,面向更低成本的长上下文工作负载。上述内容来自 DeepLearning.AI 每周两次的短讯 newsletter Data Points。

  3. Founder ParkAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    YC 2026 Startup 复盘:硬件与数据公司挣钱,应用团队开始自训专用模型

    Founder Park 编译 YC 播客《The Lightcone》内容,YC CEO Garry Tan 与合伙人 Diana Hu、Jared Friedman、Harj Taggar 复盘过去 12 到 18 个月的批次数据。

  4. 快手技术AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手电商直播如何落地业界首个大规模实时字幕系统 Live Captioning Engineering

    快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。

9月19日周六
  1. Suhail(@Suhail)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DSV4.1 中的 Engram 表:压缩与缓存

    DSV4.1 的 Engram 表被评价为"超级酷",其核心思路是一切都靠压缩,之后一切都靠缓存。该帖未披露具体参数量、benchmark 分数或可用性信息。

  2. 宝玉的分享AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT 6 Astra 和 Codex 做 3D 版《桃花源记》:含完整提示词

    作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 CSBP:面向扩散 LLM 的上下文分片块并行策略

    Stanford AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,训练加速随上下文长度增长而提升。

9月18日周五
  1. SemiAnalysisAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 解读 Engram 嵌入:面向高效 DRAM/SSD 卸载的软硬件协同设计

    SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。

  2. Y Combinator(@ycombinator)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kastle 为银行打造 AI 员工,已处理超 20 亿美元交易并完成 2400 万美元 A 轮

    Kastle 正在为银行构建 AI 员工,其智能体可自动化抵押贷款服务、消费信贷等后台运营流程。目前 Kastle 已与 25 家顶级抵押贷款服务商中的 10 家合作,累计处理交易额超过 20 亿美元。该公司在参加 YC 两年后完成 2400 万美元 A 轮融资,两位创始人分享了如何让智能体可靠到足以处理真实金融交易。

  3. Qdrant(@qdrant_engine)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 四小时 Vector Space Stream 回顾:覆盖 token 原生存储到十亿级评估

    Qdrant 举办的 Vector Space Stream 直播结束,全程超过 4 小时,覆盖 token 原生存储、向量压缩、机器人、新型嵌入向量几何、双编码器、自适应混合搜索、十亿级规模评估以及计算与存储分离等主题。错过直播的观众现可在 YouTube 观看回放,并可通过 Qdrant 的 Discord 社区继续讨论。

  4. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:8 月 25% 数学预印本致谢 AI,4 月为 4%

    Epoch AI 基于 2025 年 1 月至 2026 年 8 月的全部数学 arXiv 预印本分析发现,致谢 AI 使用的论文比例从 4 月的 4% 升至 8 月的 25%。

  5. Anthropic(@AnthropicAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 与 Adaptyv Bio 合作举办蛋白质设计竞赛,验证超 5000 个设计

    Anthropic 与 Adaptyv Bio 合作举办蛋白质设计竞赛,将实验验证超过 5000 个设计。Anthropic 提供最高 100 万美元 Claude credits 及实验验证资金,Modal 出资最高 25 万美元算力,Twist Bioscience 提供 DNA。竞赛详情与报名入口分别发布于 Adaptyv 的 Proteinbase 页面和 Google 表单。

  6. Anthropic(@AnthropicAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布三项指标追踪 AI 自我开发进度

    Anthropic 公布三项用于追踪 AI 发展的指标:AI 承担了多少 AI 研发工作、AI 智能体的受监督程度、算力如何分配,并给出 Anthropic 内部的指标快照。Anthropic 表示任何前沿开发者都可发布同样的指标,第三方也可验证,以缩小前沿实验室与公众之间的信息差。

  7. LlamaIndex 🦙(@llama_index)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 谈企业 AI 智能体的文档基础设施难题

    LlamaIndex 上周参加 Connected Stack 大会,@jerryjliu0 在 Founder Flash Talks 环节指出企业智能体普遍面临的问题:通用模型难以读取杂乱复杂的文档。LlamaIndex 将自己定位为面向智能体的文档基础设施,因为智能体正在成为新的知识工作者。