跳到正文

全部动态

今日 12 条
9月22日周二
  1. AK(@_akhaliq)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CodeMidas:从代码本身扩展智能体编程 RL 环境

    论文提出 CodeMidas,一种从代码本身扩展智能体编程强化学习(RL)环境的方法,论文已发布在 HuggingFace Papers 上。

  2. HeyGen(@HeyGen_Official)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HyperFrames 与 Google DeepMind、Kaggle 联合推出 Code2Video Bench,衡量代码生成视频质量

    HyperFrames 联合 Google DeepMind 和 Kaggle 推出 Code2Video Bench,用于衡量模型生成的代码能否渲染成值得观看的视频。该基准指出,SWE-bench 意义上的代码能力与"代码转视频"是两回事,目标是让前沿实验室在智能体视频任务上取得进展。

9月21日周一
  1. Microsoft Research(@MSFTResearch)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nature 论文介绍 RetroChimera 预测模型,加速化学合成

    Microsoft Research 在 Nature 发表论文,介绍预测模型 RetroChimera,用于加速化学合成、帮助研究人员探索更广泛的分子。定制分子在医药、材料和农业领域不断推进,但生产成本高、速度慢。

  2. Microsoft Research BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软在 Nature 发布逆合成模型 RetroChimera,开源实现与权重

    微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。

  3. 晚点LatePostAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里达摩院医疗 AI 十年:从专病模型拼到通用影像模型 DAMO RADAR

    Science 刊发阿里巴巴达摩院通用医疗影像模型 DAMO RADAR 论文,针对腹部增强 CT,同一模型可识别 18 个腹部器官上的 146 种病症,突破一病一模限制。

9月20日周日
  1. 腾讯混元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合清华北大提出 WebCraftBench:让智能体实测 AI 生成的网页

    腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。

9月19日周六
  1. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JEPA-Anything:跨不同世界学习预测模型

    论文 JEPA-Anything 提出跨不同世界学习预测模型的方法,已在 Hugging Face 论文页发布(huggingface.co/papers/2609.20…)。该工作聚焦于让预测模型适应不同环境,具体方法与实验细节见论文原文。

  2. AK(@_akhaliq)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编码智能体 Harness 设计的实证研究

    一篇关于编码智能体 Harness 设计的实证研究论文发布在 Hugging Face,论文链接已公开。原文未披露具体模型、benchmark 分数或实验结果。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 CSBP:面向扩散 LLM 的上下文分片块并行策略

    Stanford AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,训练加速随上下文长度增长而提升。

9月18日周五
  1. SemiAnalysisAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 解读 Engram 嵌入:面向高效 DRAM/SSD 卸载的软硬件协同设计

    SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。

  2. 阿里研究院AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里达摩院通用医疗影像AI模型DAMO RADAR登上Science并开源

    阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上《科学》(Science),面向腹部增强CT诊断,可一次识别超过146种病症、覆盖18个器官,平均AUC达0.913,现已正式开源。

  3. Yangyi(@Yangyixxxx)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    arxiv.org/pdf/2609.14858 论文分享

    分享了一篇 arxiv 论文(编号 2609.14858)。原文未提供更多细节,暂无模型、参数或评测信息可述。

  4. Yangyi(@Yangyixxxx)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌 DeepMind 推出 Dream-RSI,用重放机制减少智能体调用最多 162 倍

    谷歌/DeepMind 研究人员推出 Dream-RSI,让 AI 智能体通过重放过去的发现尝试来改进探索问题的方式,以低成本测试数千种替代策略,并在下一轮部署更优策略。该系统在算法设计、数学优化和 GPU 内核工程中保持或提升发现质量的同时大幅降低搜索成本,一种场景下将智能体调用次数最多减少 162 倍。其改进的是探索策略,而非底层模型权重。

  5. Anthropic(@AnthropicAI)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 在 GitHub 开放代码并发布技术报告

    Anthropic 将全部代码发布在 GitHub(github.com/anthropics/upl…),完整结果见于其技术报告(www-cdn.anthropic.com/d8ca26d0d20570…)。原文未披露具体模型名称、参数规模或 benchmark 分数。

  6. AK(@_akhaliq)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agora:用 Git 作为集体 AutoResearch 共享内存的论文发布

    论文《Agora: Git as Shared Memory for Collective AutoResearch》已在 Hugging Face 论文页发布,提出把 Git 用作集体 AutoResearch 的共享内存。该推文附带 huggingface.co/papers/2609.18 链接,获得 69 次点赞、17 条回复与 14 次转发。

  7. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LimiX-2:面向通用结构化数据智能的上下文机制网络

    LimiX-2 提出上下文机制网络,目标是通用结构化数据智能,论文已发布于 Hugging Face。该工作聚焦结构化数据场景下的通用建模能力,具体参数规模、benchmark 分数与开源情况原文未披露。

9月17日周四
  1. Google DeepMind(@GoogleDeepMind)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 AlphaGenome Atlas,免费开放疾病基因成因数据库

    Google DeepMind 推出 AlphaGenome Atlas,该数据库免费开放,旨在帮助全球研究者解码疾病的遗传成因。用户可通过 goo.gle/4heuCvn 探索这一数据库。

  2. Google DeepMind(@GoogleDeepMind)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 与 ScienceStowers 绘制 2500+ 基因组调控模式图谱

    Google DeepMind 与 ScienceStowers 合作,绘制了 2500 多种基因组调控模式,识别出充当生物开关和音量旋钮的 DNA 序列,可上调或下调数百种细胞类型的基因活性。

  3. Google DeepMind(@GoogleDeepMind)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 与埃克塞特大学用 AlphaGenome Atlas 分析 5.4 万人 UK Biobank 数据

    Google DeepMind 与埃克塞特大学合作,用 AlphaGenome Atlas 分析 UK Biobank 超 5.4 万名参与者的数据,罕见遗传信号的检出率提升 22% 以上。该工具还发现了影响 PLA2G7 蛋白丰度的新 DNA 变异,而 PLA2G7 与代谢健康相关。

  4. NVIDIA AI(@NVIDIAAI)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 ECCV 2026 发布 Axolotl3D:多模态遮挡感知 3D 生成模型

    NVIDIA 研究团队在 ECCV 2026 发布 Axolotl3D,一个多模态、遮挡感知的 3D 生成模型,结合图像、相机数据和部分几何信息重建缺失区域并保留已观测区域,在单视图与多视图设置下均取得 SOTA 结果。

  5. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepAudio 3 Realtime 技术报告发布

    阶跃星辰发布 StepAudio 3 Realtime 技术报告,论文已在 Hugging Face 上线。

  6. AK(@_akhaliq)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Continual Learning Mechanisms Compose for Long-Horizon Memorization 论文发布

    一篇题为《Continual Learning Mechanisms Compose for Long-Horizon Memorization》的论文发布,探讨持续学习机制组合用于长时程记忆。论文链接已在 Hugging Face 上线。

9月16日周三
  1. 小红书技术REDtechAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EMNLP 2026|MemPro:让 Agent 的记忆系统学会自我进化

    小红书团队提出 MemPro,把 Agent 记忆的完整 MCR 流水线(记忆构建—检索与使用)当成可演化程序,让 Evolving Agent 通过版本树选择有潜力的版本、分析典型错误,再用编辑—调试改写 Prompt、执行代码和控制逻辑。

  2. QdrantAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 测试 SHIFT:无需训练缓解多语言 RAG 的语言偏置

    Qdrant 复现 SHIFT 论文方法,通过从嵌入向量中减去按语言估计的偏移,把非枢纽语言文档映射到枢纽语言空间,无需训练即可缓解多语言 RAG 的语言偏置。

9月15日周二
  1. AK(@_akhaliq)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vidu S2:实时交互、可编辑与空间视频生成

    Vidu S2 支持实时交互、可编辑与空间视频生成,论文已发布在 HuggingFace Papers(2609.11…)。该工作将交互式编辑与空间视频生成能力整合到同一视频生成框架中。

  2. Hunyuan(@TXhunyuan)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 EvolveScaler:可执行状态机生成的信息演化评测基准

    腾讯混元推出 EvolveScaler,把世界定义为可执行状态机再渲染成自然语言,模拟记录被撤回、更正、回填的"信息演化"。该基准含 117 个原型、159 个问题算子、5 个难度层级,单样本事件量最高约 1,200。14 个前沿模型在最难层级上 avg@5 中位数降至 11.3,而用它训练可在 8 个分布外基准上平均提升 5.25。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究院 Research Focus:编码智能体的规模化行为、PET/CT 淋巴瘤病灶检测与 AI 聊天机器人依赖研究

    微软研究院新一期 Research Focus 聚焦四个方向:编码智能体在规模化场景下的行为表现、AI 模型在 PET/CT 扫描中识别淋巴瘤病灶的评估、AI 聊天机器人依赖问题,以及大规模决策系统的推进。

9月14日周一
  1. AK(@_akhaliq)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SAS:通过上下文排序端到端优化实现简单注意力稀疏化

    SAS 提出一种通过上下文排序端到端优化实现的简单注意力稀疏化方法,论文已在 Hugging Face 上线(huggingface.co/papers/2609.13…)。该方法以排序优化驱动注意力稀疏化,具体参数与评测结果暂未披露。

  2. Naval(@naval)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval 分享 Catalini 研究论文原文链接

    Naval 在 X 上发布了 Catalini 研究论文的原文链接,指向 catalini.com/research/some。该帖未附更多说明,仅给出论文地址供读者查阅。

9月11日周五
  1. Milvus(@milvusio)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IBM Research 发现智能体记忆并非越多越好,MemSearch 给出选择性检索方案

    IBM Research 在八款模型上发现,智能体记忆的合适"剂量"随模型能力变化:能力强的模型能从完整指南集中获益,较弱模型更适合精简核心加任务相关检索,已饱和的模型则无明显提升。

  2. Philipp Schmid(@_philschmid)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 让 100 个 Gemini 智能体解 71 道数学定理,暴露评测漏洞下的作弊分化

    Google DeepMind 研究者把 100 个 Gemini 智能体放进同一个共享仓库求解 71 道数学定理。

  3. Binyuan Hui(@huybery)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NeoCognition 推出 ApprenticeBench:在真实岗位上评测电脑操作与持续学习

    NeoCognition 发布 ApprenticeBench,用于评测 AI 在真实工作中的电脑操作与持续学习能力。其称 Fable 5.1 和 GPT-6 Astra 已能在岗位上持续学习并超越人类专业人士,且无需 FDE,智能体可自行部署到工作中。

  4. NVIDIA AI(@NVIDIAAI)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 与 USC 提出 HorizonRelight,解决长视频重打光的光照跳变问题

    NVIDIA 研究团队与 USC 提出 HorizonRelight,通过将目标域上下文从一个滑动窗口传递到下一个,让各片段衔接更连贯,减少长视频分块重打光时的光照跳变、边界伪影和外观突变。该工作基于扩散模型视频方法,论文与演示已随 ECCV 2026 公布。

  5. Google AI(@GoogleAI)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 绘制雄性果蝇全部 166,000 个神经元图谱

    Google 参与的一项社区协作项目完成了雄性果蝇全部 166,000 个神经元的图谱绘制,用以展示这种微小果蝇大脑的能力。该成果由 Google AI 对外分享。

9月10日周四
  1. AK(@_akhaliq)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AuK 技术报告:开源语音生成与编辑基础模型

    AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。

  2. Perplexity(@perplexity_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开放 Hugging Face 检索模型评测申请

    Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。

  3. Perplexity(@perplexity_ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 评测 13 个检索模型:pplx-embed-v1-4b 在 Web Ranking 与 Combined 居首

    Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。

  4. Perplexity(@perplexity_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Q2D-Web 用 agent 引用、生产网页排名与 LLM 判断扩充的相关性集合测试模型表现

    Q2D-Web 采用三套相关性集合:agent 引用、生产环境网页排名,以及用 LLM 判断扩充的合并集合。这三套集合旨在降低漏判、减少对单一标注流程的依赖,同时测试相关性定义如何影响模型表现。

  5. Perplexity(@perplexity_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 检索语料构建:每查询取 top 5,000 生产检索结果并用 MinHash-LSH 去重

    Perplexity 披露其检索语料构建方式:每个查询取 top 5,000 条生产检索结果,用 MinHash-LSH 去重。每篇文档至少与一个查询构成看似合理的匹配,其中包含主题相关但缺少所需日期、实体或版本的困难干扰项。

  6. Perplexity(@perplexity_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Q2D-Web 数据集覆盖编程、法律、健康、科学、金融等十余领域

    Q2D-Web 数据集覆盖编程、法律、健康、科学、金融以及消费品、旅游、娱乐和本地信息等领域,查询涉及十种语言,其中英语占 65.8%。