Weaviate Query Agent 推出 medium / high / ultrahigh 三档 effort 参数
Weaviate 的 Query Agent Search Mode 新增 effort 参数,提供 medium、high、ultrahigh 三档,用于控制每次请求的检索投入程度。更高档位会在两处增加计算:查询编写阶段花更长时间拆解请求并转为结构化搜索,重排阶段对召回文档做更充分评估后再返回最终排序。官方建议按自身准确率、延迟和成本要求选择合适档位。
Weaviate 的 Query Agent Search Mode 新增 effort 参数,提供 medium、high、ultrahigh 三档,用于控制每次请求的检索投入程度。更高档位会在两处增加计算:查询编写阶段花更长时间拆解请求并转为结构化搜索,重排阶段对召回文档做更充分评估后再返回最终排序。官方建议按自身准确率、延迟和成本要求选择合适档位。
项目 douchat.ai 的 GitHub 仓库与官网 douchat.ai 链接已公开,并欢迎用户提交反馈、issue 与 PR。该条信息未披露模型名称、参数规模或具体功能细节。
Qdrant 发布研究预览项目 Constella,目标是在不重新嵌入全部文档的前提下更换查询嵌入模型。该方案目前以 research preview 形式公开,具体参数、基准分数与可用性细节未披露。
Elastic Cloud Serverless 于 9 月 29 日起在 Microsoft Azure 美国中部(Iowa)区域上线,Azure 区域增至 12 个,全球覆盖达 34 个区域。
作者把自己的 SEO 文章写作流程做成了一个叫 content-gate 的 skill,用于让 AI 撰写 SEO 类文章。该 skill 基于 Google Search Central 官方文档的内容质量与合规指南,配有发布前 checklist 供 AI 自查,并提供双语本地化指南——按目标语言写作而非逐句翻译。项目已开源在 GitHub,作者已用它写过一部分文章。
两条 SEO 技巧被分享:一是在 YouTube 拍 How-to 教程、产品对比、工具评测类视频,这类 video keyword 的搜索结果里 Google 常直接出视频卡,小频道视频有时能压过权威博客,种子词建议用产品真实使用场景而非硬广。
Notion 透露,ChatGPT、Claude 等 AI 工具已成为用户回答"你是如何听说 Notion 的?"时的首要来源。这一变化经历了从缓慢积累到突然加速的过程。
Querit 最新更新将自动化网页追踪引入 Dify,Querit Monitors 现已在 Dify 上线,支持设置周期性搜索、捕获新结果并追踪变化。用户可在 Dify 工作流内完成一次搜索后持续监控,用于竞品追踪、行业新闻与市场趋势研究。
PureblueAI 创始人鲁扬提出 GEO 与 SEO 是两个物种:SEO 有规则可循,GEO 是黑盒,只能用一个模型去学习另一个模型。他把 GEO 拆成漏斗与因子挖掘,类比量化交易,主张研究 AI 可解释性而非文章写法。他还提出 prompt 就是 AI 时代的货架,豆包偏爱抖音视频、海外模型偏爱官网与 Reddit,酒旅品类已按 8 到 12 个点抽佣。
Perplexity Fast Search 现已成为 Nous Portal 订阅用户在 Hermes Agent 中的默认搜索。该搜索面向智能体任务打造,单次搜索调用延迟为 p50 160 ms、p95 230 ms。
Perplexity 在 Search API 中推出 Fast Search,运行在自研的 Rust 检索与排序服务 Photon 上。官方称 95% 的搜索结果在 230ms 或更短时间内返回,p95 延迟低于 250ms,同时在相关性与准确性基准上保持较高排名。Photon 由一个小型工程团队配合数百个智能体构建,作者称后续将用自动研究循环持续在帕累托前沿上优化搜索基础设施。
Perplexity 详解其 Photon 架构:p99 响应时间从约 800 ms 降至约 65 ms,使用的服务机器减少约 20%,每个文档可存储的数据量提升 2.5 倍。该公司同步给出了 Photon 的构建方法以及 Fast Search 的接入入口,Fast Search 已可通过 API 使用。
Perplexity 的 Photon 将新索引构建与处理实时查询的服务器分离,版本就绪后逐个更新 serving group。每次更新会用真实搜索查询预热缓存并检查就绪状态,再将其重新纳入路由,其余 serving group 持续提供查询服务。
Perplexity 在 Search API 中推出 Fast Search,该功能运行在新一代 Rust 构建的检索与排序服务 Photon 上。官方称 Fast Search 能在 230 ms 或更短时间内返回 95% 的搜索结果,Photon 由一个小编队工程师与数百个智能体共同构建。
Milvus 3.0 Function Chain 重排演示展示了如何在一条检索链路内完成商品重排:BGE-M3 将查询转为嵌入向量,Milvus 执行 COSINE 向量检索召回 top 20 商品,服务端 Function Chain 计算热度、价格亲和度、新鲜度与归一化语义分,再由 XGBoost 模型融合成新的业务分数并返回重排结果。
Weaviate 1.39 正式上线 MMR 多样性选择,覆盖全部 near_* 搜索与混合搜索,无需改动 schema 或重建索引,完全在查询时运行。该机制逐个贪心挑选结果,在查询相似度与已选结果相似度之间权衡:balance=1.0 时排序仍以纯相关性为主,balance=0.5 时首页可分散到富士山、列车、猴子、拉面和鸟居等不同内容。
腾讯元宝最近上线专家模式,用户输入“帮我做旅游规划/三日游/行程安排”等关键词即可触发。该模式下交通、天气、景区、酒店信息全部来自第三方数据并支持实时联网搜索,景区卡片标注免费或门票价格,可直接跳转同程微信小程序购买。方案含真实地图轨迹、支持多轮修改和手机电脑分享,元宝同期还上线了购物功能。
得物交易搜索团队过去一年将召回从判别式检索改为生成式建模,让模型主动生成候选商品而非从商品池中找最相似的。方案覆盖基于LLM的文本索引语义增强、基于MLMM的多模态向量表征、基于HLLM的深度语义表征、基于HSTU的生成式行为序列建模及基于语义ID的统一生成式召回,并推进召粗一体架构。
Qdrant 的 KShivendu 在 Retrieval Augmented Gathering 活动上分享如何用 SPLADE 做神经搜索,且无需查询时推理,活动时间为美东时间当天下午 1 点。Doug Turnbull 推荐对 SPLADE 和神经搜索感兴趣的人关注。
a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。
Qdrant 在五个公开数据集上实验了向量检索的候选深度:若最终只要 5 条结果,先召回 100 个候选能给重排序或融合阶段更多素材。把 limit 从 10 提到 500,最优可能的 nDCG@10 最多提升 0.28,但实际得分变化不超过 0.01——有时文档已被召回,只是排名不够高。
Lucy 基于 Qdrant 为超 280 万份 SEC 与 DART 监管文件构建检索层,混合检索加 RRF 后 FinanceBench Recall@5 达 93.4%、Recall@10 达 94.7%。
Richard Socher 在 Latent.Space 播客中讨论了 AI 安全、对齐、奖励黑客、开源 AI 等话题,以及他创办 Recursive 的原因。他介绍了 Recursive 的 Eureka Machine、10 Spaces of Intelligence 等概念,并探讨递归自我改进、AI 自主设定目标、AI 同行评审为何失灵等问题。
一家覆盖 100+ 国家、服务数亿听众的音乐流媒体平台用自托管 Milvus 搭建了音频与歌词的统一检索层,将 1 亿+曲目编码为数十亿向量,实现每秒数百次查询下约 10ms 的 P99 数据库检索延迟。该基础设施同时支撑歌曲识别、歌词搜索、推荐和版权匹配,支持播放短片段、哼唱旋律或输入模糊歌词等检索方式,并通过地域与版权过滤结合语义与全文搜索。
Elastic 宣布 Elastic Cloud Serverless 跨项目搜索(CPS)正式 GA,用户可在多个 serverless 项目间执行单条查询,覆盖所有区域、项目类型与云厂商,数据原地查询、无需迁移。
Perplexity 推出 CobbleDB,这是一款专为重复批量读取 prepared page records 打造的数据库,用于优化其搜索负载的性能与成本。Perplexity 计划将 CobbleDB 开源,供其他构建 AI 搜索的团队使用。
Satyam Sahu 用 Qdrant 对 10 家科技公司的 47 份 SEC 文件做了混合检索实验,对比 dense embeddings、BM25 与 SPLADE 三种方式在金融搜索中的表现,考察各自适用的场景与短板。金融检索同时要求语义理解和精确匹配,因此混合搜索成为关注方向。
Fireworks AI 帮助 Juicebox 用定制专用模型,把数十万份人才档案的实时搜索延迟降低 80%,推理成本从每年 400 万美元降至 80 万美元。Juicebox 需要多个实时搜索智能体在数秒内完成检索。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。
Q2D-Web 采用三套相关性集合:agent 引用、生产环境网页排名,以及用 LLM 判断扩充的合并集合。这三套集合旨在降低漏判、减少对单一标注流程的依赖,同时测试相关性定义如何影响模型表现。
Perplexity 披露其检索语料构建方式:每个查询取 top 5,000 条生产检索结果,用 MinHash-LSH 去重。每篇文档至少与一个查询构成看似合理的匹配,其中包含主题相关但缺少所需日期、实体或版本的困难干扰项。
Q2D-Web 数据集来自 23,000 条无 PII 的生产搜索,覆盖十种语言、数十个领域,历时九个月收集。其中 Agent 将用户请求改写为主查询与支持查询,每条查询独立评估并各自给出相关性判断。
Perplexity 推出 Q2D-Web(Query2Doc-Web),用于评测 agentic RAG 系统检索能力的基准和公开榜单。该基准测试嵌入模型在使用 AI 智能体重写搜索查询时,在大规模网页搜索上的表现。
Google DeepMind 发布 AlphaGenome Atlas,一个由 AI 驱动的可搜索数据库,用于映射全部 90 亿种可能单字母 DNA 变化的预测影响。官方表示,它有望帮助研究人员更好地理解生物机制。
Weaviate《Building Foundry》最后一集演示如何在不移动或重命名原文件的前提下,为创意素材库搭建可搜索层,结合描述、标签、提取文本与元数据补充上下文。该搜索层支持关键词、语义与混合搜索,搜索“white rabbit in a grassy landscape”可同时召回参考图、预告片片段及相关景观素材,即使文件名完全不含这些词。
Qdrant 在五个公开数据集上测试了向量检索的调参策略,发现该调哪个参数取决于问题出在哪里。将候选深度从 10 提升到 500,最佳可达分数最多提高 0.28,但最终分数提升至多只有 0.01,因为相关文档已被召回、只是排名不够高。Qdrant 因此建议先定位失败环节,再调整与之对应的 `hnsw_ef`、候选深度、RRF `k`、量化或重排序等参数,而非反复试参数。
Latent.Space 发布 Frontier AEO 追踪器项目,用于分析 Astra 优先关注什么、使用哪些来源,以及从 Sol 到 Astra、从 Opus 到 Fable 发生了哪些变化。相关答案已收录在 latent.space/p/aeo。
Qdrant 发布 1.19.1 补丁版本,量化 HNSW 搜索速度提升约 1.5–2.5 倍,payload 密集的 shard 迁移提速 1.5 倍。该版本还改进了 TurboQuant SIMD 打分、批量 HNSW 搜索与删除检查等。
ChatGPT 官方账号称 GPT-6 Astra 在六项能力上达到 state-of-the-art,分别是电脑操作、浏览、智能体编码、网络安全、科学和专业工作。该推文未给出具体的评测基准名称、分数或模型开放时间。