DeepLearning.AI 发布智能体研究模型与框架 AREX
DeepLearning.AI 发布智能体研究模型与配套框架 AREX,它会逐条要求核验答案,保留已验证部分,只针对缺口继续研究。AREX 在 BrowseComp 上取得 82.5%,在 WideSearch-en 上 F1 为 82.0;仅使用该框架最多可提升 10 分,微调后的 4B 模型在 6 项基准中的 5 项上优于未微调的 35B 模型。
DeepLearning.AI 发布智能体研究模型与配套框架 AREX,它会逐条要求核验答案,保留已验证部分,只针对缺口继续研究。AREX 在 BrowseComp 上取得 82.5%,在 WideSearch-en 上 F1 为 82.0;仅使用该框架最多可提升 10 分,微调后的 4B 模型在 6 项基准中的 5 项上优于未微调的 35B 模型。
在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。
Perplexity 发布 pplx-embed-v2-late,包含两个 late-interaction 嵌入模型,可在共享嵌入空间中检索文本、图像和页面,支持跨模态查询。两个模型均达到前沿性能,并已在 Hugging Face 公开提供。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
ChatGPT 官方账号称 GPT-6 Astra 在六项能力上达到 state-of-the-art,分别是电脑操作、浏览、智能体编码、网络安全、科学和专业工作。该推文未给出具体的评测基准名称、分数或模型开放时间。
Jina AI 发布 jina-reranker-v3.5,这是一个 0.6B 的列表式重排序模型,改进了 v3 的交互方式,速度更快,并针对企业搜索数据做了优化。它在 BEIR 上取得 63.20 nDCG@10,以约 7 倍更少的参数超过 Qwen3-Reranker-4B。
DeepSeek 在 V3.1 基础上发布 DeepSeek-V3.1-Terminus,针对用户反馈做出改进。此次更新提升语言一致性,减少中英文混杂与随机字符;同时增强 Code Agent 和 Search Agent 表现。