Perplexity 介绍 Photon:p99 响应时间从约 800 ms 降至约 65 ms
Perplexity 详解其 Photon 架构:p99 响应时间从约 800 ms 降至约 65 ms,使用的服务机器减少约 20%,每个文档可存储的数据量提升 2.5 倍。该公司同步给出了 Photon 的构建方法以及 Fast Search 的接入入口,Fast Search 已可通过 API 使用。
Perplexity 详解其 Photon 架构:p99 响应时间从约 800 ms 降至约 65 ms,使用的服务机器减少约 20%,每个文档可存储的数据量提升 2.5 倍。该公司同步给出了 Photon 的构建方法以及 Fast Search 的接入入口,Fast Search 已可通过 API 使用。
Perplexity 的 Photon 将新索引构建与处理实时查询的服务器分离,版本就绪后逐个更新 serving group。每次更新会用真实搜索查询预热缓存并检查就绪状态,再将其重新纳入路由,其余 serving group 持续提供查询服务。
Perplexity 在 Search API 中推出 Fast Search,底层是全新 Rust 检索与排名服务 Photon,由小规模工程团队加数百个智能体构建。官方称其 95% 的搜索结果可在 230 ms 内返回。
LangChain 发布 LangSmith Engine v2,新增 Red Teaming 主动排查工具,通过分析智能体的生产 traces 和仓库来测试幻觉、违反 system prompt 等尚未在生产暴露的问题,目前向现有 LangSmith Deployment 用户开放 Private Beta。
在 WeAreDevelopers North America 主题演讲中,Docker 总裁 Mark Cavage 发布面向 AI 智能体的 Docker Sandboxes,为每个智能体提供独立隔离的 microVM 与内核,并通过独立 CLI 免费提供。
Grafana Labs 把可靠性工程中的错误预算(error budget)用于 AI 智能体质量,通过 evaluations 让模型裁判对 groundedness、fulfillment、toxicity、latency、cost 等行为分别打分,再把分数变成带目标的 SLO,例如设定 30 天内 95% 的对话被判定为 fulfilled。
Runway 为 Seedance 2.5 上线 Draft 模式,可在探索阶段以更快速度、更少积分生成内容,再将满意的结果提升至完整质量。目前该模式已可通过官方链接开始使用。
Bridgewater 应用 AI 团队负责人 Sam Green 将在 AI Engineer New York 带来演讲“Vault: When Fifty Years of Structured Data Isn't Enough”,介绍 Bridgewater 如何构建共享非结构化数据平台,为投资研究与生产环境中的 AI 智能体提供支撑。会议于 10 月 12–14 日举行。
Docker 发布 Sandbox Kit 规范 v3,采用 Apache 2.0 开源在 docker/sandbox-kit-spec 仓库。
Docker 发布 Cloud Sandboxes,将原有的 microVM 沙盒放到 Docker 托管算力上运行,本地与云端共用同一套隔离模型和 CLI,可用 `sbx move my-project --to cloud` 双向迁移。
LangSmith 上线 Trajectories,把一条 thread 内主智能体与子智能体的消息、工具调用按首次出现顺序聚合,去掉嵌套 run 结构,让长会话以对话路径形式可读。
Milvus 3.0 Function Chain 重排演示展示了如何在一条检索链路内完成商品重排:BGE-M3 将查询转为嵌入向量,Milvus 执行 COSINE 向量检索召回 top 20 商品,服务端 Function Chain 计算热度、价格亲和度、新鲜度与归一化语义分,再由 XGBoost 模型融合成新的业务分数并返回重排结果。
Recraft V4.1 Flash 现可通过 OpenRouter 调用,官方称其为市面上最快的图像模型,每张图生成耗时 1.3 秒,价格 $0.007/image。该模型延续 Recraft 在摄影、人像、复杂场景、logo 和早期概念上的表现,面向高并发生成与快速迭代场景。
Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。
Bridgewater Associates 产品工程负责人 Aaron Linsky 将在 AI Engineer New York 带来演讲《Can Your AI Analyst Keep a Secret?》,深入生产级 AI 分析师的检索层,讲解 Bridgewater 与 turbopuffer 如何在数百万份机密文档上实施动态的行级权限控制。大会时间为 10 月 12–14 日。
沈亚楠创立具身公司恩戈罗(NGORO),第一款机器人放弃双足和拟人造型,用轮式底盘、最小转弯半径 30cm,第一批产品做洗衣、房屋清洁、物品归位与递送,2027 年将作为栖息地智能住宅标配交付真实用户,首批约 2000 台。他判断家庭是最接近通用也最难的场景,恩戈罗要借栖息地的半结构化住宅与仿真、真机数据先启动数据飞轮。
曦望Sunrise联席CEO王湛在2026网易未来大会上提出,AI产业的损益表正在被Token重写,Token价格直接决定智能经济规模。他援引国家数据局数据称国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿,并判断算力结构性缺口大概率延续到2028年。曦望为此推出专为推理设计的启望S3 GPU,单卡性能为上一代5倍,单Token成本降低90%。
tinyjs 能用不到 10MB 的体积构建 JavaScript 桌面应用,内置 txiki.js 驱动的后端,可访问包括 FFI 在内的完整系统能力,配合原生 WebView 渲染,支持打包到 macOS、Linux 和 Windows。
京东海博团队把大模型“读不懂业务全貌”重新定义为“经营好上下文”,采用 OKF 规范将知识编译从运行时前移到维护期,构建项目知识×领域知识矩阵、角色化知识层与 Skill 能力层三层结构,并用 AB 实验验证带知识库“更快更全”。以 40w 行代码的 yzt-erp-wms 仓库为例,共沉淀约 1051 篇知识文档,其中 flows/ 接口与流程 1001 篇、chains/ 业务链路 41 篇。
华为数字能源首次公布源网荷储AIDC解决方案,围绕“3+1”创新重构,目标是让每一瓦特产出更多Token。方案包括MIMO供电架构、泰山UPS(单柜1280kVA、双变换效率最高98%)、恒山直流UPS(支持270V/400V/800V)和SmartLi 5.0、LUNA2000多层混合储能。商汤项目采用工厂预制与室外部署,45天完成18MW供配电系统全流程交付。
高通在2026骁龙峰会上发布第六代骁龙8超级至尊版和第六代骁龙8至尊版,首次将2nm工艺用于旗舰移动平台,两者搭载最高5GHz的Oryon CPU和重新设计的Hexagon NPU,超级至尊版还在Adreno GPU中首次加入Matrix Cores并支持8K/60fps视频拍摄。
Dify 高级开发者关系郑立撰文披露其插件生态的安全与治理机制:截至 2026 年 8 月 25 日,Marketplace 共列出 928 个插件、907 个带有安装记录、263 个官方标注条目,官方称维护基线为 99 个主动维护插件。
Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。
在云栖大会阿里巴巴 AI Native 研发实践论坛上,阿里、蚂蚁、飞猪等团队披露:编码仅占软件交付总时长 20%—30%,极端链路中编码不足 1%、约 1 小时,但需求到交付仍需约 21 天,时间耗在影响分析、环境准备、联调、审批、灰度和封网等环节。
Douchat 接入 Jev,把群聊里的多个 Agent 从"轮流回复消息"改为"围绕一个任务协作",由 Jev 做结构化判断、LLM 负责规划和执行、程序负责调度与状态记录。
Kaivid Labs 团队将 40 万+文档向量从 Milvus 迁移到 Qdrant,并记录了整个过程。他们说明了迁移的处理方式、验证数据完整性,并对比了两套系统在延迟、吞吐量和内存占用上的表现。完整记录已发布在 kaivid.com 博客。
阿里云在云栖大会发布磐久AL64分布式SNPO光互连超节点,将光互连推进到XPU附近,其SNPO支持3.2T、6.4T,带宽密度比现有OIF规范提升约25%。曦智科技同期首次展示面向XPU Scale-Up的SNPO产品——3.2T/6.4T收发一体硅光芯片。据美银估算,AI光连接市场将从2025年约140亿美元增长到2030年约730亿美元。
腾讯元宝最近上线专家模式,用户输入“帮我做旅游规划/三日游/行程安排”等关键词即可触发。该模式下交通、天气、景区、酒店信息全部来自第三方数据并支持实时联网搜索,景区卡片标注免费或门票价格,可直接跳转同程微信小程序购买。方案含真实地图轨迹、支持多轮修改和手机电脑分享,元宝同期还上线了购物功能。
开源库 OpenSEO 近日获得大量推荐,GitHub stars 已达 2 万,并对 agent 友好,号称可替代 Semrush 和 Ahrefs。发帖者询问实际用过的用户:效果真的不错,还是只是 hype?
阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。
国内光互连初创公司芯光界成立不足5个月已完成五轮融资,累计融资额超10亿元,第六轮融资近期启动,完成后将暂缓融资直至产品量产。芯光界正推进一款面向国内GPU和交换机龙头企业的3.2T NPO光引擎量产,双方联合研发,预计最迟于2027年年中进入量产阶段。其NPO设计预留速率升级空间,可在一个月内从3.2T切换至6.4T。
英伟达CEO黄仁勋在最新访谈中称AI危言耸听已走得太远,将当前AI浪潮视为一场新的工业革命,提出能源芯片、AI工厂、模型、应用、社会影响构成的"五层蛋糕"架构。他反驳AI终结就业的"有害神话",认为安全、对齐和沙盒化都是可通过工程手段解决的问题,产品不安全就不应发布,并强调世界既需要闭源也需要开源模型,以便各国和企业掌控自己的基础设施。
Klaviyo 在 Vercel 上搭建内部应用平台,向全员开放后头两周就有 512 名员工部署了 356 个应用,其中 196 个是带独立数据库的全栈应用。应用默认 SSO 门控且私有,员工从想法到上线不超过 3 分钟;Klaviyo 还自建 K:Forge 流水线,借助 Secure Compute 让应用直连自有数据库而不经公网。
腾讯混元在线上 LLM 强化学习场景下重新审视经典临界批次规模理论,覆盖 GRPO 与 PPO 两类算法。研究发现,重新调整学习率可在一定批次规模范围内保持每个回复的学习效果;在固定硬件上扩大批次规模可使 PPO 生成阶段吞吐最高提升 2.29×,其测得的最佳 GRPO 配置完成同一验证目标所需时间减少 29%。
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。
TypeSafe AI 于 2026 年 9 月 15 日发布 JEV 并获 4000 万美元种子轮(DCVC 领投),该模型不生成文本,只按预先定义的问题类型返回是否概率、枚举选择或量表分值,输入定价 $0.042/百万 token、输出免费。
有一批新创公司正聚焦本地 AI、主权 AI 和 GPU 囤积,andrew chen 对此表示认同,并祝贺 Zain Javaid 与 ghostai 团队。
Modal 发布面向 AI-SQL 的推理引擎 Quail,将 SQL 查询规划与推理执行联合优化,在单条多表连接查询上达到每 H100 GPU 每分钟处理超 10 亿 token,比同硬件的 vLLM 基线快 10 倍以上。
Vercel Connect 现已支持 TanStack AI,用 TanStack AI 构建的智能体可调用受 OAuth 保护的 MCP 服务器,无需自行存储或轮换凭证。