Weaviate 1.38 发布:HFresh 与 MCP Server 正式 GA
Weaviate 1.38 发布,磁盘向量索引 HFresh 与 MCP Server 两大能力正式 GA,前者面向十亿级频繁变动数据,低内存、延迟可预测且无需周期性全量重建,后者可让 LLM、IDE 和 AI 智能体直连 Weaviate;1.38 还支持运行时开关 MCP Server 及写权限,无需重启。
Weaviate 1.38 发布,磁盘向量索引 HFresh 与 MCP Server 两大能力正式 GA,前者面向十亿级频繁变动数据,低内存、延迟可预测且无需周期性全量重建,后者可让 LLM、IDE 和 AI 智能体直连 Weaviate;1.38 还支持运行时开关 MCP Server 及写权限,无需重启。
Modal 发布面向 HTTP、WebSocket 和 gRPC 流量的 Servers,通过区域化自动扩缩容的 HTTP 服务器副本池和反向代理路由,将 p50 延迟从 39ms 降至 6ms。该方案走轻量低延迟路径,副本不可用时客户端会收到 503,排队与降载交由容器应用处理,适合 LLM 推理等毫秒级场景。
Runlayer 宣布从 Felicis 和 Khosla Ventures 融资 3000 万美元,帮助企业在 AI 上全面投入。该平台将 AI 的赋能、安全与控制整合于一体,为团队提供合适的 AI 工具。
乱翻书本期圆桌邀请庄明浩、RWKV 元始智能联合创始人罗璇,与主播潘乱讨论 AI 时代个人工作台为何可能重回手机:Agent 变强后 APP 是否退居幕后、端侧 AI 与云端 AI 的分工,以及折叠屏加 AI 能否接住工作流。
讯飞星辰 MaaS 平台的 Qwen3.6-35B-A3B 和 Qwen3.5-35B-A3B 模型正在限时免费、不限量调用,均支持图片与文本输入及 128K 上下文,活动截至 6 月 30 日。用户三步即可领取 API Key,可接入 Claude Code、cc-switch,或配置到 dbx、Horizon 等开源项目中使用。
Epoch AI 抓取 DeepSeek、MiniMax、Moonshot、Z.ai、字节跳动和阿里六家中国 AI 公司的 1600 多份招聘信息,发现其推理仍依赖 Nvidia CUDA 与 TensorRT-LLM,同时探索昇腾、寒武纪等国产芯片,Z.ai 称今年初已用国产芯片端到端训练出 160 亿参数的 GLM-Image。
Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。
Qdrant 于 6 月 11 日在旧金山 The Midway 举办首届美国 Vector Space Day,350 余名开发者参会,设 Agent 与记忆、搜索与检索、边缘与机器人三个分轨。
Qdrant 提出用廉价信号在检索路径上提前识别弱检索,避免为每个查询都调用 LLM 判断。这些信号读取检索器已返回的结果,至多增加一次复用查询向量的 Qdrant 查询,包括 max_score、dense_variance、evidence_coverage、retriever_divergence 和 dense_agreement 等。
MongoDB 提出一套从 POC 走向生产的 Agentic AI 四步信任框架,涵盖基础层、验证层、治理层等环节。框架以客户退款为例,用 RAG 和运行数据减少模型幻觉,并将可观测性作为"黑匣子记录仪"记录每一步推理、工具调用与 token 开销。验证层引入 Agent 置信度分数(ACS)与业务风险分数(BRS),治理层则用 ADS = ACS x (1 - BRS) 决定智能体的自主程度。
Mistral 发布 OCR 4,其 API 与 Mistral AI Studio 中的 Document AI 即日起可用,并已登陆 Amazon SageMaker 和 Microsoft Foundry。Snowflake Parse Document 支持即将推出,同时支持单容器自托管,文档无需离开本地环境。
Modal 推出 Auto Endpoints,一条命令即可部署兼容 OpenAI API 的生产级 LLM 推理服务,代码、指标和部署过程对用户可见可控。该服务支持 GLM 5.2 等开放模型,默认给出经调优的推理配置,并提供 TTFT、ITL、投机解码接受长度等引擎级指标及自动扩缩容。Modal 同时为超低延迟路由推出 Modal Servers,称 HTTP 请求开销可低至 5ms。
Skywork 现已支持通过 Discord、LINE 或 Lark 派发任务,并附有一段演示视频,展示如何连接这些 IM 平台。
Modal 指出多数沙箱基准只测容器调度与启动的 time to interactive,但生产环境中复制 repo、安装依赖等应用层初始化才占用户等待的大头。
Augment Code 提出把代码审查前移到设计阶段:人工先审设计,Code Review 专家随后在数分钟内读完完整 diff 并核对是否偏离已批准的设计。由于不再由人逐行阅读,实现规模不再是限制,工作单元也从 PR 变成整个项目,一个智能体即可独立把项目从已批准设计推进到合并代码。
Modal 与 Z Lab 合作训练并在 Hugging Face 发布 Qwen 3.5/3.6 系列 DFlash 推测解码模型,包括 4B、9B、27B、35B-A3B、122B-A10B 及 Qwen 3.6 35B-A3B 等版本。
吴恩达推出新课,教你用 VocalBridge 为 AI 智能体与应用添加语音,兼顾可靠性与速度。课程包含三类应用:语音命令与鼠标点击共用单通道的语音互动游戏、约 10 行代码就能为现有智能体加语音且不改动提示词或工具、以及用 make_phone_call 函数发起外呼电话的智能体。课程还教授外呼与实时转录、语音评估打分与回归检测。
Weaviate 针对向量数据库试点常在数据导入阶段就失败的问题,给出几条最佳实践:服务端 collection.batch.stream 自动设定导入速率,无需调 batch size;用确定性 UUID 实现幂等重试,避免重复写入和重复计费;blobHash 只保留对象嵌入向量、丢弃已另存的大对象,可从 10 TB 降到几 GB 且搜索质量不变。
Jim Fan 披露 ENPIRE 物理 AutoResearch 的幕后设计,需 8 台机器人可无人值守整夜运行。系统内置两层安全机制:硬性运动学限制在机器人越界时立即判定任务失败并自动重置,扭矩限制柔性夹爪则在接触失误时安全停转;同时定义机器人利用率、Token 利用率等遥测指标供 ENPIRE 实时感知资源。
B站搜索团队提出特征选择算法LeAP,将离散的特征打乱转化为端到端可学习的门控网络,并引入基于特征打散差异的自适应梯度去偏正则。该算法已被ECML-PKDD 2026录用,在Criteo、Avazu、ML-1M、AliCCP等公开数据集上达到SOTA水平。
Google DeepMind 联手英国政府、Google Cloud 与 Faculty,在 Barnet、Camden、Dorset 三地试点一款基于 Gemini 的 AI 规划原型工具,目标是把住户规划申请的处理时间削减 50%。
NVIDIA 的 Jim Fan 宣布推出 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和 token 预算,让它们自主探索并直接在硬件上学习、读论文和反复尝试。
Weaviate 在 Playground 上线了报纸主题演示 Weaviate Chronicles,把每 2 小时涌入的新闻标题自动聚类成同一事件。该演示先将报道嵌入为向量,再结合混合语义搜索、字符 n-gram 相似度和 Leiden 社区检测(一种图算法)完成聚类,并附带可复制提示词让用户搭建自己的版本。Weaviate Cloud 同时推出免费永久套餐。
高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。
智元机器人合伙人姚卯青在访谈中表示,2026年具身智能连GPT-1阶段都未达到,真机数据量与支撑基座模型涌现所需规模相差四五个数量级。智元已将核心数据资产剥离,独立孵化一站式物理AI数据服务平台"觅蜂",对标具身版Scale AI,姚卯青兼任其董事长兼CEO。他预计2027到2028年行业有望达到1亿小时级数据规模,届时才可能出现真正的涌现能力。
Qdrant 发布 Qdrant Edge,把其 Rust 向量检索引擎做成嵌入式的进程内库,在本地磁盘打开 shard 即可写入和查询嵌入向量,全程离线,安装体积约 11 MB,目前处于 beta 阶段,可通过 pip install qdrant-edge-py 或 cargo add qdrant-edge 安装。
v0 现已支持 skills,用户可从提示栏挂载,智能体在每次生成中都会调用它。技能来源包括 skills.sh、已保存的 skills 以及用户自己的 repo。
Modal 发布多项产品更新,Functions 新增区域路由,可将请求经 US West、EU West 或 Asia Pacific South 转发,降低非 US East 来源的网络延迟。
Google 与 UCSD 正在探索"手机集群计算",把每年被淘汰的、仍可用的数亿部旧手机重新用于云端算力。这种做法无需再开采原材料,并利用制造这些设备时已产生的隐含碳,从而直接降低计算的碳足迹。
谷歌 Antigravity 发布新版本,最受期待的功能是更完善的模型配额仪表盘(即将登陆 IDE)。仪表盘现以百分比显示每小时和每周配额上限,方便用户随时掌握剩余用量。官方同时为所有用户重置了 Gemini 配额。
灵初智能联合创始人陈源培在斯坦福李飞飞实验室实现了全球首次双臂长程灵巧操作,以及全球首次用人类数据训练机器人双臂灵巧操作。他认为具身 Scaling Law 的核心瓶颈是数据,单靠遥操数据难以堆到足够规模,百万小时级别的人类中心数据至少能让行业看到效果;跨本体泛化的关键是提取人类操作中的通用信息,再用强化学习补足机器人具体关节、力和接触细节。
v0 上线 annotations 功能,用户可在预览中点击页面元素添加评论,再把所有批注作为单条提示词一次性发送给 agent。该功能把零散的修改意见汇总成一次输入,省去逐条描述和反复提交的步骤。
MongoDB 认为生产级 AI 智能体需要生产级数据平台,主张用原生 JSON 存储融合短期记忆、长期知识与企业的动态非结构化数据,并直接在运营数据上提供搜索、向量搜索、混合搜索和嵌入向量等信息检索能力,免去频繁同步。DevRev 的 AgentOS 基于 MongoDB Atlas 运行,每月处理数十亿次请求。MongoDB 称已有超过 67,000 家客户使用其服务。
Hugging Face 分享了一条关于"用 Modal 构建小型应用"的直播链接。正文未披露具体模型、参数或功能细节。
Modal 对 FlashAttention-4 内核做了一系列改动,使其更适合大语言模型推理,尤其是 decode 密集的负载。团队将优化归为两类:调整并行策略(如把 split KV 技术移植到 FA4、从 query 并行转向 key/value 并行),以及支持不规则全局内存访问(用 cp.async 取代基于 TMA 的 cp.async.bulk)。
阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。
Job Search Terminal 是一款免费、本地优先的求职仪表盘,数据存在本机,不设账号、云端数据库和订阅,用户自带 API key 并自行审核 AI 输出。
Weaviate 推出 Engram,将 AI 记忆按 groups、topics、scopes 三层结构组织,而非堆进一个共享记忆池。groups 用 topics 加处理管线划定用例边界,topics 决定哪些信息会被提取为记忆,scopes 区分项目级、用户级与属性级归属;异步管线负责提取、调和并提交记忆,配合 Weaviate 多租户保持边界隔离。
Augment Code 发布新模型家族 Fable 5,专为长周期工作设计,可处理调查、多步修改和通常耗时数小时的端到端任务。据其说明,在处理最难、最模糊的工程工作时收益最大。官方表示希望听取用户的使用反馈与价值发现场景。
Augment Code 宣布即将把 Fable 5 加入其模型路由器 Prism。Prism 会为每一轮对话路由到最合适的模型,并且具备缓存感知能力,让团队在保持前沿级质量的同时降低成本。其内部基准显示,Prism 在质量不变的前提下,每任务成本最高降低 30%。