MongoDB 8.3 发布:为 AI 工作负载提速,写入吞吐提升 35%
MongoDB 8.3 正式发布,相比 8.0 写入吞吐提升 35%、读取提升 45%、ACID 事务提升 15%,且无需改动应用代码。MongoDB 称 8.0 客户已获得 36% 更快的读取和 59% 更高的更新吞吐。Atlas 覆盖 AWS、Google Cloud、Microsoft Azure 共 130 个区域,并支持跨云集群。
MongoDB 8.3 正式发布,相比 8.0 写入吞吐提升 35%、读取提升 45%、ACID 事务提升 15%,且无需改动应用代码。MongoDB 称 8.0 客户已获得 36% 更快的读取和 59% 更高的更新吞吐。Atlas 覆盖 AWS、Google Cloud、Microsoft Azure 共 130 个区域,并支持跨云集群。
EazoAI 构建了一条完整管线:想法 → AI 生成全栈应用 → 部署 → 在平台上上线 → 首日即有真实用户,无需写代码。该平台正举办奖金 30 万美元的黑客松,5 月 23–24 日在旧金山、5 月 24–25 日在纽约和上海举行,零代码门槛。
Fellou 认为 vibe coding 浪潮没有造出更多构建者,只造出更多"离放弃只差一次部署"的人。Cursor 和 Claude 降低了原型开发的门槛,但没人降低上线的门槛,这才是 2025 年真正的缺口。
Anthropic 宣布即日起对 Claude Code 做三项调整:Pro、Max 与 Team 套餐的 5 小时速率限制翻倍;Pro 和 Max 套餐取消 Claude Code 的高峰时段限额下调;同时大幅提高 Opus 模型的 API 速率限制。
作者曾把本地优先视作学术概念而拒绝多年,如今已用该模式上线三款生产应用,也曾在两个项目中将其拆除。他澄清本地优先是数据架构而非 offline-first、PWA 或 service worker 缓存,其核心是用户设备持有主数据副本、服务端只作为带特殊权限的同步节点;同时指出数据分析面板、银行支付、简单 CRUD 和无离线协作需求的应用都不适合采用,并建议从一个功能开始渐进引入。
Genspark 发布面向智能体的 Git 服务器 sb-git,支持版本管理、分支、diff、blame、回滚和 push 等完整 Git 语义,免费开放使用。可从终端、Claude Code、OpenClaw 或任何支持 Git 的智能体调用,无需 GitHub 账号和仓库配置,clone 后即可 push,每人 1GB 空间,Plus 和 Pro 用户为 10GB。
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
流式 UI 在内容生成过程中持续变化,带来三类问题:视口被强制固定在底部、新内容导致布局位移、渲染频率高于浏览器每秒约 60 次的刷新。文章用聊天气泡、日志流和实时指标三个演示复现这些问题,并提出用 60px 阈值标记用户是否主动上滚,仅在用户处于底部时恢复自动滚动。
Epoch AI 的 AI Chip Sales 数据集显示,截至 2025 年底五大芯片设计商累计出货约 2000 万颗 AI 芯片,Nvidia 占约一半销量和超过 66% 的 AI 算力。
Andrej Karpathy 表示,OpenAI 的 VPT 曾在 2022 年令他震撼,如今 SI 将这一思路扩展为 FDM1,并应用于知识工作与计算机使用场景。他对此感到兴奋,期待看到更多进展。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下辅助患者诊疗的“三方协作”模式。
B站推出bilibili GPU Manager(BGM)内核模块,联动cgroup子系统与显卡驱动实现GPU显存和算力隔离。显存侧由cgroup配置limit、驱动获取假显存总量并按left判断分配;算力侧用cgroup配置的slice替换TSG默认时间片,从而控制单次调度上限、降低高优任务等待。该方案基于NVIDIA开源驱动做参数修正,替代MPS、MIG及CUDA劫持等黑盒方案。
AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。
Ali Aoun Mehdi 在 Gen AI Zürich 黑客松上开发出 Sentinel,一个监测 20 个全球新闻源的 AI 预警系统,每 30 分钟抓取一次数据,可在 30 秒内识别事实矛盾并给出虚假信息风险评分。它用 Qdrant Cloud 做语义检索、Mistral-7B(经 Featherless AI)提取事实并计算矛盾分,已获 Qdrant Challenge 冠军。
Hermes Agent 采用四套记忆系统:MEMORY.md(2,200 字符)与 USER.md(1,375 字符)构成提示词记忆,session_search 调用 SQLite 历史会话存档,技能(Skills)充当程序记忆,另有可选的 Honcho 层做用户建模。
Mistral AI 发布 Workflows 公开预览版,这是面向企业 AI 的编排层,用于把 AI 驱动的业务流程从原型推向生产,具备持久性、可观测性和容错能力。ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等组织已用它自动化关键流程。
HelloGitHub 第 121 期收录多个 AI 相关开源项目,包括为 Claude Code、Cursor 注入 Office 文件操作技能的 OfficeCLI,监控 Claude Code、Codex CLI 等 Agent 的 token 用量与上下文窗口的命令行工具 abtop,以及在一键切换 API 节点、自动故障转移的 cc-switch。
Qdrant Cloud 新增 GPU 加速索引、Multi-AZ 部署和审计日志三项能力。GPU 索引基于 NVIDIA T4,HNSW 索引构建最高提速 4 倍,已在 AWS 集群开放。Multi-AZ 面向 Premium 层级,故障时集群仍可运行,对应 SLA 为 99.95%;审计日志覆盖查询、upsert、删除等 API 操作,所有付费集群可用。
Cognition 宣布与 Mercedes-Benz 合作,加速其全球工程团队的软件工程,这是迄今汽车行业规模最大的 AI 软件工程部署之一。Cognition 的 Scott Wu 与 Mercedes-Benz CIO Katrin Lehmann 就此进行了对话。
美国总统于4月20日签署 Defense Production Act 第303条认定令,将变压器、高压输电部件、变电站等电网基础设施正式列为国防关键物资。
DeepSeek 宣布全线 DeepSeek API 的输入缓存命中价格即刻降至原价的 1/10。官方同时提醒,DeepSeek-V4-Pro 的 75% OFF 促销仍在进行,将持续到 2026 年 5 月 5 日 15:59(UTC)。
Node.js 2026 年首届协作峰会在伦敦由 Bloomberg 主办,40 余人到场。会上宣布新发布计划:从 Node.js v27 起版本号将对应首次 Current 发布年份,以减少并行发布线数量。新 Streams API 已进入 Node.js 核心,并作为实验特性随 v25.9.0 发布,采用 async iterables 与显式背压策略。
字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练任务拆分为相互解耦的计算岛屿并采用异步数据流,使单点硬件故障不中断其他部分。
Data Graphs 基于自研图数据库引擎,结合 Qdrant 向量检索构建混合 Graph RAG 平台,由 Agentic AI 根据查询动态选择图查询或向量检索路径。
Google DeepMind 与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 达成合作,帮助企业规模化落地前沿 AI,合作方将获得包括 Gemini 系列在内的前沿模型早期访问权限。三方合作聚焦金融、制造、零售、媒体娱乐等行业的 agentic 转型,并延续 Google Cloud 此前对咨询与系统集成伙伴的支持。
伯克利 AI 研究博客提出 GRASP,一种针对学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代注入随机性以探索,并重塑梯度让动作获得清晰信号同时避开高维视觉模型中的状态输入梯度。
Sebastian Raschka 公开了自己绘制 LLM 架构图的工作流:从官方技术报告入手,再直接查阅 Hugging Face Model Hub 上的 config 文件与 transformers 参考实现来补齐架构细节,因为近年论文对开源权重模型的描述常不如代码详细。该方法主要适用于开源权重模型,不适用于 ChatGPT、Claude、Gemini 等闭源模型,且刻意保持手动操作。
黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。
Claude Code 已将 Opus 4.7 的默认 effort level 设为 xhigh,用户可用 /effort 命令自行调整。官方邀请用户体验并反馈。
Opus 4.7 在底层换用了新的 tokenizer。测试显示,相比 Opus 4.6,它可能多消耗 1x 到 1.5x 的 token,建议据此提前规划用量。
Andrew Ng 与 JetBrains 合作推出短课程 Spec-Driven Development with Coding Agents,由 Paul Everitt 主讲。课程教授以详细规格文档定义需求、再让编码智能体据此实现的开发方式,可跨会话保留上下文并控制大型代码改动,工作流可打包为跨智能体与 IDE 的便携技能。
Anthropic 的 Anthony Morris 宣布 Claude Code 桌面版重做上线,应用从头设计以便更容易并行处理任务。用户 cat 表示自己已连续数周每天使用该桌面版,它可以在同一处启动和管理本地与云端的多个 Claude Code 会话,还能查看 git 状态、固定活跃会话,并通过拖拽布局同时查看多个会话。
MongoDB 委托 IDC 调研亚太八个市场 1400 家组织后发现,已将现代化融入战略的领先企业数字化收入接近同行的三倍,而 43% 的企业称现有架构已成为主要障碍。IDC 预测,未启动数据债务修复的 CIO 到 2027 年将面临 50% 的 AI 失败率,38% 的亚太企业把云端数据管理平台列为 2026 年现代化投资首要方向。
Modal 让 Claude Code 自主调度弹性 GPU 完成 autoresearch:Tony 给 Claude Code 配置 Modal Skills 后指向 OpenAI Parameter Golf 挑战,15 小时内跑了 113 个实验、消耗 238 GPU-hours,核心训练比单台工作站快 5 倍。
CREAO 25 人团队(10 名工程师)实现 99% 生产代码由 AI 编写,新功能当天上线、A/B 测试后当天砍掉。其核心是用统一 Monorepo、六阶段 GitHub Actions 流水线和 Claude Opus 4.6 三轮 AI 代码审查重构工程流程,并以 Claude Sonnet 4.6 每日扫描 CloudWatch 构建自愈闭环。
Modal 收购 Butter,Butter 创始人 Erik Dunteman 与研究员 Raymond Tana 将加入 Modal Sandbox 团队。
Claude Code 新增配置向导,自动处理 Amazon Bedrock 和 Google Vertex 的环境变量与配置文件,无需手动编写。Claude Code 还能检测到用户锁定旧模型时,在权限允许下建议升级到新模型。
Andrej Karpathy 称今早用某模型处理 245 页 Mythos PDF 时失败严重、输出全部错乱,认为 PDF 转换难度很高。他表示要让 SOTA LLM 正常工作,PDF 转换可能得做成一个 Skill 而非程序。
Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。