Modal 宣布 Day 0 支持 Mistral 3,GPU 快照将冷启动提速近 10 倍
Modal 宣布对 Mistral 3 提供 Day 0 支持,开发者可直接在其无服务器基础设施上部署和扩缩这批开源模型。Mistral 3 是 Mistral 最新的前沿开源多模态模型家族,本文重点介绍其中适合 Modal 无服务器架构的 Ministral 3,提供 3B、8B、14B 三种规模,在基准上与 Qwen 3-VL 系列竞争。
Modal 宣布对 Mistral 3 提供 Day 0 支持,开发者可直接在其无服务器基础设施上部署和扩缩这批开源模型。Mistral 3 是 Mistral 最新的前沿开源多模态模型家族,本文重点介绍其中适合 Modal 无服务器架构的 Ministral 3,提供 3B、8B、14B 三种规模,在基准上与 Qwen 3-VL 系列竞争。
Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。
Modal 提出面向编码智能体的开发者体验框架,认为智能体与人一样依赖紧密的反馈循环。其核心包括命令行、SDK 和 API 等程序化访问,可操作的错误信息,以及与代码就近排布的一致示例。Modal 称其为人类设计的能力同样让智能体受益,例如其 vLLM 推理示例。
Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。
DeepSeek-V3.2-Exp 推理 demo 的早期版本存在 RoPE 实现不匹配问题:indexer 模块的 RoPE 期望非交错输入,MLA RoPE 期望交错输入,可能导致性能下降。该问题已在 deepseek-ai 的 GitHub 仓库修复。
Modal 详解推理中的 host overhead:GPU 因等待 CPU 准备任务而空转,表现为 GPU kernel 利用率偏低。若 host overhead 达 50%,GPU 成本将翻倍,而 GPU 成本通常是推理成本的主要来源。
自动驾驶长期依赖数据飞轮与端到端模型,通过挖掘海量路测数据打补丁来提升能力,但这一数据优先路径正遭遇瓶颈:长尾场景成本剧增、泛化能力受限。作者主张从自动驾驶2.0的“数据优先”转向以推理为核心的3.0,需要推理能力、常识、长时程记忆与解释交互四大支柱。英伟达2025年10月发布Alpamayo-R1,将显式因果推理与轨迹规划整合进统一VLA架构;特斯拉也计划在下一代FSD中引入推理增强。
Qwen Code v0.2.1 发布,开发团队在 17 天内连发 8 个版本(v0.1.0 到 v0.2.1),重心放在修复用户反馈的 bug 而非添加新功能。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。
Cursor 的语义搜索能提升智能体在所有前沿模型上的准确率,在大型代码库中尤为明显,仅靠 grep 难以应对。其思路是在索引阶段投入大量算力,复用这部分计算来提升效果,而不增加推理期算力开销,嵌入向量是实现这一目标最简单的机制。Cursor 还训练了专用嵌入模型用于代码检索。
Cursor 2.0 在 LSP 性能上做了大量优化工作,官方称效果出色。同时 Cursor 还上线了多项体验改进。
Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。
Modal 的 Volumes v2 开放 Beta,支持更高吞吐、更强随机访问性能和数百容器并发写入,且取消文件数量上限;JavaScript/TypeScript 与 Go SDK 以 v0.5 进入 Beta,提供统一的 Client 对象并支持 Sandboxes、Functions、Images 和 Volumes。
Modal 与 Datalab 合作,让开发者可在 5 分钟内于 Modal 上部署 Datalab 的 Marker 文档解析流水线和 Surya OCR 工具包,模型权重缓存进 Modal Volume 以缩短冷启动。
本周有人用 Fellou 在 24 分钟内自动投递了 LinkedIn 上的 127 个职位。只需一句提示词「Find remote Product Manager roles in fintech and apply with my resume」,Fellou 便完成简历分析、职位查找与自动投递,全程无需表格、多标签页或手动滚动。
Next.js 16 正式发布,Turbopack 成为所有应用的默认打包工具,官方称生产构建快 2-5 倍、Fast Refresh 快至 10 倍。新版本加入基于 PPR 和 use cache 的 Cache Components、面向 AI 辅助调试的 Next.js Devtools MCP,以及取代 middleware.ts 的 proxy.ts。
FlowiseAI 发布新版本,包含来自社区的大量小幅改进和 bugfix。完整 release note 已在 GitHub 上公布,官方对社区贡献者表示感谢。
Flowise 升级 OpenAPI Toolkit,可将任意 OpenAPI(Swagger/JSON)规范转成一组面向 LLM 的工具,效果类似 MCP。使用时只需填入一个 OpenAPI 规范链接(如 api.apis.guru/v2/specs/groun…)即可完成转换。
Flowise 发布 v3.0.8,新增基于 OpenAI 与 ElevenLabs 的 TTS 语音能力,并为 Gemini 和 Anthropic 加入内置网页搜索与抓取。该版本还带来 Teradata MCP、Oxylabs 抓取器,以及 OpenAPI Toolkit 升级。
FlowiseAI 在 X 上发布了指向其 Flow 项目的链接,附带的 GitHub 页面地址为 github.com/FlowiseAI/Flow。该帖获得 5 次转发、45 次点赞和 11173 次浏览,未包含模型、参数或功能等具体信息。
FlowiseAI 发布开源版智能体工作流工具,对标 OpenAI 的 AgentKit,支持所有模型。OpenAI 同日推出 AgentKit,包含可嵌入的 ChatKit 聊天界面、Agent Builder 可视化工作流创建器、输入输出安全筛查的 Guardrails 以及数据集与 trace 评分的 Evals。
Thinking Machines 发布 Tinker API,基于其 LoRA 微调实验结果构建,旨在为研究人员和 ML 从业者提供高质量研究工具,降低在前沿模型上做实验的基础设施门槛。该 API 目前已开启 Beta,可加入 waitlist。
MongoDB Atlas 与 Pureinsights Discovery Platform 的集成已正式 GA,提供关键词、向量与生成式 AI 驱动的搜索体验。该方案先用 Atlas Search 做关键词检索,再通过 Atlas Vector Search 与 Voyage AI 的嵌入和重排序理解查询意图,并可跨博客、论坛和技术文档合成带引用的生成式答案。
AI 基础设施公司 Modal 完成超 8000 万美元 B 轮融资,由 Lux Capital 领投,老股东跟投,投后估值 11 亿美元,累计融资 1.11 亿美元。
MongoDB Blog 提出 Canvas 框架,用于解决企业 AI 智能体项目大量停留在试点阶段的问题。文章援引数据称近八成公司使用生成式 AI,但部署用例中不到 10% 能走出试点,MIT 研究样本中失败率甚至高达 95%。
MongoDB Atlas 现已加入 MCP Toolbox for Databases 的支持数据库生态,这一开源 Model Context Protocol(MCP)服务器由 Anthropic 提出,可实现生成式 AI 智能体与企业数据源的无缝集成。
DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus,在保持原有能力的基础上缓解了中英文混杂与偶发异常字符问题,并进一步优化了 Code Agent 与 Search Agent 的表现。官方称新版本输出效果更稳定,目前官方 App、网页端、小程序与 DeepSeek API 模型均已同步更新,开源版本已在 Hugging Face 和 ModelScope 上线。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并推出 Voyage AI 的嵌入与重排序模型,同时为 Community Edition 和 Enterprise Server 带来搜索与向量搜索公开预览。
MongoDB 在 MongoDB.local NYC 2025 发布 MongoDB 8.2,称其为功能最丰富、性能最强的版本。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其是迄今功能最丰富、性能最高的版本;同时推出应用现代化平台 AMP,企业从旧系统迁移到 MongoDB 的速度提高两到三倍。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其是迄今功能最丰富、性能最强的版本。
MongoDB 在 MongoDB.local NYC 活动上发布 MongoDB 8.2,官方称这是其功能最丰富、性能最强的一个版本。同期公布的还有 Voyage AI 嵌入模型与重排器,以及 MongoDB Community Edition 和 Enterprise Server 上进入公开预览的 Search 与 Vector Search。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为迄今功能最丰富、性能最强的版本。同时推出 MongoDB 应用现代化平台(AMP),可将企业从旧系统迁移到 MongoDB 的速度提升两到三倍,代码重写等任务提速数倍。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并公布 Voyage AI 嵌入模型与 reranker 的进展,Search 和 Vector Search 已在 Community Edition 与 Enterprise Server 进入 public preview。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为史上功能最丰富、性能最强的版本。大会还推出 Voyage AI 嵌入模型与重排器,并宣布搜索与向量搜索在 Community Edition 和 Enterprise Server 上开放公开预览。
Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。
AppLovin 技术副总裁葛小川在 OnBoard! 播客中回顾了这家广告技术平台从游戏营销公司到千亿美金市值公司的两次转型历程,并解析其核心广告推荐引擎 Axon AI 如何在微秒级处理上万亿次竞价、以 ROAS 而非 CTR 驱动投放决策。
Cursor 发布 0.50 版本,推出新的标签页模型并预览后台 agent,新标签页模型在跳转方面有大幅提升,用户可在 Cursor 的远程副本中立即与 agent 交互。该版本还带来 1M+ 上下文的窗口。
作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。