OpenAI 发布构建 AI 智能体实用指南
OpenAI 发布《构建 AI 智能体实用指南》,覆盖用例、模型选择、工具设计、护栏机制与多智能体模式,面向智能体的设计、编排与部署全流程。
OpenAI 发布《构建 AI 智能体实用指南》,覆盖用例、模型选择、工具设计、护栏机制与多智能体模式,面向智能体的设计、编排与部署全流程。
OpenAI 发布面向初创企业的 GPT-5 系列模型实用指南,讲解如何迁移到 Responses API、设计 Agent、调优提示词、引导 GPT-5 模型并构建可靠的 AI 工作流。
药物发现公司 Chai Discovery 从第一天起就基于 Modal 构建计算平台,用其弹性 GPU 和分布式文件系统 Modal Volumes 运行从蛋白质嵌入到大分子设计推理的流水线。
GPT-5 被用于营销、工程、财务、战略、法律和 IT 等真实业务工作流,OpenAI 发布了一份简明指南,说明其如何支撑这些流程,并介绍团队应如何评估它。
Monica 9.0 正式上线,同步推出 Monica Agent,主打 Deep Research(深度研究与撰写报告)、Create Slides(把想法转成专业幻灯片)和 Browser Operator(在用户自己的浏览器中自动执行任务)三项能力。官方将其定位为 Premium AI Agent,并采用 Startup Pricing 定价,可在 monica.im 试用。
Node.js 发布 2026 年 1 月安全版本,缓解启用 async_hooks 时用户代码递归耗尽栈空间导致进程以退出码 7 立即退出、而非抛出可捕获 RangeError 的问题,受影响版本包括 20.20.0、22.22.0、24.13.0 和 25.3.0。
Manus 与 Similarweb 达成首个数据合作,为 Manus Pro 用户提供 12 个月网站流量历史数据,可直接对标竞品、分析营销渠道与流量来源,并查看分地区流量明细。
MongoDB Blog 发布 Vision RAG 指南,用多模态嵌入让包含图表和表格的复杂文档变得可搜索,从而省去复杂且昂贵的文本提取。文中指出传统 RAG 主要面向纯文本,企业知识多存于 PDF、幻灯片和图形等多模态格式,用 OCR 或解析工具处理存在工程量大、精度不稳定、规模化成本高的问题;指南介绍 Voyage AI 最新模型如何支撑这一能力,并提供分步实现说明。
Linus Torvalds 被发现在其最新项目的部分开发工作中使用了 Antigravity。该消息由 Varun Mohan 在社交平台分享,称看到自己的编程偶像使用 Antigravity 倍感荣幸。
Modal 将其跨 AWS、GCP、Azure、OCI 的 GPU 工作池扩展到超过 2 万块并发 GPU,两年内启动超 400 万云实例。此次公开其 GPU 可靠性系统,涵盖实例类型测试选型、机器镜像与启动检查、被动与主动健康检查,以及可观测性与支持。模态还维护半自动基准测试 modal-host-bench,用于评估并规避特定实例类型的性能与可靠性问题。
Skyler Miao 表示正与 Groq 紧密合作,并称 M2.1 有望很快上线 Groq。该说法由 Groq 官方账号转发,双方均未披露 M2.1 的具体参数、版本细节或上线时间。
Groq 宣布与美国能源部合作,通过 Genesis Mission 推进高能效、确定性的 AI 推理以及美国主导的算力基础设施。Groq 称当前算力不足以让 AI 惠及所有人,此次合作正是为改变这一现状。
Next.js 16.1 发布,Turbopack 文件系统缓存 for next dev 正式稳定并默认开启,重启开发服务器后首次路由编译在 Vercel 大型内部应用上快约 14 倍、react.dev 快约 10 倍。
Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。
去哪儿网构建了一套分层解耦、端云协同的端智能基础设施,由引擎层、基建层、应用层组成,支持 XGBoost、LightGBM 及 RNN、CNN、Transformer 等模型端侧推理,单次推理耗时控制在毫秒级,推理成功率保持 99.9%。在用户流失预测挽留场景中,端侧模型直接利用实时微观行为特征,单次推理耗时≤10ms,预测准确率较天然不下单概率相对提升 12%。
Mistral AI 发布 Devstral 2 编码模型家族,提供两个尺寸版本,均为开源。同时推出原生 CLI 工具 Mistral Vibe,用于端到端自动化。作者称其支持在家进行 SOTA 开源 vibe coding。
Modal 宣布对 Mistral 3 提供 Day 0 支持,开发者可直接在其无服务器基础设施上部署和扩缩这批开源模型。Mistral 3 是 Mistral 最新的前沿开源多模态模型家族,本文重点介绍其中适合 Modal 无服务器架构的 Ministral 3,提供 3B、8B、14B 三种规模,在基准上与 Qwen 3-VL 系列竞争。
Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。
Modal 提出面向编码智能体的开发者体验框架,认为智能体与人一样依赖紧密的反馈循环。其核心包括命令行、SDK 和 API 等程序化访问,可操作的错误信息,以及与代码就近排布的一致示例。Modal 称其为人类设计的能力同样让智能体受益,例如其 vLLM 推理示例。
Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。
DeepSeek-V3.2-Exp 推理 demo 的早期版本存在 RoPE 实现不匹配问题:indexer 模块的 RoPE 期望非交错输入,MLA RoPE 期望交错输入,可能导致性能下降。该问题已在 deepseek-ai 的 GitHub 仓库修复。
Modal 详解推理中的 host overhead:GPU 因等待 CPU 准备任务而空转,表现为 GPU kernel 利用率偏低。若 host overhead 达 50%,GPU 成本将翻倍,而 GPU 成本通常是推理成本的主要来源。
自动驾驶长期依赖数据飞轮与端到端模型,通过挖掘海量路测数据打补丁来提升能力,但这一数据优先路径正遭遇瓶颈:长尾场景成本剧增、泛化能力受限。作者主张从自动驾驶2.0的“数据优先”转向以推理为核心的3.0,需要推理能力、常识、长时程记忆与解释交互四大支柱。英伟达2025年10月发布Alpamayo-R1,将显式因果推理与轨迹规划整合进统一VLA架构;特斯拉也计划在下一代FSD中引入推理增强。
Qwen Code v0.2.1 发布,开发团队在 17 天内连发 8 个版本(v0.1.0 到 v0.2.1),重心放在修复用户反馈的 bug 而非添加新功能。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。
Cursor 的语义搜索能提升智能体在所有前沿模型上的准确率,在大型代码库中尤为明显,仅靠 grep 难以应对。其思路是在索引阶段投入大量算力,复用这部分计算来提升效果,而不增加推理期算力开销,嵌入向量是实现这一目标最简单的机制。Cursor 还训练了专用嵌入模型用于代码检索。
Cursor 2.0 在 LSP 性能上做了大量优化工作,官方称效果出色。同时 Cursor 还上线了多项体验改进。
Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。
Modal 的 Volumes v2 开放 Beta,支持更高吞吐、更强随机访问性能和数百容器并发写入,且取消文件数量上限;JavaScript/TypeScript 与 Go SDK 以 v0.5 进入 Beta,提供统一的 Client 对象并支持 Sandboxes、Functions、Images 和 Volumes。
Modal 与 Datalab 合作,让开发者可在 5 分钟内于 Modal 上部署 Datalab 的 Marker 文档解析流水线和 Surya OCR 工具包,模型权重缓存进 Modal Volume 以缩短冷启动。
本周有人用 Fellou 在 24 分钟内自动投递了 LinkedIn 上的 127 个职位。只需一句提示词「Find remote Product Manager roles in fintech and apply with my resume」,Fellou 便完成简历分析、职位查找与自动投递,全程无需表格、多标签页或手动滚动。
Next.js 16 正式发布,Turbopack 成为所有应用的默认打包工具,官方称生产构建快 2-5 倍、Fast Refresh 快至 10 倍。新版本加入基于 PPR 和 use cache 的 Cache Components、面向 AI 辅助调试的 Next.js Devtools MCP,以及取代 middleware.ts 的 proxy.ts。
FlowiseAI 发布新版本,包含来自社区的大量小幅改进和 bugfix。完整 release note 已在 GitHub 上公布,官方对社区贡献者表示感谢。
Flowise 升级 OpenAPI Toolkit,可将任意 OpenAPI(Swagger/JSON)规范转成一组面向 LLM 的工具,效果类似 MCP。使用时只需填入一个 OpenAPI 规范链接(如 api.apis.guru/v2/specs/groun…)即可完成转换。
Flowise 发布 v3.0.8,新增基于 OpenAI 与 ElevenLabs 的 TTS 语音能力,并为 Gemini 和 Anthropic 加入内置网页搜索与抓取。该版本还带来 Teradata MCP、Oxylabs 抓取器,以及 OpenAPI Toolkit 升级。
FlowiseAI 在 X 上发布了指向其 Flow 项目的链接,附带的 GitHub 页面地址为 github.com/FlowiseAI/Flow。该帖获得 5 次转发、45 次点赞和 11173 次浏览,未包含模型、参数或功能等具体信息。
FlowiseAI 发布开源版智能体工作流工具,对标 OpenAI 的 AgentKit,支持所有模型。OpenAI 同日推出 AgentKit,包含可嵌入的 ChatKit 聊天界面、Agent Builder 可视化工作流创建器、输入输出安全筛查的 Guardrails 以及数据集与 trace 评分的 Evals。
Thinking Machines 发布 Tinker API,基于其 LoRA 微调实验结果构建,旨在为研究人员和 ML 从业者提供高质量研究工具,降低在前沿模型上做实验的基础设施门槛。该 API 目前已开启 Beta,可加入 waitlist。
MongoDB Atlas 与 Pureinsights Discovery Platform 的集成已正式 GA,提供关键词、向量与生成式 AI 驱动的搜索体验。该方案先用 Atlas Search 做关键词检索,再通过 Atlas Vector Search 与 Voyage AI 的嵌入和重排序理解查询意图,并可跨博客、论坛和技术文档合成带引用的生成式答案。