跳到正文

#部署/工程

今日 68 条
12月2日周二
  1. Modal BlogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 宣布 Day 0 支持 Mistral 3,GPU 快照将冷启动提速近 10 倍

    Modal 宣布对 Mistral 3 提供 Day 0 支持,开发者可直接在其无服务器基础设施上部署和扩缩这批开源模型。Mistral 3 是 Mistral 最新的前沿开源多模态模型家族,本文重点介绍其中适合 Modal 无服务器架构的 Ministral 3,提供 3B、8B、14B 三种规模,在基准上与 Qwen 3-VL 系列竞争。

11月23日周日
  1. Eugene YanAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    产品评测的三个简单步骤

    Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。

11月20日周四
  1. Modal BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal:智能体也需要良好的开发者体验

    Modal 提出面向编码智能体的开发者体验框架,认为智能体与人一样依赖紧密的反馈循环。其核心包括命令行、SDK 和 API 等程序化访问,可操作的错误信息,以及与代码就近排布的一致示例。Modal 称其为人类设计的能力同样让智能体受益,例如其 vLLM 推理示例。

11月19日周三
  1. Modal BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reducto 如何用 Modal 将企业级文档处理延迟降低 3 倍

    Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。

11月18日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3.2-Exp 推理 demo 修复 RoPE 实现不匹配

    DeepSeek-V3.2-Exp 推理 demo 的早期版本存在 RoPE 实现不匹配问题:indexer 模块的 RoPE 期望非交错输入,MLA RoPE 期望交错输入,可能导致性能下降。该问题已在 deepseek-ai 的 GitHub 仓库修复。

  2. Modal BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何解决拖垮推理效率的 host overhead 问题

    Modal 详解推理中的 host overhead:GPU 因等待 CPU 准备任务而空转,表现为 GPU kernel 利用率偏低。若 host overhead 达 50%,GPU 成本将翻倍,而 GPU 成本通常是推理成本的主要来源。

11月17日周一
  1. 语言即世界language is worldAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    自动驾驶系统的局部最优陷阱

    自动驾驶长期依赖数据飞轮与端到端模型,通过挖掘海量路测数据打补丁来提升能力,但这一数据优先路径正遭遇瓶颈:长尾场景成本剧增、泛化能力受限。作者主张从自动驾驶2.0的“数据优先”转向以推理为核心的3.0,需要推理能力、常识、长时程记忆与解释交互四大支柱。英伟达2025年10月发布Alpamayo-R1,将显式因果推理与轨迹规划整合进统一VLA架构;特斯拉也计划在下一代FSD中引入推理增强。

11月15日周六
  1. Binyuan Hui(@huybery)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen Code v0.2.1 发布:17 天迭代 8 个版本,优先修复 bug 而非加新功能

    Qwen Code v0.2.1 发布,开发团队在 17 天内连发 8 个版本(v0.1.0 到 v0.2.1),重心放在修复用户反馈的 bug 而非添加新功能。

11月13日周四
  1. Modal BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Decagon 如何在 Modal 上落地实时语音 AI

    Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。

  2. Binyuan Hui(@huybery)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-fficiency 发布:评估 LM 能否加速真实 GitHub 仓库

    SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。

11月6日周四
  1. Aman Sanger(@amanrsanger)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 语义搜索提升 AI 智能体准确率:靠索引期算力换取推理期性能

    Cursor 的语义搜索能提升智能体在所有前沿模型上的准确率,在大型代码库中尤为明显,仅靠 grep 难以应对。其思路是在索引阶段投入大量算力,复用这部分计算来提升效果,而不增加推理期算力开销,嵌入向量是实现这一目标最简单的机制。Cursor 还训练了专用嵌入模型用于代码检索。

11月5日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 2.0 大幅优化 LSP 性能

    Cursor 2.0 在 LSP 性能上做了大量优化工作,官方称效果出色。同时 Cursor 还上线了多项体验改进。

11月4日周二
  1. Modal BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Modal、Pipecat 和开源模型实现 1 秒语音到语音延迟

    Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。

10月31日周五
  1. Modal BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 更新 Volumes v2、JavaScript 与 Go SDK

    Modal 的 Volumes v2 开放 Beta,支持更高吞吐、更强随机访问性能和数百容器并发写入,且取消文件数量上限;JavaScript/TypeScript 与 Go SDK 以 v0.5 进入 Beta,提供统一的 Client 对象并支持 Sandboxes、Functions、Images 和 Volumes。

10月30日周四
  1. Modal BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 与 Datalab 合作:5 分钟内高吞吐部署 Marker 文档智能

    Modal 与 Datalab 合作,让开发者可在 5 分钟内于 Modal 上部署 Datalab 的 Marker 文档解析流水线和 Surya OCR 工具包,模型权重缓存进 Modal Volume 以缩短冷启动。

10月26日周日
  1. Fellou(@FellouAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou 让用户在 LinkedIn 24 分钟自动投递 127 个职位

    本周有人用 Fellou 在 24 分钟内自动投递了 LinkedIn 上的 127 个职位。只需一句提示词「Find remote Product Manager roles in fintech and apply with my resume」,Fellou 便完成简历分析、职位查找与自动投递,全程无需表格、多标签页或手动滚动。

10月22日周三
  1. Next.js BlogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 16 发布:Turbopack 成为默认打包工具,新增 Devtools MCP 与 Cache Components

    Next.js 16 正式发布,Turbopack 成为所有应用的默认打包工具,官方称生产构建快 2-5 倍、Fast Refresh 快至 10 倍。新版本加入基于 PPR 和 use cache 的 Cache Components、面向 AI 辅助调试的 Next.js Devtools MCP,以及取代 middleware.ts 的 proxy.ts。

10月11日周六
  1. FlowiseAI(@FlowiseAI)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FlowiseAI 发布社区贡献的小幅改进与 bugfix 版本

    FlowiseAI 发布新版本,包含来自社区的大量小幅改进和 bugfix。完整 release note 已在 GitHub 上公布,官方对社区贡献者表示感谢。

  2. FlowiseAI(@FlowiseAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Flowise OpenAPI Toolkit 升级:把任意 OpenAPI 规范转成 LLM 可用的工具集

    Flowise 升级 OpenAPI Toolkit,可将任意 OpenAPI(Swagger/JSON)规范转成一组面向 LLM 的工具,效果类似 MCP。使用时只需填入一个 OpenAPI 规范链接(如 api.apis.guru/v2/specs/groun…)即可完成转换。

  3. FlowiseAI(@FlowiseAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Flowise v3.0.8 发布:新增 TTS、Gemini/Anthropic 内置联网搜索

    Flowise 发布 v3.0.8,新增基于 OpenAI 与 ElevenLabs 的 TTS 语音能力,并为 Gemini 和 Anthropic 加入内置网页搜索与抓取。该版本还带来 Teradata MCP、Oxylabs 抓取器,以及 OpenAPI Toolkit 升级。

10月7日周二
  1. FlowiseAI(@FlowiseAI)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FlowiseAI 发布 Flow 项目更新

    FlowiseAI 在 X 上发布了指向其 Flow 项目的链接,附带的 GitHub 页面地址为 github.com/FlowiseAI/Flow。该帖获得 5 次转发、45 次点赞和 11173 次浏览,未包含模型、参数或功能等具体信息。

  2. FlowiseAI(@FlowiseAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FlowiseAI 推出支持所有模型的开源版 AgentKit

    FlowiseAI 发布开源版智能体工作流工具,对标 OpenAI 的 AgentKit,支持所有模型。OpenAI 同日推出 AgentKit,包含可嵌入的 ChatKit 聊天界面、Agent Builder 可视化工作流创建器、输入输出安全筛查的 Guardrails 以及数据集与 trace 评分的 Evals。

10月2日周四
  1. Lilian Weng(@lilianweng)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 推出 Tinker API,简化前沿模型 LoRA 微调实验

    Thinking Machines 发布 Tinker API,基于其 LoRA 微调实验结果构建,旨在为研究人员和 ML 从业者提供高质量研究工具,降低在前沿模型上做实验的基础设施门槛。该 API 目前已开启 Beta,可加入 waitlist。

10月1日周三
  1. MongoDB BlogAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB Atlas 与 Pureinsights 集成正式 GA,打造关键词+向量+生成式 AI 搜索

    MongoDB Atlas 与 Pureinsights Discovery Platform 的集成已正式 GA,提供关键词、向量与生成式 AI 驱动的搜索体验。该方案先用 Atlas Search 做关键词检索,再通过 Atlas Vector Search 与 Voyage AI 的嵌入和重排序理解查询意图,并可跨博客、论坛和技术文档合成带引用的生成式答案。

9月29日周一
  1. Modal BlogAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 完成 8700 万美元 B 轮融资,估值 11 亿美元

    AI 基础设施公司 Modal 完成超 8000 万美元 B 轮融资,由 Lux Capital 领投,老股东跟投,投后估值 11 亿美元,累计融资 1.11 亿美元。

9月24日周三
  1. MongoDB BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何构建值得长期保留的 AI 智能体:Canvas 框架

    MongoDB Blog 提出 Canvas 框架,用于解决企业 AI 智能体项目大量停留在试点阶段的问题。文章援引数据称近八成公司使用生成式 AI,但部署用例中不到 10% 能走出试点,MIT 研究样本中失败率甚至高达 95%。

9月22日周一
  1. MongoDB BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB Atlas 加入 MCP Toolbox,打通 AI 智能体与企业数据源

    MongoDB Atlas 现已加入 MCP Toolbox for Databases 的支持数据库生态,这一开源 Model Context Protocol(MCP)服务器由 Anthropic 提出,可实现生成式 AI 智能体与企业数据源的无缝集成。

  2. DeepSeekAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V3.1-Terminus 版本更新

    DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus,在保持原有能力的基础上缓解了中英文混杂与偶发异常字符问题,并进一步优化了 Code Agent 与 Search Agent 的表现。官方称新版本输出效果更稳定,目前官方 App、网页端、小程序与 DeepSeek API 模型均已同步更新,开源版本已在 Hugging Face 和 ModelScope 上线。

9月18日周四
  1. MongoDB BlogAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 发布 8.2 版本、Voyage AI 嵌入模型与 AMP 应用现代化平台

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并推出 Voyage AI 的嵌入与重排序模型,同时为 Community Edition 和 Enterprise Server 带来搜索与向量搜索公开预览。

  2. MongoDB BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:为 AI 时代定义理想数据库

    MongoDB 在 MongoDB.local NYC 2025 发布 MongoDB 8.2,称其为功能最丰富、性能最强的版本。

  3. MongoDB BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 发布 8.2、AMP 平台,搜索与向量搜索进入公开预览

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其是迄今功能最丰富、性能最高的版本;同时推出应用现代化平台 AMP,企业从旧系统迁移到 MongoDB 的速度提高两到三倍。

  4. MongoDB BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 发布 8.2、Voyage AI 与 AMP 应用现代化平台

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其是迄今功能最丰富、性能最强的版本。

  5. MongoDB BlogAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 活动上发布 MongoDB 8.2,官方称这是其功能最丰富、性能最强的一个版本。同期公布的还有 Voyage AI 嵌入模型与重排器,以及 MongoDB Community Edition 和 Enterprise Server 上进入公开预览的 Search 与 Vector Search。

  6. MongoDB BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 8.2 与 AMP 平台定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为迄今功能最丰富、性能最强的版本。同时推出 MongoDB 应用现代化平台(AMP),可将企业从旧系统迁移到 MongoDB 的速度提升两到三倍,代码重写等任务提速数倍。

  7. MongoDB BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 发布 8.2、Voyage AI 嵌入模型与 AMP 平台,定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并公布 Voyage AI 嵌入模型与 reranker 的进展,Search 和 Vector Search 已在 Community Edition 与 Enterprise Server 进入 public preview。

  8. MongoDB BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 8.2 发布,定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为史上功能最丰富、性能最强的版本。大会还推出 Voyage AI 嵌入模型与重排器,并宣布搜索与向量搜索在 Community Edition 和 Enterprise Server 上开放公开预览。

9月10日周三
  1. Thinking Machines — ConnectionismAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 详解 LLM 推理不确定性成因与确定性实现

    Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。

7月3日周四
  1. OnBoard!AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 AppLovin 技术 VP 葛小川:2 年市值增长 25 倍,千亿美金广告平台的传奇成长史

    AppLovin 技术副总裁葛小川在 OnBoard! 播客中回顾了这家广告技术平台从游戏营销公司到千亿美金市值公司的两次转型历程,并解析其核心广告推荐引擎 Axon AI 如何在微秒级处理上万亿次竞价、以 ROAS 而非 CTR 驱动投放决策。

5月22日周四
  1. Sualeh Asif(@sualehasif996)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 0.50 发布:新标签页模型、1M+ 上下文窗口与后台 agent

    Cursor 发布 0.50 版本,推出新的标签页模型并预览后台 agent,新标签页模型在跳转方面有大幅提升,用户可在 Cursor 的远程副本中立即与 agent 交互。该版本还带来 1M+ 上下文的窗口。

5月4日周日
  1. Eugene YanAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 MCP、Amazon Q 和 tmux 构建每日新闻摘要智能体

    作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。