Martin Fowler 碎片:开源提示词模式框架、音乐人起诉 Google 诽谤、Apple 重新思考 AI 支出
Martin Fowler 的 Fragments 合集提到一个面向提示词模式的开源框架,并收录了音乐人起诉 Google 诽谤、Apple 重新思考 AI 支出、本地运行 LLM,以及"Genie 是否会陷入焦油坑"等话题。以上内容以链接摘要形式汇集于 martinfowler.com/fragments。
Martin Fowler 的 Fragments 合集提到一个面向提示词模式的开源框架,并收录了音乐人起诉 Google 诽谤、Apple 重新思考 AI 支出、本地运行 LLM,以及"Genie 是否会陷入焦油坑"等话题。以上内容以链接摘要形式汇集于 martinfowler.com/fragments。
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
Demis Hassabis 在 Y Combinator 的 How to Build the Future 节目中与 Garry Tan 对话,讨论通往 AGI 还缺什么,并指出记忆问题至今仍未解决。他还谈到 AlphaGo 如何影响 Gemini、小模型为何越来越强、持续学习与 AI 智能体的未来,以及从 AlphaFold 走向虚拟细胞。他建议创始人思考在 AGI 到来之前该构建什么。
B站推出bilibili GPU Manager(BGM)内核模块,联动cgroup子系统与显卡驱动实现GPU显存和算力隔离。显存侧由cgroup配置limit、驱动获取假显存总量并按left判断分配;算力侧用cgroup配置的slice替换TSG默认时间片,从而控制单次调度上限、降低高优任务等待。该方案基于NVIDIA开源驱动做参数修正,替代MPS、MIG及CUDA劫持等黑盒方案。
AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。
43 Talks 沙龙邀请拾象科技 Cage、词元共振小七姐、ListenHub 创始人 Orange、AI 艺术家歸藏,探讨 AI 时代组织形态的进化。Cage 观察到硅谷出现 The Great Flattening,传统中层「翻译」职能被 LLM 挤压;小七姐的团队从 6 人进化为 12 个「人机对」,产品上线不到一周营收突破 1 万美金。
DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。
DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。
DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。
小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。DeepSeek-V4-Pro 总参数 1.6T、激活 49B,官方称性能对标全球顶级闭源模型;DeepSeek-V4-Flash 总参数 284B、激活 13B,定位快速、高效、经济的选项。
DeepSeek-V4 Preview 开源并给出两个版本的参数与 1M 上下文,可据此了解其开放程度与定位。
DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。
官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。
Node.js 2026 年首届协作峰会在伦敦由 Bloomberg 主办,40 余人到场。会上宣布新发布计划:从 Node.js v27 起版本号将对应首次 Current 发布年份,以减少并行发布线数量。新 Streams API 已进入 Node.js 核心,并作为实验特性随 v25.9.0 发布,采用 async iterables 与显式背压策略。
Elastic 全球副总裁、原 Jina AI 创始人兼 CEO 肖涵在 Elastic 中国 AI 搜索技术大会上演讲,认为 2026 年做 AI 搜索基本就是在做智能体记忆,并指出记忆表征、选择性遗忘和跨模型迁移是当前未解决的问题。
月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。
K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。
Sebastian Raschka 公开了自己绘制 LLM 架构图的工作流:从官方技术报告入手,再直接查阅 Hugging Face Model Hub 上的 config 文件与 transformers 参考实现来补齐架构细节,因为近年论文对开源权重模型的描述常不如代码详细。该方法主要适用于开源权重模型,不适用于 ChatGPT、Claude、Gemini 等闭源模型,且刻意保持手动操作。
黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。
mem0 现已支持在生产规模上低成本运行智能体记忆,且不牺牲质量,该方案主打 token 高效。mem0 为开源项目。
AI 正在让开源软件变得真正可改:用户即便不懂代码,也能给本地开源应用加功能、做成自用分支。David Heinemeier Hansson 认为,这股能力用在操作系统上更关键——只有 Linux 能改菜单栏、窗口管理器和通知系统,Windows 与 macOS 的核心归厂商所有。他已在 Omarchy 社区看到非技术用户用 AI 定制系统。
Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。
去哪儿酒店团队用 FFmpeg + RTMP 推流、开源流媒体服务器 SRS 搭建数字人直播底座,通过 GOP 设为 50、开启 min_latency 低延迟模式并配合前端预加载,把端到端延迟从 10 秒降到 3 秒、实现首屏秒开。SRS 单进程可扛数千路并发,Origin 节点用 forward 功能一路转推抖音、视频号、淘宝等多平台,并支持 SIGUSR2 热升级与推流端双活容灾。
Andrej Karpathy 称赞 Farzapedia 是个人 Wiki 式 AI 个性化的好例子:记忆以显式、可浏览的 wiki 文件形式存在,用户能清楚看到 AI 知道什么。数据存于本地、采用 markdown 与图片等通用格式,可自由接入 Claude、Codex、OpenCode 等任意 AI,甚至用于微调开源模型。
用户可通过 llama-server -hf ggml-org/gemma-4-26b-a4b-it-GGUF:Q4_K_M 启动模型,再用 openclaw onboard --non-interactive 以 custom-api-key 方式完成接入。
NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。
Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。
METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。
Claude Code 源码泄漏后,宝玉不打算写源码分析,而是分享学大型开源项目的四步法:先跑起来、从单个功能点切入、动手做二次开发、最后从零搭建。他指出泄漏的 50 多万行代码只是 source map 还原结果,缺脚手架和私有 package,无法直接运行。Anthropic 的 Boris 回应称问题出在本应自动化、却仍人工操作的部署环节,未归咎或开除任何人。
吴恩达警告反 AI 联盟正筛选更能煽动公众的叙事来拖慢 AI 进展。一项英国机构的大型研究发现,"AI 将导致人类灭绝"的说法基本失效,但 AI 战争与环境议题更能引发共鸣,失业和儿童受害则是驱动人们行动的信息。他同时指出,大型 AI 公司借"AI 危险"论阻挠开源项目自由分发,实质是监管俘获。
飞书开源命令行工具 lark-cli,让 AI Agent 直接操作飞书完成发消息、查日历、写文档、建多维表格、发邮件和管理任务。作者认为 CLI 相比 API 和 GUI 更适合 Agent,因为它可自描述(--help 即可了解能力)且以文本交互;CLI、MCP 与技能三者分工不同,CLI 干活、MCP 在不支持终端的环境中是唯一选择、技能相当于给 Agent 的说明书。
Chroma 推出 Chroma Context-1,一个 20B 参数的搜索智能体,模型权重已在 Hugging Face 发布。官方称其推进了智能体搜索的 pareto 前沿,速度提升一个数量级、成本降低一个数量级,并以 Apache 2.0 协议开源。
Mistral AI 发布 Voxtral TTS,一款开放权重的文本转语音模型,主打自然、富有表现力和超快速度。官方给出的特点包括真实且带情感表现的语音、支持 9 种语言并能准确捕捉不同方言、首帧音频延迟很低,以及可较容易地适配新音色。
Delphi Ventures 创始合伙人 José Maria Macedo 在走访中国 AI 创始人、VC 和上市公司 CEO 两周后,表示自己更看好中国硬件、更看衰软件。
Andrej Karpathy 整理 litellm 供应链投毒事件的资料清单,指出共有 2112 个包依赖 litellm,其中 1403 个为直接依赖,包括 DSPy、Open Interpreter、PraisonAI、MLflow、langchain-litellm 等。
Qdrant 上线免费进阶课程 Multi-Vector Search Course,由 Kacper Łukawski 设计,面向已掌握向量搜索基础的 ML、后端与搜索工程师。
针对 William Shen 发布的 UNI-1,林俊旸表示"做得不错,如果能开源会更好"。据 William Shen 介绍,UNI-1 具备智能、可控、有文化感的特点,能力范围极广,团队正面对 Deepmind、OpenAI、Bytedance 等巨头的竞争,后续还将推出 API、技术报告和 model card。
Sebastian Raschka 发布 LLM 架构画廊,收录 45 个架构并配可视化模型卡,同时推出 Redbubble 海报版。文章借此梳理现代开源权重模型中的注意力变体,从标准多头注意力(MHA)讲起,示例架构包括 GPT-2、OLMo 2 7B 和 OLMo 3 7B,并延伸到分组查询注意力、滑动窗口注意力等概念。
Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。
MiniMax-M2.7 已在 Poe 平台上线,官方称其为面向自主软件工程和智能体工作流的下一代自进化模型,可迭代改进自身的智能体脚手架并在重复运行中优化任务表现。该模型在 SWE-Pro 等真实编码基准上取得较大提升,适用于多文件代码库修改、长周期规划、工具调用、文档自动化和复杂多智能体任务,已在 Poe 全平台应用及 Poe API 开放使用。
Next.js 16.2 发布,next dev 启动速度提升约 400%,服务端组件渲染提速 25%–60%,并包含 200 多项 Turbopack 修复与改进。
杨立昆与谢赛宁等人创立的世界模型公司 AMI Labs 仅 25 人、无产品,便完成 10.3 亿美元 Seed 轮融资,投前估值 35 亿美元,创欧洲历史最大 Seed 轮。总部设在巴黎,并在纽约、蒙特利尔、新加坡设研发中心,刻意避开硅谷。谢赛宁称"硅谷已深陷 LLM、被它催眠",公司要做"反向的 OpenAI",通过全球联盟共建世界模型。
Hugging Face 面向全球开放 Hugging Face Builders 申请,面向热爱开源 AI、擅长组织社区活动的人,邀请其成为 Builder 并牵头本地社区。该计划此前已显现全球需求,官方同步放出项目介绍与申请入口。