mem0 谈程序性记忆:存储可重复的操作步骤,风险在于流程过期却不再验证
mem0 解释了程序性记忆,即存储"部署流程""新增 API endpoint 所需的五个步骤"这类可重复执行的操作步骤。它指出这类记忆的失效模式不同:为旧系统设计的流程会在系统更替后继续运行,且不再重新验证。
mem0 解释了程序性记忆,即存储"部署流程""新增 API endpoint 所需的五个步骤"这类可重复执行的操作步骤。它指出这类记忆的失效模式不同:为旧系统设计的流程会在系统更替后继续运行,且不再重新验证。
Firecrawl 已上线 Vercel Connect,AI 智能体可通过它搜索和抓取网页获取所需上下文,命令为 `vercel connect create firecrawl --name my-agent`。
glm-5.3-flash 将很快在 Ollama 云上线。该消息由 Ollama 发布,未披露参数规模、上下文长度或具体上线时间。
Qwen 宣布 Qwen3.8-Flash-Next 当天即可通过 SGLang 部署,并对 SGLang 的 day-0 支持表示感谢。
vLLM 宣布在发布首日即支持阿里 Qwen3.8-Flash-Next,并已在 NVIDIA 和 AMD GPU 上验证。
Qwen3.8-Flash-Next 现已支持通过 SGLang 部署,SGLang 作为首日合作伙伴同步支持 Qwen4 的新架构预览。阿里 Qwen 团队对 SGLang 的首日支持表示感谢。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
在 1M-token 上下文长度下,QSA 的注意力内核在 prefill 阶段最高提速 7.6×,decode 阶段提速 4.9×。当 prefix-cache 命中率为 90% 时,Qwen3.8-Flash-Next 的 prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。
vivo 互联网前端团队推出基于 Web 的 AI 游戏开发平台 vGame,用结构化场景描述加 AI Agent 取代手工编码,将广告小游戏开发效率提升一个数量级。平台技术选型为 Vue 3 + Vite、Koa + OpenCode SDK + Claude Agent,游戏运行时基于 Galacean Engine,并把游戏开发知识封装为 17 个 Agent Skill。
Naval 推荐了一期 AI 播客,嘉宾 Neil Movva 从 Nvidia 的 GPU 与 kernel 工作起步,如今经营 Sail Research,为 AI 智能体构建让 token 尽可能便宜的基础设施。节目以类似 401 级课程的深度讨论了延迟与吞吐、芯片与内存、Transformer、AI 训练数据的未来、算力套利与电力"拾荒者策略",以及开源与前沿实验室之争。
Lovable 在高峰期每秒可在 code.storage 上创建 250 个新代码仓库,同时通过更纯粹的对象存储方案将拉取延迟改善 230%。Anton Osika 称自己在创办 Lovable 之前职业生涯中启动过约 250 个仓库。面向追求规模与速度的产品开发者,code.storage 现已开放注册。
得物技术披露其 MultiAgent 平台的记忆模块实现,采用 Working、Session、User、Agent 四层记忆模型,短期记忆以 MySQL 持久化、Redis 作热点缓存并做 Token 窗口裁剪,会话结束后异步沉淀到长期层。
个人提效不等于组织提效,团队吞吐被三类卡点挡住:个人经验难以复制、跨角色背景对齐成本高、工具生态各自为政,换更强的模型也不会消失。作者给出解法 Workspace——面向 Agent 的组织资产基座,把知识库、代码库、iCafe 空间和 skill 收进一个代码库,Agent 可访问并自行验证产出。它只存摘要与索引而非知识快照,工作模式不变。
Kimi K3 是一个有效扩展到 2.8T 总参数并全量开源的 MoE 模型,本期播客由清华大学计算机系博士候选人孙宇涛领读其技术报告。
2026 年 FDE(前线部署工程师)被称为「硅谷最性感的工作」,全球岗位数量过去两年增长了几十倍,OpenAI、Anthropic 等公司纷纷组建 AI 部署团队帮客户解决落地「最后一公里」。
Ollama 已内置网页搜索,用户可用开源模型执行研究任务,原有功能继续保持可用。该功能通过 ollama.com/blog/claude-de… 公布,官方称常见使用方式不受影响。
Ollama v0.33 发布,可将 Claude Desktop 配置为第三方网关提供方接入 Ollama,只需一个开关,云端与本地模型即可直接使用。该版本强调配置流程的简化,未披露更多技术细节。
Dify 将参加在加州 Mountain View 举办的 Querit Search Afterhours 开发者之夜,并做闪电演讲与演示,分享大规模交付智能体工作流的经验,同场还有 CAMEL-AI、Continua、Model OS 和 Atlas Cloud。
ChatGPT 在网页和移动端更新定时任务功能:Plus 和 Pro 用户现在可以让任务在 Slack、Gmail 和 GitHub 内容发生变化时触发响应,而不只是按固定时间表运行。定时任务同时向 Free 用户开放,后者最多可创建三个任务。用户还可以分享自己常用的任务,供他人自行调整使用。
Elastic{ON} 将于 2026 年 9 月 30 日首次在孟买举办,地点为 JW Marriott Mumbai Sahar,聚焦搜索、全栈可观测性与安全。Elastic 将展示 Elasticsearch Platform 如何作为智能体 AI 的上下文引擎,结合语义搜索与上下文工程,让 AI 在搜索、安全、可观测性场景中可审计、可落地。议程含主题演讲与产品更新、全栈可观测性深度专场。
Latent.Space 与 @realbasilchatha 合作推出新的 Forward Deployed Engineering 播客栏目。
吴恩达(Andrew Ng)发布 AI 工程技能图谱(AI Engineering Skills Map)第一支柱"构建与部署 AI 应用",涵盖 LLM 基础、用数据为模型提供依据、构建智能体系统、评估驱动开发、生产环境运维和机器学习基础六个方向。
Gemini macOS 应用新增语音输入能力,可在任意窗口内直接听写、总结文件和改写文案。该功能由 Gemini 应用提供,适用于 macOS 平台。
Vercel Connect 已正式 GA,开发者可通过 @vercel/connect/ai-sdk 将 AI SDK 智能体安全接入 MCP 服务器。该服务为应用和智能体提供对 Slack、Linear、GitHub 等 100 多项服务的受控访问,支持短期作用域访问 token、token 与触发可观测性、RBAC 和审计日志。
Vercel Connect 正式 GA,可在 v0 中直接使用,让应用和智能体安全接入 Slack、Linear、GitHub 等 100 多项服务。该服务提供短期作用域访问 token、token 与触发器的可观测性,以及 RBAC 和审计日志。
bolt.new 分享了一组提示词示例:让 AI 生成使用 globe.gl 的夜间地球可交互 3D 模型,并在主要城市之间绘制动画飞行弧线,随后再用提示词创建招聘页面并把刚做好的 3D 地球融入页面设计。
LiveAvatar 取消并发限制,不再是提高上限而是彻底移除,同一 API 可同时运行 1 个或 10000 个数字人。规模化使用下全身 1080p 输出低至每分钟 0.01 美元。有大规模需求的用户可通过 liveavatar.com/contact-sales 联系销售。
hermes 的记忆配置推荐选 mem0,内置的 MEMORY.md 和 USER.md 默认继续与其并行运行。mem0 提供三种模式:Mem0 Cloud、通过 Docker 自托管服务器,以及用自有 LLM、embedder 和向量库的完全开源进程内方案。
Ollama 模型库新增 granite 模型页面,地址为 ollama.com/library/granit…。该条目在社交平台获得 8 个点赞、7789 次浏览,暂无评论与转发。
OpenAI 在 Hot Chips 上公布了与 Broadcom 合作自研的推理芯片 Jalapeño,设计始于 2024 年中,约 16 个月完成流片,SemiAnalysis 受邀在其实验室用 InferenceX 实测该芯片。
SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片 Jalapeño,给出逐场景吞吐与能效对比及架构细节。
Qdrant 自 v1.13 起在自托管实例支持 GPU 加速 HNSW 索引,Qdrant Cloud 也在今年 4 月将其作为托管选项上线。GPU 擅长大规模并行处理,能同时写入大量 HNSW 图的节点与边,从而缓解切换嵌入模型时全量重建索引的耗时与成本。
京东科技蔡欣彤独立开发了端到端智能播客平台 Smart Podcast Platform,用户上传视频或音频后,由 AI 自动完成内容理解、音色设计、语音合成与专业混音,全程无需人工干预。
Gemma 4 家族还带有 MTP drafters,采用专门的投机解码架构,最高可实现 3 倍提速。相关细节来自 Google 的一篇博客文章,另有 Leonie 整理的投机解码学习笔记可供参考。
用 176 万条 Cohere 嵌入的 MS MARCO 向量、13 种优化器配置实测 Qdrant 搜索延迟:持续建索引期间排空中位延迟 780 ms、p95 2.0 s,索引完成后中位延迟降 180 倍至 4.3 ms。
Antigravity 现已内置终端和版本控制支持,官方称这项功能"早就该有"。团队表示将继续为开发者优化使用体验。
Ollama 宣布其 token 用量正爆发式增长,并称更好的模型、更多应用与 harness 选择以及全私有化部署是推动因素。官方表示这只是一切的开始,将继续保持这一破纪录势头,并对即将到来的众多模型表示期待。
Mistral 宣布与 HUMAIN 建立战略合作,覆盖 AI 基础设施、先进模型开发和 AI 解决方案在沙特及中东地区的部署。双方将共同开发本地化前沿 AI 模型,初期聚焦网络安全、语音以及在阿拉伯语上表现强劲的模型。
Groq 宣布将跻身 NVIDIA Groq 3 LPX 的首批采用者,并与 Dell Technologies 合作部署该芯片,同时搭配 NVIDIA Vera Rubin NVL72,落地其专为 AI 推理打造的云。
Stack Overflow 的 AI 采用与信任调查显示,84% 受访者正在使用或计划使用 AI 工具,但不信任 AI 准确性的开发者多于信任的开发者,最常见困扰是输出看似正确却需要额外调试。
Qdrant 的混合搜索对同一 query 同时跑 dense 和 sparse 检索,再用 RRF 或 DBSF 融合两份候选列表,前者只看向量排名、后者按平均分与分数分布重新缩放。