AI时代进程内缓存怎么写spec?《AI时代的架构设计100讲》第8讲
架构师之路《AI时代的架构设计100讲》第8讲提出,进程内缓存应默认禁止、例外放行,并给出可直接复制的spec模板:模式声明、红线约束、异常与降级、验收标准四部分。原因是AI写代码时爱自作主张加本地Map“优化性能”,必须把默认禁止写进spec。仅三种场景放行:只读数据启动加载、极高峰挡流量、允许一定程度数据不一致。
架构师之路《AI时代的架构设计100讲》第8讲提出,进程内缓存应默认禁止、例外放行,并给出可直接复制的spec模板:模式声明、红线约束、异常与降级、验收标准四部分。原因是AI写代码时爱自作主张加本地Map“优化性能”,必须把默认禁止写进spec。仅三种场景放行:只读数据启动加载、极高峰挡流量、允许一定程度数据不一致。
Recraft 转发并公开了 @Abmankendrick 的一段写实人像提示词,描述一位二十多岁后期、深棕色长卷发的微笑女性,身穿中蓝色圆领卫衣、佩戴金色耳环。提示词指定了中性灰渐变影棚背景、左前方柔和漫射光、浅景深与 85mm 镜头,强调自然肤质与超高细节。
NVIDIA TensorRT Model Connect 是一个基于 TensorRT、用 C++ 编写的开源 AI 模型参考实现集合。项目以编码智能体为核心设计,采用并行开发、模型族隔离、可回滚改动和 GPU 验证等做法,目标是让 TensorRT 推理栈的性能更易被使用。
Julien Chaumond 推荐了 @0xSero 撰写的一份 DGX Spark 指南,该指南已在 Hugging Face 博客上线。原文未披露指南的具体内容、篇幅或技术细节。
Michele Catasta 分享了如何设计并构建 harness,以远低于常规的成本达到前沿性能。原文未披露具体模型、参数规模或 benchmark 数据。
NVIDIA 发布 Nemotron Labs 内容,介绍如何在 DGX Spark 与 DGX Station 上本地运行 Nemotron 模型。该内容面向本地部署场景,展示 Nemotron 在 NVIDIA 自有硬件上的运行方式。
作者冷逸演示了用 Coding 模型做视频的完整流程,底层逻辑是让 LLM 用 JavaScript 或 Three.js 写每一帧画面生成 HTML,经无头浏览器逐帧捕获后由 FFmpeg 编码成 MP4,全程在 Agent 内完成、不打开剪辑软件。
Claude Code 社区分享了一组实用技巧:从单机模式走向多人协作,多用 Artifacts 作为队友、其他线程和 subagent 的共享记忆上下文,只需让 Claude 把它做成 artifact 即可。用 `/eli5` 插件可让 Claude 用寥寥数语讲清全局,比读大段文字更有用。此外,真正的瓶颈是"未知的未知",解法是多尝试、多迭代以培养直觉与品味。
为给简单简历做 BOSS 直聘插件,用 ChatGPT 通过 CDP 操作 Chrome,或用 grok bot 云端操作,都会被网站直接打到空白页。作者称 GitHub 上的 loks666/get_jo 仓库及相关讨论让自己大开眼界,其中既有 AI 时代的各种巧思,也有针对自动化反制手段的干货讨论。
AWS 展示如何用 AG-UI 协议、Strands Agents SDK 的 Swarm 模式和 Amazon Nova Act 构建能随 AI 输出变化自动调整的界面。
阿里稳定性团队复盘 AI Native 研发转型:当后端、产品、设计师都能用 AI 写前端,代码能跑却难接手,于是把团队判断做成结构化规则包 Skill,并打包为 Claude Code Plugin「Anchor」。
美图设计室 PPT Skill 接入 WorkBuddy,用户把会议纪要 Word 草稿拖进对话框、附上参考图和提示词,即可直接生成完整的 8 页汇报 PPT,无需切换软件。生成结果按封面、目录、整体进度、模块进展组织,采用结论式标题与模块化内容并自动高亮重点数据,支持单页精准修改和一键跳转美图设计室画布做 3D 图标等微调。最终导出标准可编辑 PPTX 源文件,而非锁死的图片或 PDF。
在 Qdrant 中,文档经嵌入模型转为向量存储,用户查询也需转成同一向量空间的向量才能比对。问题在于更换嵌入模型通常意味着必须重新嵌入已有文档。
腾讯技术工程提出一套 Agent 自进化方法论,把评测、记忆、落地、控制四个环节作为同一闭环的四个齿轮,主张自进化的瓶颈不在单个技术点,而在环节之间的数据通路是否连通。
LlamaIndex 探索了 Jev 及同类模型在文档解析任务上的早期方案,涉及方向检测、语言检测、路由等任务。文档解析需要大量即时决策。
生产级 AI 应用仅靠模型版本无法保证可复现,检索、提示词、工具契约与推理服务配置都会独立改变行为。文章建议用版本化发布清单(含模型、提示词、索引、嵌入、运行时修订号)统一界定发布边界,并以覆盖端到端路径的评估门禁和经过演练的回滚路径作为 MLOps 起点。
Simon Willison 为其在圣何塞 Devs World Congress North America 所做主题演讲发布了详细笔记和注释版文字稿,梳理 2026 年至今 LLM 与智能体的全部进展,演讲于上周五进行。
Stack Overflow 博客总结团队的分层 human-in-the-loop 实践:Prediction Router 按置信度把决策分三层,Tier 1 自动验证处理约 85% 流量、延迟低于 3 毫秒,Tier 2 异步专家复核约 12% 案例、4 到 6 小时完成,Tier 3 约 3% 高风险场景实时人工介入并设 30 到 60 秒确认窗口。
Justine Moore 以 a16z 的 It's Time to Build 视频为参考,让 Claude 制作一支数据中心主题的类似短片,并让 Claude 复盘了自己的制作流程。
作者把自己的 SEO 文章写作流程做成了一个叫 content-gate 的 skill,用于让 AI 撰写 SEO 类文章。该 skill 基于 Google Search Central 官方文档的内容质量与合规指南,配有发布前 checklist 供 AI 自查,并提供双语本地化指南——按目标语言写作而非逐句翻译。项目已开源在 GitHub,作者已用它写过一部分文章。
实时查看 Agent 的每一个请求。该内容由 xgo.ing 提供支持,帖子获得 688 次浏览。
京东零售构建了以 Forge Agent 为统一 AI 门面、Sindri Plugin/MCP 为确定性工具、Sindri 后端负责规划与提交、ADF 承载 DAG 与调度生命周期的人工智能数据研发链路。
小红书直播用架构、性能、稳定性三套递进能力,在 3 周窗口内交付 40+ 世界杯需求,赛事期实现千万级 PCU 零事故。端到端进房成功率场均 99.5%+,三端异常退出率均低于万分之一,降级后 CPU 均值降幅接近 60%、温升降幅约 30%。全部赛事零事故,赛中调整全部通过配置完成、无需发版。
OpenShorts 是一个把长视频切片、AI UGC 生成与跨平台发布整合到同一后端和素材体系的开源项目,截至 2026 年 9 月 28 日约有 5700 Star、1300 Fork,核心应用采用 MIT License。
大淘宝商家财务团队用 Ontology 四层图谱(业务/系统/交付/治理)加 decision_function 结构化决策,替代预设 workflow 和打包 Skill,让 Agent 按"先取证、再决策、后行动"闭环动态生成流程,3 个月在 Agent Room 完成 120+ 需求与工作项,覆盖需求开发、工单处理、数据订正和业务运维。
Magpie 接入 DeepSeek 后 prompt 成本已压得很低,再叠加一层 RTK 过滤 Bash 工具输出的噪声,实测可省掉七成多的工具输出 token。两个省钱方向叠加后性价比明显提升。
优设整理了10个实用的去AI味Skill,覆盖提示词优化、AI痕迹检测、文本改写和文风塑造。机械句式、翻译腔和套话废话基本都能找到对应工具,公众号、小红书、口播稿和长文章可按问题直接选。在GitHub顶部搜索栏输入对应Skill名字即可获取。
针对每秒20w写、1k读的写多读少定长value场景,无锁缓存通过写入定长value加16bit CRC签名、读取时校验签名,签名不一致则返回NULL视为cache miss,以牺牲一致性换取零锁冲突。
作者整理了 GPT-Image 2.5 的 12 种照片编辑玩法,并给出可直接复制的提示词,涵盖消除背景游客、自动调光、专业美颜等基础修图。创意部分包括拍立得 3D 公仔、景点明信片、主体转贴纸、旅游碎片行李箱和人物旅游海报,网感部分包括演唱会氛围感、美食炸弹和指定物体转文字涂鸦、ins 风画面注释。
从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。
两条 SEO 技巧被分享:一是在 YouTube 拍 How-to 教程、产品对比、工具评测类视频,这类 video keyword 的搜索结果里 Google 常直接出视频卡,小频道视频有时能压过权威博客,种子词建议用产品真实使用场景而非硬广。
GitHub Copilot 桌面应用基于 React 与 Tauri 构建,为渲染 2000+ 文件、百万行改动的 PR,将代码行渲染放到 React 之外。
有开发者指出,这个技巧最实用的方向之一是 i18n 审核:不同语言字符长度不同很容易把界面搞乱,中文和英文的长度差异尤其明显,用这个技巧效果很好。
Viking 分享了一个设计与交互技巧:让 agent 往界面里塞各种 edge case,比如超长或超短文本、各种极端数字,观察 worst-case 布局表现,再对着截图做 UI review 并按问题清单修复。
Anthropic 开源 financial-services 仓库,提供面向投行、股票研究、私募股权、基金运营和财富管理的金融 Agent 参考实现,把金融工作拆成命名 Agent、垂直 Skills、MCP 数据连接器和 Managed Agent Cookbooks 四类可复用资产。
花叔基于 Anthropic 工程师复盘 claude.ai 与 Claude 桌面端两周提速约 3 倍的方法,整理出开源 skill「闪电.skill」,含 8 个步骤和测速、棘轮两个脚本,可通过 npx skills add alchaincyf/huashu-flash 安装。
Fireworks AI 发布新 cookbook(联合 HUD),让开发者无需自建基础设施即可在自己的任务上做 RL 训练。流程是在 HUD 中定义任务和 grader,再在 Fireworks 上采样并训练模型,同一环境同时用于训练和评估。
有人在社群里用一句提示词让 opus 5.5 基于 tokenrank 榜单的多维数据和参赛者信息直接生成一条爆款视频,目标受众是已付费用户。该视频全部由模型独立完成,一次生成成功,未做人工剪辑。
Viking 分享了 OpenClaw 自己使用的 test audit 技能(github.com/openclaw/openc…),其任务是告诉 agent 什么测试应该加、什么测试是垃圾不应该加,开始写测试时 agent 要先回答四个关于是否有必要加测试的问题,判断通过才加。
归藏(藏师傅)用 Opus 5.5 为 CodePilot 产品一键生成了一支产品宣传视频,称其在图像图形类前端表现突出,效果"吊打"他所说的 GPT-6 Astra。他表示后续会把相关经验沉淀进自己的 guizang-product-video-skilll,让较弱的模型也能获得不错的效果,并已就此展开 skill 测试。