跳到正文

#教程/实践

今日 37 条
5月25日周一
  1. 强少来了AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.168:Codex团队使用SOP

    Codex团队发布了一份使用SOP,将可复用的项目上下文结构化为OpenSpec记录、高频复杂操作封装为Superpowers,并通过Codex自动化和验证执行过程,适用于开发、产品、测试、设计等多个业务团队。同期刊物还收录了Codex官方团队分享的持久对话流、语音输入、任务干预与排队等进阶用法,以及得物基于Harness工程的Claude Code数仓落地方案。

5月21日周四
  1. QdrantAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sunny Health 如何用 Qdrant 打造 AI 医疗礼宾服务

    Sunny Health 基于 Qdrant 构建 AI 医疗礼宾服务,通过支付方或护理机构的 SSO 登录,为会员完成福利导航、网络内医生匹配和预约挂号三项任务。其检索层需在 300 万到 400 万条医生数据上同时执行硬性过滤(网络内、执照、语言)与语义相似度排序,因此从 Postgres 迁移到 Qdrant 向量搜索,并采用 Rust 客户端和 MCP 工具辅助开发。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达新课:构建能生成图像和视频的 AI 智能体

    吴恩达联合 Google Cloud Tech 推出新课,教你构建生成图像和视频的 AI 智能体,核心是让智能体自我评估输出并迭代提升质量。课程讲解三种评估技术:图文相似度评分校验输出与提示词是否匹配、LLM 裁判按品牌一致性等自定义标准打分、结构化量规把提示词拆成"主体是否在画面内"等可验证的 yes/no 问题。

5月20日周三
  1. 宝玉的分享AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 官方团队分享如何把 Codex 用到极致

    Codex 官方团队的 jason(@jxnlco)分享了把 Codex 用到极致的组合用法,核心是从写代码延伸到终端命令、浏览网页、调用 API 等各类电脑工作。

  2. Martin Fowler(@martinfowler)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 博客:Birgitta Böckeler 谈 agent harness 中的传感器与静态代码检查

    Birgitta Böckeler 在 Martin Fowler 博客发文,记录她在 agent harness 中使用传感器的经验。文章第一部分聚焦静态分析,从基础代码 linting 入手。

5月19日周二
  1. QdrantAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GoPerfect 如何用 Qdrant Cloud 打造智能体招聘团队

    GoPerfect 基于 Qdrant Cloud 搭建智能体招聘平台,用混合搜索、多向量表示加 LLM 编排,在内部基准中把候选人接受率从行业约 30% 提升到 99.993%,大客户实测稳定在 95–100%,约为行业基线的四倍。单个候选人不再用单一嵌入向量表示,而是拆成结构化向量集合,查询时由智能体拆分意图并并行发起多路子查询,复杂多条件搜索可在 10 秒内端到端完成。

5月17日周日
  1. 宝玉的分享AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么我不"凭感觉编程"

    资深开发者 Jacob Harris 撰文解释自己为何拒绝"凭感觉编程"(Vibe Coding)。他因不愿为 Token 持续付费而卸载集成 LLM 的 IDE、回归 Emacs,并认为 LLM 只能解决编写代码本身的"偶然复杂性",无法应对架构设计等"本质复杂性",且无法解释自身选择的路径。

5月16日周六
  1. 宝玉的分享AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    创始人手册:2026 年如何打造 AI 原生初创公司

    Anthropic 发布《创始人手册》,按构思、MVP、发布、扩展四阶段梳理 2026 年 AI 原生初创公司的做法:创始人变成指挥 AI 智能体的角色,用 Claude 的 Chat、Claude Cowork 和 Claude Code 完成研究调研、智能体编程与流程自动化。

5月15日周五
  1. 哔哩哔哩技术AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩 bili-fe-workflow:从 prompt 工程到 Harness Engineering 的智能开发工作流实践

    哔哩哔哩技术团队将 prompt 工程演进为 Harness Engineering,做出一系列智能开发工作流,让 AI 执行跨越整个研发生命周期的长任务。该工作流以 `.workflow` 结构化项目知识库为基础,包含 workflow-init、knowledge-update、prd-preprocess 等命令,并分成视觉驱动的 D2C 与逻辑驱动的 Dev 两条 Skill 路径。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 推出新课 Transformers in Practice,与 AMD 合作讲解 Transformer 推理

    Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。

5月14日周四
  1. Martin Fowler(@martinfowler)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler:用 LLM 访谈自己来生成大段上下文

    Martin Fowler 提出一种为 LLM 准备大量上下文的方法:与其自己动手写,不如让一个 LLM 来访谈自己,把访谈内容整理成可用上下文。相关文章发布在 martinfowler.com 的 Interrog 页面。

  2. UX MagazineAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Spiral Climbs:当设计转向系统,AI 与智能体如何重构产品工作流

    随着 UI 被商品化,竞争优势上移至问题定义、押注排序与结果负责,产品设计正从界面绘制转向系统、token 与代码。作者把 Miro、Figma、VS Code 配合 Codex 和 GitHub、Jira 串成一条从想法到上线的链路,并嵌入设计思维、系统思维与会议纪要三类智能体。

5月13日周三
  1. Smashing MagazineAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 透明度实用界面模式:如何用状态文案让智能体"思考"可见(第二部分)

    AI 智能体等待时间与下载延迟不同,二十秒的停顿是在思考和权衡方案,用 spinner 会让用户误以为卡死或崩溃。

  2. 硬地骇客AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硬地骇客 EP126:Agent Harness 为什么决定 AI 能否真正干活

    同一个模型放进 Claude Code、Codex、OpenCode 里就能读文件、改代码、跑测试,放进聊天框却只能给建议,差别在于 Agent Harness。这期播客把 Harness 定义为模型之外决定 AI 能否干活的工程系统,负责工具、权限、上下文、执行环境和结果验证,并讨论 AI Coding 作为大模型工程化练兵场,以及模型能力与 Harness 生态的未来演进。

5月12日周二
  1. Modal BlogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何实现真正的无服务器 GPU:把推理冷启动从 2 千秒压到 50 秒

    Modal 介绍其五年工程积累,通过云缓冲、自定义文件系统 ImageFS、CPU 检查点/恢复和 CUDA 检查点/恢复四项优化,把推理服务副本的启动时间从约 2 千秒降到约 50 秒。

  2. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sapu 如何用 Qdrant 索引 2800 万条 PubMed 摘要加速癌症研究

    Sapu 将 PubMed 全部 2800 万条摘要索引进单个 Qdrant collection,此前研究人员只能分批上传摘要子集查询。该平台采用 OpenAI text-embedding-3-large(3072 维)配合 LangChain 写入 Qdrant Cloud,并支持将 1000 篇文档拆成 1000 个独立并行查询。

  3. Andrej Karpathy(@karpathy)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:让 LLM 用 HTML 输出答案,比 markdown 更好用

    Andrej Karpathy 建议在提问末尾让 LLM「structure your response as HTML」,再把生成的文件用浏览器打开查看,效果很好,他也试过让模型以幻灯片等形式呈现输出。他认为 AI 输出正从原始文本、markdown 走向 HTML,最终可能演化为扩散神经网直接生成的交互式视频,同时输入端仍需加入指点、手势等交互方式。

5月11日周一
  1. QdrantAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 指南:如何衡量检索相关性

    Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。

5月10日周日
  1. 宝玉的分享AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解:AI Agent Harness 的构造

    本文拆解了包裹大语言模型的 Agent Harness 架构,涵盖编排循环、工具、记忆、上下文管理、状态持久化、错误处理和护栏等 12 个组件,并说明提示词工程、上下文工程与 Harness 工程三个层次的区别。

5月8日周五
  1. 宝玉的分享AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 团队谈为何用 HTML 替代 Markdown 作为输出格式

    Claude Code 团队成员 Thariq 提出用 HTML 取代 Markdown 作为 AI 智能体的输出格式,理由是 HTML 信息密度更高、支持表格与 SVG 图表、便于分享和双向交互。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 新课:用 CopilotKit 构建能生成图表、表单和白板的自定义 UI 智能体

    Andrew Ng 推出与 CopilotKit 合作的新短期课程,教你构建在聊天中按需生成图表、表单、白板等自定义 UI 的智能体。课程由 CopilotKit 联合创始人 @ataiiam 讲授,涵盖三种方法:从自建组件中挑选、用行/卡片/文本等积木组合新布局,以及把白板、日历等第三方应用嵌入对话。

5月6日周三
  1. Smashing MagazineAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地优先 Web 开发的架构:一位开发者的七年实践反思

    作者曾把本地优先视作学术概念而拒绝多年,如今已用该模式上线三款生产应用,也曾在两个项目中将其拆除。他澄清本地优先是数据架构而非 offline-first、PWA 或 service worker 缓存,其核心是用户设备持有主数据副本、服务端只作为带特殊权限的同步节点;同时指出数据分析面板、银行支付、简单 CRUD 和无离线协作需求的应用都不适合采用,并建议从一个功能开始渐进引入。

5月4日周一
  1. Modal BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 用单个 Python 字典将 SGLang 多模态推理性能提升超 10%

    Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。

5月3日周日
  1. Eugene YanAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何与 AI 协作并让成果持续累积

    Eugene Yan 总结自己与 AI 协作的方法,提出五条原则:提供好的上下文、把个人偏好编码成配置、让验证变简单、委派更大的任务、并闭环沉淀。具体做法包括把代码和知识库分层组织、为每个项目维护带注释的 INDEX.md、用 CLAUDE.md 当作行为契约并按目录分级加载、把高频操作做成按需加载的 skill,以及在会话中纠正输出而非直接改文件,让转录成为配置更新的输入。

5月1日周五
  1. Smashing MagazineAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何为流式内容设计稳定界面

    流式 UI 在内容生成过程中持续变化,带来三类问题:视口被强制固定在底部、新内容导致布局位移、渲染频率高于浏览器每秒约 60 次的刷新。文章用聊天气泡、日志流和实时指标三个演示复现这些问题,并提出用 60px 阈值标记用户是否主动上滚,仅在用户处于底部时恢复自动滚动。

  2. 张小珺Jùn|商业访谈录AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和苏煜聊 Agent 技术史:从 Logical Agent 到 Language Agent,以及 OpenClaw Moment

    俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。

  3. Andrew Ng(@AndrewYNg)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达推出新课《AI Prompting for Everyone》,讲授 ChatGPT、Gemini、Claude 通用提示技巧

    吴恩达开设新课程《AI Prompting for Everyone》,面向各水平用户,教授适用于 ChatGPT、Gemini、Claude 等 AI 工具的通用提示技能。课程涵盖深度研究模式、为 AI 提供充足上下文与文件图像、在买车择业等重要决策时让 AI 深度思考,以及生成图像、分析数据、搭建简单游戏和网站。他同时讲解模型底层直觉,帮助判断何时该信任回答。

4月29日周三
  1. Martin Fowler(@martinfowler)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 更新 AI 编程指南,并发布 harness engineering 视频等内容

    Martin Fowler 更新了 AI 编程指南,发布了一期关于 harness engineering 的视频,并讨论了函数应该多长、Software Brain 的问题以及 AI 为何不受欢迎。相关链接收录在其 Fragments 合集中。

  2. 哔哩哔哩技术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站基于NVIDIA开源驱动的GPU隔离方案:BGM内核模块如何做显存与算力隔离

    B站推出bilibili GPU Manager(BGM)内核模块,联动cgroup子系统与显卡驱动实现GPU显存和算力隔离。显存侧由cgroup配置limit、驱动获取假显存总量并按left判断分配;算力侧用cgroup配置的slice替换TSG默认时间片,从而控制单次调度上限、降低高优任务等待。该方案基于NVIDIA开源驱动做参数修正,替代MPS、MIG及CUDA劫持等黑盒方案。

  3. Modal BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 Modal 上构建基于强化学习的定理证明工作流

    AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。

  4. 宝玉的分享AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解 Hermes Agent 的记忆系统:它如何修正 OpenClaw 的误区

    Hermes Agent 采用四套记忆系统:MEMORY.md(2,200 字符)与 USER.md(1,375 字符)构成提示词记忆,session_search 调用 SQLite 历史会话存档,技能(Skills)充当程序记忆,另有可选的 Honcho 层做用户建模。

4月28日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thoughtworks 内部 IT 的智能体编程工作流 SPDD:结构化提示词驱动开发

    Thoughtworks 内部 IT 采用名为 Structured-Prompt-Driven Development(SPDD)的智能体编程工作流。Wei Zhang 和 Jessie Jie Xia 通过一个简单示例讲解其运作方式,并在 GitHub 项目中给出细节。

4月26日周日
  1. 纵横四海AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EP80《深度工作》:什么是AI时代最不能被取代的技能?

    纵横四海播客EP80围绕 Cal Newport 的《深度工作》与其新书《慢生产力》展开,讨论为什么在AI时代"深度"反而成为最昂贵、最不可替代的职业资本。节目援引微软职场报告探讨AI是否真在取代人类工作,并提出禁欲主义、双峰、节奏、新闻记者四种深度工作哲学,以及"第一勺冰淇淋原则"、可视化计分板等实践方法。

4月21日周二
  1. 硬地骇客AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硬地骇客 EP125:12 个问题搞懂 Vibe Coding 爆火真相

    播客「硬地骇客」EP125 中,三位主播 Saito、一啸、归归围绕独立开发者最焦虑的 12 个问题逐一解答,包括没收入怎么熬、有 idea 却停在纸上、产品没人用、AI 时代工程师该练什么能力,以及 Vibe Coding 爆火是否意味着人人都能做产品。他们结合做 Podwise 的真实经历给出解答,不鸡汤、不画饼。

4月20日周一
  1. 强少来了AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.167:我把 OpenAI Codex 官方案例全跑了一遍

    作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。

4月18日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sebastian Raschka 分享理解 LLM 架构的工作流

    Sebastian Raschka 公开了自己绘制 LLM 架构图的工作流:从官方技术报告入手,再直接查阅 Hugging Face Model Hub 上的 config 文件与 transformers 参考实现来补齐架构细节,因为近年论文对开源权重模型的描述常不如代码详细。该方法主要适用于开源权重模型,不适用于 ChatGPT、Claude、Gemini 等闭源模型,且刻意保持手动操作。

4月17日周五
  1. cat(@_catwu)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 提示技巧:把测试流程写进 claude.md 或加 /verify-app 技能,让模型自验改动

    让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。

4月16日周四
  1. Andrew Ng(@AndrewYNg)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 联手 JetBrains 推出 Spec-Driven Development with Coding Agents 课程

    Andrew Ng 与 JetBrains 合作推出短课程 Spec-Driven Development with Coding Agents,由 Paul Everitt 主讲。课程教授以详细规格文档定义需求、再让编码智能体据此实现的开发方式,可跨会话保留上下文并控制大型代码改动,工作流可打包为跨智能体与 IDE 的便携技能。

4月15日周三
  1. 宝玉的分享AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    使用 Claude Code:会话管理与 100 万上下文

    Anthropic 员工 Thariq 撰文讲解 Claude Code 的会话管理方法,围绕上下文窗口升级到 100 万 Token 后,如何在继续、回溯、清空(/clear)、压缩(/compact)和子智能体五种选择间做决策。

  2. Modal BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Modal 与 OpenAI Agents SDK 搭建自定义智能体框架

    Modal 发布教程,演示如何在 OpenAI Agents SDK 之上从零搭建自定义编码智能体框架,通过 SandboxAgent 和 ShellTool 把智能体放进带 GPU 的 Modal 沙箱中执行任务。