跳到正文

#教程/实践

今日 37 条
7月7日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Birgitta Böckeler 实测本地 LLM 跑编程任务,梳理影响可行性的因素

    Birgitta Böckeler 近期实测用本地 LLM 完成部分编程任务,并梳理出影响其可行性的多项因素。相关备忘已发布在 martinfowler.com。

  2. AI炼金术AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    徐文浩拆解做大项目的 Harness 设计:纯 Vibe Coding 做大项目一定会塌

    播客「AI 炼金术」中,徐文浩分享做大项目的 Harness 设计,认为纯 vibe coding 做大项目一定会塌掉,但不该得出 AI 没用的结论,而是要靠一整套基建管理复杂度并持续迭代。

7月6日周一
  1. 李继刚AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    人生周报v080:Bayes,一本统计学书与语言模型式笔记系统

    李继刚「人生周报v080」以 Bayes 为主题,推荐日本作者所写的《统计学关我什么事》,并用先验、似然比、后验五步取景框分析问题。文中还提出「语言是一种技术」、把进化论引入笔记系统让笔记每天繁衍变异,并分享生成 PPT 的 skill /ljg-present。

  2. 宝玉的分享AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 团队详解智能体循环的四种类型

    Claude Code 团队把“循环”定义为 AI 智能体不断重复执行工作周期直到满足预设停止条件,并按触发方式、停止条件、所用基础指令和适配任务四个维度分类。

  3. cat(@_catwu)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有哪些 Claude Code + workflows + artifacts 的用法?分享一个候选人搜寻的工作流

    有用户分享用 Claude Code 搭配 workflows 和 artifacts 搜寻候选人的用法:向 Claude Code 描述职位与目标背景,让它启动动态工作流找出 100 名候选人,并为每人附上 LinkedIn、Twitter、博客、播客及一句话简介,再生成 artifact 邮件发送,随后可在离开电脑后随时查看结果。

7月4日周六
  1. cat(@_catwu)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code 的 computer use 自动配置 Claude Tag

    有用户提示,可让 Claude Code 借助 computer use 功能自动完成 Claude Tag 的配置:只需把它指向 Claude Tag 文档,它就会为团队接入 GitHub 仓库、数据仓库、Google Drive 及其他数据源。

7月2日周四
  1. Smashing MagazineAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 AI 模态匹配用户意图:如何设计正确的交互界面

    LLM 基于对话训练导致行业把所有 AI 能力塞进聊天框,但文本输入与输出各有代价:空白输入框让用户猜能力、须把模糊想法翻译成精确提示词,长文本回复则把解读负担转嫁给用户。文章提出用任务审计和输入/输出对齐矩阵两种工具,按用户当下意图匹配模态。

  2. QdrantAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 如何实现分支感知的语义代码搜索

    Qdrant 提出分支感知的语义代码搜索方法,用向量索引按语义检索代码,并让每次查询只作用于某一分支的实时视图:包含该分支自身的提交及其从祖先继承的内容,排除后续提交已替换的版本。

6月30日周二
  1. UX MagazineAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    提示词就是新的设计简报:UX × AI 系列第二部分

    UX × AI 系列第二篇提出"提示词就是新的设计简报",认为写 prompt 并非新技能,而是设计师早已掌握的设计简报写作能力在新界面的应用。文章指出优秀简报与有效 prompt 共享四大要素:目标、受众、约束与上下文,提示词本质是沟通与设计能力,而非来自软件开发的"提示词工程"这类技术技能。

6月29日周一
  1. HelloGitHubAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 123 期:llmfit、tolaria、text-to-cad 等 31 个开源项目

    HelloGitHub 第 123 期推荐 31 个开源项目,包括一条命令检测本机硬件并推荐可本地运行模型的 Rust 工具 llmfit,以及基于 Git 的 Markdown 知识库工具 tolaria,内置 MCP 服务器可让 Claude Code、Codex 直接读写。

6月27日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用开源工具和开放权重模型搭建本地编码智能体

    Sebastian Raschka 发布教程,讲解如何用 Ollama 服务本地 LLM 并接入 Qwen-Code、Codex、Claude Code 等编码智能体 harness。

6月26日周五
  1. Lilian Weng(@lilianweng)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 发布关于 Scaling Laws 的长文

    Lilian Weng 发布了一篇拖延 3 年多的 Scaling Laws 长文,探讨如何在投入大规模训练前推理数据与模型规模之间的最优算力分配。文章涵盖 Scaling Laws 的预测内容、算力最优分配的工作机制、Kaplan et al. 与 Chinchilla 结论分歧的原因,以及数据上限与拟合细节如何让外推变得困难。

  2. QdrantAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 教程:用查询分解处理多跳问题

    Qdrant 发布教程,介绍用查询分解(Query Decomposition)处理多跳问题:先检索原问题,由 LLM 读取结果并生成下一个子问题,循环检索直到补齐缺失事实,再融合各跳结果。该方案基于 Self-Ask 与 IRCoT,用 gpt-5-mini 生成子问题,并用 Reciprocal Rank Fusion(k=2)合并各跳结果。

6月25日周四
  1. Hugging Face(@huggingface)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    欢迎来到开源 AI:在本地运行你自己的模型

    Hugging Face 发布"Welcome to Open Source AI: Run Your Own Models Locally",主题是在本地运行开源 AI 模型,内容以 X 平台直播形式呈现。该帖获得 346 次点赞、55 次转发和约 5.1 万次浏览。

6月24日周三
  1. Modal BlogAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal Auto Endpoints 如何用投机解码实现 SOTA 推理延迟

    Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。

  2. QdrantAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 研究:不调用 LLM 如何预测弱检索

    Qdrant 提出用廉价信号在检索路径上提前识别弱检索,避免为每个查询都调用 LLM 判断。这些信号读取检索器已返回的结果,至多增加一次复用查询向量的 Qdrant 查询,包括 max_score、dense_variance、evidence_coverage、retriever_divergence 和 dense_agreement 等。

6月23日周二
  1. MongoDB BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB 提出 Agentic AI 四步信任框架:从 POC 走向生产

    MongoDB 提出一套从 POC 走向生产的 Agentic AI 四步信任框架,涵盖基础层、验证层、治理层等环节。框架以客户退款为例,用 RAG 和运行数据减少模型幻觉,并将可观测性作为"黑匣子记录仪"记录每一步推理、工具调用与 token 开销。验证层引入 Agent 置信度分数(ACS)与业务风险分数(BRS),治理层则用 ADS = ACS x (1 - BRS) 决定智能体的自主程度。

6月22日周一
  1. Modal BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 解析沙箱启动延迟:为何 Started ≠ Ready,并推出 Readiness Probes

    Modal 指出多数沙箱基准只测容器调度与启动的 time to interactive,但生产环境中复制 repo、安装依赖等应用层初始化才占用户等待的大头。

6月19日周五
  1. Augment Code(@augmentcode)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数千活跃用户的生产系统上线的几个实现,均未引发事故

    有几个实现就是这样上线到生产环境的,均运行在拥有数千活跃用户的系统上,且没有一个引发事故。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达新课:用 VocalBridge 为 AI 智能体加上语音能力

    吴恩达推出新课,教你用 VocalBridge 为 AI 智能体与应用添加语音,兼顾可靠性与速度。课程包含三类应用:语音命令与鼠标点击共用单通道的语音互动游戏、约 10 行代码就能为现有智能体加语音且不改动提示词或工具、以及用 make_phone_call 函数发起外呼电话的智能体。课程还教授外呼与实时转录、语音评估打分与回归检测。

6月18日周四
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 分享向量数据库数据导入最佳实践:批处理限流、幂等重试与 blobHash

    Weaviate 针对向量数据库试点常在数据导入阶段就失败的问题,给出几条最佳实践:服务端 collection.batch.stream 自动设定导入速率,无需调 batch size;用确定性 UUID 实现幂等重试,避免重复写入和重复计费;blobHash 只保留对象嵌入向量、丢弃已另存的大对象,可从 10 TB 降到几 GB 且搜索质量不变。

  2. Jim Fan(@DrJimFan)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 揭秘 Physical AutoResearch 幕后:ENPIRE 如何让 8 台机器人无人值守过夜

    Jim Fan 披露 Physical AutoResearch 的幕后工程:ENPIRE 让 8 台机器人整夜无人值守运行,通过硬运动学限制与力矩受限柔性夹爪两层机制保障安全。系统在 AutoResearch 前冻结奖励函数,并用机器人秒、GPU 秒、token 三类遥测(如 MRU、MTU)让 ENPIRE 实时感知资源,避免盲目爬山。

6月16日周二
  1. Smashing MagazineAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如何放大设计中的概率思维:Air Canada 聊天机器人案例与产品设计指南

    Air Canada 聊天机器人曾给出不存在的丧亲票价退款政策,航空公司拒绝兑现后被裁定败诉,暴露了把 AI 预测当作事实的风险。文章主张设计师应以概率思维看待 AI 输出——它们是信号而非结论,并可用结构化提示词在产品设计前模拟结果,但模拟不能替代真实实验,因为模型基于历史数据,往往反映过去行为而非预测未来变化。

6月13日周六
  1. Alex Albert(@alexalbert__)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Fable 提示词指南

    Anthropic 的 Alex Albert 分享了 Fable 提示词指南中的一条技巧,指南还包含更多使用 Fable 的提示词方法。完整指南可在 platform.claude.com 的构建文档中查看。

  2. Alex Albert(@alexalbert__)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 分享让 Fable 在长对话中写得更清晰的提示词

    Alex Albert 称 Fable 在长时间智能体对话中表现"超人",有时快到他跟不上。他分享了一段提示词片段,用于让 Fable 写得更清楚、去掉术语行话,并称这是目前找到的最好解决办法。

6月11日周四
  1. Richard Socher(@RichardSocher)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher:更快训练达到同等质量

    Richard Socher 提出"更快训练达到同等质量"(Faster training to the same quality),该帖获 36 次点赞、8905 次浏览。原文未披露具体模型、参数或速度倍数等细节。

  2. Modal BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何让 FlashAttention-4 更适合 LLM 推理

    Modal 对 FlashAttention-4 内核做了一系列改动,使其更适合大语言模型推理,尤其是 decode 密集的负载。团队将优化归为两类:调整并行策略(如把 split KV 技术移植到 FA4、从 query 并行转向 key/value 并行),以及支持不规则全局内存访问(用 cp.async 取代基于 TMA 的 cp.async.bulk)。

  3. 通义大模型AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让 Qwen3-VL 在手机起飞:MNN 开启 SME2 端侧提速 80%

    阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。

6月10日周三
  1. Smashing MagazineAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    认知障碍用户在 UX 研究中能发现更多可用性问题吗?

    Fable 与加州大学尔湾分校合作开展认知可用性研究,招募 30 名被试(10 人/网站,认知障碍与普通用户各半),在三个 AI 生成的网站上完成预约、购物车、食谱检索等任务并填写 Accessible Usability Scale(AUS)问卷。研究通过录像与转录统计每位被试提出的问题与改进建议,以验证认知障碍测试者能否比普通用户发现更多可用性洞察。

6月9日周二
  1. 硬地骇客AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Skills 到自动化工作流:Agent 如何接管真实生产力

    硬地骇客 EP127 讨论了从 Claude Code、Codex 到 OpenClaw,哪些 Skills 真正改变了工作流,并分析 GrillMe、TDD、Playwright、Computer Use 等热门 Skills 解决的具体问题。节目还覆盖知识管理、投资研究、邮件处理等 Coding 之外的场景,以及自定义 Skill 的开发与自动化沉淀,探讨如何让 Agent 成为个人数字分身。

  2. 通义大模型AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室用 Qwen3.7-Max 只凭一份文档从 0 交付双端应用

    通义实验室与 Efflora 团队基于 Qwen3.7-Max 做了一场实验,仅给一份约 15 万字的产品调研文档,就在隔离环境中从 0 交付移动端和 Web 端两套可运行应用,单端约 4 个多小时全自动完成。

6月5日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 与 Red Hat 推出高效 LLM 服务新课,教你用 vLLM 与量化应对高并发

    Andrew Ng 联合 Red Hat 推出高效 LLM 服务短课程,由 cedricclyburn 主讲。课程教你用量化压缩模型显存占用,并用 vLLM 通过智能内存管理高效处理大量并发请求,还将对部署进行基准测试,在速度、成本与精度间做权衡。70B 参数模型仅加载权重就需约 140 GB 显存,每个活跃请求还需独立的 KV cache。

6月3日周三
  1. Smashing MagazineAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让设计系统适配 AI:Atlassian 的 spec files 与 FigmaLint 实践指南

    让 AI 生成的原型更稳定,关键在于把设计决策当作基础设施,写入供 AI 读取的 Markdown spec files,并配合 token 层与审计脚本约束硬编码值。文中推荐的免费 Figma 插件 FigmaLint 可审计 token、状态、无障碍与硬编码值。Atlassian、Carbon、CMS、Nordhealth 等已给出 AI-Ready 设计系统示例。

6月1日周一
  1. 乱翻书AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    3000块成本、3.5亿次播放,AI短剧《安徽小木匠》怎么在抖音挣钱

    AI短剧《安徽小木匠》作者小果哥哥在播客中复盘,该剧制作成本不到3000元,播放量超过3.5亿次,收益50多万元。他介绍了从番茄小说选IP、用AI生成并拼接剧本、小云雀生成视频、重新拼接音画到抖音和红果上线分发的完整流程,并提到上线受益还涉及投流,从学习AI到剧集上线共19天。

  2. 强少来了AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.169(2026.06.01):Codex国内也能畅快用,亲测有效

    有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。

5月29日周五
  1. cat(@_catwu)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code 动态工作流并行清查数百个 A/B 测试 flag

    有人用 Claude Code 的动态工作流并行排查公司数百个 A/B 测试 flag,找出已全量(100%)或从未放量(0%)的陈旧项以便下架清理,整个过程耗时不到 10 分钟,而顺序逐个调查则需等待 Claude Code 依次处理。

5月27日周三
  1. Martin Fowler(@martinfowler)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Birgitta Böckeler 谈测试套件作为编码智能体的回归传感器

    Birgitta Böckeler 在 martinfowler.com 发文,探讨传感器在编码智能体中的作用,重点分析测试套件如何充当回归传感器,以及变异测试(mutation testing)能在其中扮演的角色。

  2. Martin Fowler(@martinfowler)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 团队分享 vibe coding 安全实践:四位同事的经验

    Martin Fowler 的四位同事在 martinfowler.com 发文,分享将良好安全实践应用到 vibe coding 中的亲身经验。文章以多人经验合集的形式呈现。

  3. 哔哩哔哩技术AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩如何用 A2UI + Vue 让大模型生成可交互界面

    哔哩哔哩商业广告团队基于 Google A2UI 协议自研 Vue 渲染器和 Agent 工具链,让 AI 助手从 Markdown 文本输出升级为生成可交互 UI。方案包含 Runtime Schema 装配、结构与过渡双重校验、SSE 双通道输出,并以 npm 包形式交付 SDK,业务方三步即可接入,新场景接入周期从天级缩短到小时级。

  4. Eugene YanAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 LLM 保障源代码安全:从威胁建模到漏洞修复

    用 LLM 保障源代码安全需要走完一条完整流程:建立威胁模型、发现漏洞、验证、分类定级,最后完成补丁修复。