跳到正文

全部动态

今日 38 条
6月30日周二
  1. UX MagazineAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    提示词就是新的设计简报:UX × AI 系列第二部分

    UX × AI 系列第二篇提出"提示词就是新的设计简报",认为写 prompt 并非新技能,而是设计师早已掌握的设计简报写作能力在新界面的应用。文章指出优秀简报与有效 prompt 共享四大要素:目标、受众、约束与上下文,提示词本质是沟通与设计能力,而非来自软件开发的"提示词工程"这类技术技能。

6月29日周一
  1. HelloGitHubAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 123 期:llmfit、tolaria、text-to-cad 等 31 个开源项目

    HelloGitHub 第 123 期推荐 31 个开源项目,包括一条命令检测本机硬件并推荐可本地运行模型的 Rust 工具 llmfit,以及基于 Git 的 Markdown 知识库工具 tolaria,内置 MCP 服务器可让 Claude Code、Codex 直接读写。

6月27日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用开源工具和开放权重模型搭建本地编码智能体

    Sebastian Raschka 发布教程,讲解如何用 Ollama 服务本地 LLM 并接入 Qwen-Code、Codex、Claude Code 等编码智能体 harness。

6月26日周五
  1. Lilian Weng(@lilianweng)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 发布关于 Scaling Laws 的长文

    Lilian Weng 发布了一篇拖延 3 年多的 Scaling Laws 长文,探讨如何在投入大规模训练前推理数据与模型规模之间的最优算力分配。文章涵盖 Scaling Laws 的预测内容、算力最优分配的工作机制、Kaplan et al. 与 Chinchilla 结论分歧的原因,以及数据上限与拟合细节如何让外推变得困难。

  2. QdrantAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 教程:用查询分解处理多跳问题

    Qdrant 发布教程,介绍用查询分解(Query Decomposition)处理多跳问题:先检索原问题,由 LLM 读取结果并生成下一个子问题,循环检索直到补齐缺失事实,再融合各跳结果。该方案基于 Self-Ask 与 IRCoT,用 gpt-5-mini 生成子问题,并用 Reciprocal Rank Fusion(k=2)合并各跳结果。

6月25日周四
  1. Hugging Face(@huggingface)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    欢迎来到开源 AI:在本地运行你自己的模型

    Hugging Face 发布"Welcome to Open Source AI: Run Your Own Models Locally",主题是在本地运行开源 AI 模型,内容以 X 平台直播形式呈现。该帖获得 346 次点赞、55 次转发和约 5.1 万次浏览。

6月24日周三
  1. Modal BlogAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal Auto Endpoints 如何用投机解码实现 SOTA 推理延迟

    Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。

  2. QdrantAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 研究:不调用 LLM 如何预测弱检索

    Qdrant 提出用廉价信号在检索路径上提前识别弱检索,避免为每个查询都调用 LLM 判断。这些信号读取检索器已返回的结果,至多增加一次复用查询向量的 Qdrant 查询,包括 max_score、dense_variance、evidence_coverage、retriever_divergence 和 dense_agreement 等。

6月23日周二
  1. MongoDB BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB 提出 Agentic AI 四步信任框架:从 POC 走向生产

    MongoDB 提出一套从 POC 走向生产的 Agentic AI 四步信任框架,涵盖基础层、验证层、治理层等环节。框架以客户退款为例,用 RAG 和运行数据减少模型幻觉,并将可观测性作为"黑匣子记录仪"记录每一步推理、工具调用与 token 开销。验证层引入 Agent 置信度分数(ACS)与业务风险分数(BRS),治理层则用 ADS = ACS x (1 - BRS) 决定智能体的自主程度。

6月22日周一
  1. Modal BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 解析沙箱启动延迟:为何 Started ≠ Ready,并推出 Readiness Probes

    Modal 指出多数沙箱基准只测容器调度与启动的 time to interactive,但生产环境中复制 repo、安装依赖等应用层初始化才占用户等待的大头。

6月19日周五
  1. Augment Code(@augmentcode)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数千活跃用户的生产系统上线的几个实现,均未引发事故

    有几个实现就是这样上线到生产环境的,均运行在拥有数千活跃用户的系统上,且没有一个引发事故。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达新课:用 VocalBridge 为 AI 智能体加上语音能力

    吴恩达推出新课,教你用 VocalBridge 为 AI 智能体与应用添加语音,兼顾可靠性与速度。课程包含三类应用:语音命令与鼠标点击共用单通道的语音互动游戏、约 10 行代码就能为现有智能体加语音且不改动提示词或工具、以及用 make_phone_call 函数发起外呼电话的智能体。课程还教授外呼与实时转录、语音评估打分与回归检测。

6月18日周四
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 分享向量数据库数据导入最佳实践:批处理限流、幂等重试与 blobHash

    Weaviate 针对向量数据库试点常在数据导入阶段就失败的问题,给出几条最佳实践:服务端 collection.batch.stream 自动设定导入速率,无需调 batch size;用确定性 UUID 实现幂等重试,避免重复写入和重复计费;blobHash 只保留对象嵌入向量、丢弃已另存的大对象,可从 10 TB 降到几 GB 且搜索质量不变。

6月16日周二
  1. Smashing MagazineAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如何放大设计中的概率思维:Air Canada 聊天机器人案例与产品设计指南

    Air Canada 聊天机器人曾给出不存在的丧亲票价退款政策,航空公司拒绝兑现后被裁定败诉,暴露了把 AI 预测当作事实的风险。文章主张设计师应以概率思维看待 AI 输出——它们是信号而非结论,并可用结构化提示词在产品设计前模拟结果,但模拟不能替代真实实验,因为模型基于历史数据,往往反映过去行为而非预测未来变化。

6月13日周六
  1. Alex Albert(@alexalbert__)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Fable 提示词指南

    Anthropic 的 Alex Albert 分享了 Fable 提示词指南中的一条技巧,指南还包含更多使用 Fable 的提示词方法。完整指南可在 platform.claude.com 的构建文档中查看。

  2. Alex Albert(@alexalbert__)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 分享让 Fable 在长对话中写得更清晰的提示词

    Alex Albert 称 Fable 在长时间智能体对话中表现"超人",有时快到他跟不上。他分享了一段提示词片段,用于让 Fable 写得更清楚、去掉术语行话,并称这是目前找到的最好解决办法。

6月11日周四
  1. Richard Socher(@RichardSocher)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher:更快训练达到同等质量

    Richard Socher 提出"更快训练达到同等质量"(Faster training to the same quality),该帖获 36 次点赞、8905 次浏览。原文未披露具体模型、参数或速度倍数等细节。

  2. Modal BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何让 FlashAttention-4 更适合 LLM 推理

    Modal 对 FlashAttention-4 内核做了一系列改动,使其更适合大语言模型推理,尤其是 decode 密集的负载。团队将优化归为两类:调整并行策略(如把 split KV 技术移植到 FA4、从 query 并行转向 key/value 并行),以及支持不规则全局内存访问(用 cp.async 取代基于 TMA 的 cp.async.bulk)。

  3. 通义大模型AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让 Qwen3-VL 在手机起飞:MNN 开启 SME2 端侧提速 80%

    阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。

6月10日周三
  1. Smashing MagazineAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    认知障碍用户在 UX 研究中能发现更多可用性问题吗?

    Fable 与加州大学尔湾分校合作开展认知可用性研究,招募 30 名被试(10 人/网站,认知障碍与普通用户各半),在三个 AI 生成的网站上完成预约、购物车、食谱检索等任务并填写 Accessible Usability Scale(AUS)问卷。研究通过录像与转录统计每位被试提出的问题与改进建议,以验证认知障碍测试者能否比普通用户发现更多可用性洞察。

  2. Alex Albert(@alexalbert__)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 分享 Fable 使用四条建议并重置各产品用量限制

    Anthropic 的 Alex Albert 表示已重置旗下各产品的用量限制,并为刚开始测试 Fable 的用户给出四条使用建议。

6月9日周二
  1. 硬地骇客AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Skills 到自动化工作流:Agent 如何接管真实生产力

    硬地骇客 EP127 讨论了从 Claude Code、Codex 到 OpenClaw,哪些 Skills 真正改变了工作流,并分析 GrillMe、TDD、Playwright、Computer Use 等热门 Skills 解决的具体问题。节目还覆盖知识管理、投资研究、邮件处理等 Coding 之外的场景,以及自定义 Skill 的开发与自动化沉淀,探讨如何让 Agent 成为个人数字分身。

  2. 通义大模型AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室用 Qwen3.7-Max 只凭一份文档从 0 交付双端应用

    通义实验室与 Efflora 团队基于 Qwen3.7-Max 做了一场实验,仅给一份约 15 万字的产品调研文档,就在隔离环境中从 0 交付移动端和 Web 端两套可运行应用,单端约 4 个多小时全自动完成。

6月5日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 与 Red Hat 推出高效 LLM 服务新课,教你用 vLLM 与量化应对高并发

    Andrew Ng 联合 Red Hat 推出高效 LLM 服务短课程,由 cedricclyburn 主讲。课程教你用量化压缩模型显存占用,并用 vLLM 通过智能内存管理高效处理大量并发请求,还将对部署进行基准测试,在速度、成本与精度间做权衡。70B 参数模型仅加载权重就需约 140 GB 显存,每个活跃请求还需独立的 KV cache。

6月3日周三
  1. Smashing MagazineAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让设计系统适配 AI:Atlassian 的 spec files 与 FigmaLint 实践指南

    让 AI 生成的原型更稳定,关键在于把设计决策当作基础设施,写入供 AI 读取的 Markdown spec files,并配合 token 层与审计脚本约束硬编码值。文中推荐的免费 Figma 插件 FigmaLint 可审计 token、状态、无障碍与硬编码值。Atlassian、Carbon、CMS、Nordhealth 等已给出 AI-Ready 设计系统示例。

6月1日周一
  1. 强少来了AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.169(2026.06.01):Codex国内也能畅快用,亲测有效

    有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。

  2. Modal BlogAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 发布开源库 Modal Dojo,将 RL 后训练基础设施抽象为百行代码

    Modal 发布实验性开源库 Modal Dojo,让用户在 100 行以内代码中定义训练任务,只需配置奖励函数、模型和环境。Modal 表示 RL 后训练的瓶颈在基础设施,训练器与 rollout 引擎间的权重同步是主要开销,同集群内 RDMA 传输可将训练速度提升 100 倍,其 Sandbox 可每秒启动数千个、并发维持上百万个。

5月29日周五
  1. cat(@_catwu)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code 动态工作流并行清查数百个 A/B 测试 flag

    有人用 Claude Code 的动态工作流并行排查公司数百个 A/B 测试 flag,找出已全量(100%)或从未放量(0%)的陈旧项以便下架清理,整个过程耗时不到 10 分钟,而顺序逐个调查则需等待 Claude Code 依次处理。

5月28日周四
  1. HelloGitHubAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 122 期:DeepSeek 专用推理引擎 ds4 等 30 个开源项目

    Redis 作者用 C 语言为 DeepSeek-V4-Flash 打造了本地推理引擎 ds4,支持 Metal、CUDA 加速、2-bit 量化和 HTTP API,并非简单的 GGUF 运行工具。

5月27日周三
  1. Martin Fowler(@martinfowler)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Birgitta Böckeler 谈测试套件作为编码智能体的回归传感器

    Birgitta Böckeler 在 martinfowler.com 发文,探讨传感器在编码智能体中的作用,重点分析测试套件如何充当回归传感器,以及变异测试(mutation testing)能在其中扮演的角色。

  2. Martin Fowler(@martinfowler)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 团队分享 vibe coding 安全实践:四位同事的经验

    Martin Fowler 的四位同事在 martinfowler.com 发文,分享将良好安全实践应用到 vibe coding 中的亲身经验。文章以多人经验合集的形式呈现。

  3. 哔哩哔哩技术AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩如何用 A2UI + Vue 让大模型生成可交互界面

    哔哩哔哩商业广告团队基于 Google A2UI 协议自研 Vue 渲染器和 Agent 工具链,让 AI 助手从 Markdown 文本输出升级为生成可交互 UI。方案包含 Runtime Schema 装配、结构与过渡双重校验、SSE 双通道输出,并以 npm 包形式交付 SDK,业务方三步即可接入,新场景接入周期从天级缩短到小时级。

  4. Eugene YanAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 LLM 保障源代码安全:从威胁建模到漏洞修复

    用 LLM 保障源代码安全需要走完一条完整流程:建立威胁模型、发现漏洞、验证、分类定级,最后完成补丁修复。

5月25日周一
  1. 强少来了AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.168:Codex团队使用SOP

    Codex团队发布了一份使用SOP,将可复用的项目上下文结构化为OpenSpec记录、高频复杂操作封装为Superpowers,并通过Codex自动化和验证执行过程,适用于开发、产品、测试、设计等多个业务团队。同期刊物还收录了Codex官方团队分享的持久对话流、语音输入、任务干预与排队等进阶用法,以及得物基于Harness工程的Claude Code数仓落地方案。

5月21日周四
  1. QdrantAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sunny Health 如何用 Qdrant 打造 AI 医疗礼宾服务

    Sunny Health 基于 Qdrant 构建 AI 医疗礼宾服务,通过支付方或护理机构的 SSO 登录,为会员完成福利导航、网络内医生匹配和预约挂号三项任务。其检索层需在 300 万到 400 万条医生数据上同时执行硬性过滤(网络内、执照、语言)与语义相似度排序,因此从 Postgres 迁移到 Qdrant 向量搜索,并采用 Rust 客户端和 MCP 工具辅助开发。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达新课:构建能生成图像和视频的 AI 智能体

    吴恩达联合 Google Cloud Tech 推出新课,教你构建生成图像和视频的 AI 智能体,核心是让智能体自我评估输出并迭代提升质量。课程讲解三种评估技术:图文相似度评分校验输出与提示词是否匹配、LLM 裁判按品牌一致性等自定义标准打分、结构化量规把提示词拆成"主体是否在画面内"等可验证的 yes/no 问题。

5月20日周三
  1. 宝玉的分享AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 官方团队分享如何把 Codex 用到极致

    Codex 官方团队的 jason(@jxnlco)分享了把 Codex 用到极致的组合用法,核心是从写代码延伸到终端命令、浏览网页、调用 API 等各类电脑工作。

  2. Martin Fowler(@martinfowler)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 博客:Birgitta Böckeler 谈 agent harness 中的传感器与静态代码检查

    Birgitta Böckeler 在 Martin Fowler 博客发文,记录她在 agent harness 中使用传感器的经验。文章第一部分聚焦静态分析,从基础代码 linting 入手。

5月16日周六
  1. 宝玉的分享AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    创始人手册:2026 年如何打造 AI 原生初创公司

    Anthropic 发布《创始人手册》,按构思、MVP、发布、扩展四阶段梳理 2026 年 AI 原生初创公司的做法:创始人变成指挥 AI 智能体的角色,用 Claude 的 Chat、Claude Cowork 和 Claude Code 完成研究调研、智能体编程与流程自动化。

5月15日周五
  1. 哔哩哔哩技术AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩 bili-fe-workflow:从 prompt 工程到 Harness Engineering 的智能开发工作流实践

    哔哩哔哩技术团队将 prompt 工程演进为 Harness Engineering,做出一系列智能开发工作流,让 AI 执行跨越整个研发生命周期的长任务。该工作流以 `.workflow` 结构化项目知识库为基础,包含 workflow-init、knowledge-update、prd-preprocess 等命令,并分成视觉驱动的 D2C 与逻辑驱动的 Dev 两条 Skill 路径。