跳到正文

#教程/实践

今日 41 条
10月8日周四
  1. 掘金本周最热AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 写的小程序「厨菜记」上线 19 天开通流量主,累计 601 访客、收入几块钱

    全程由 AI 编写的小程序「厨菜记」9 月 18 日上线,19 天后累计独立访客 601、日均新增 30 人,是作者乐观预测上限的三倍,并已开通流量主。作者将预测失误归因于内容传播呈脉冲式,以及家庭内 2 到 4 人的裂变乘数。流量主开通两天累计收入几块钱,他只保留菜谱列表底部一个 Banner。

  2. freeCodeCamp.orgAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 CPU 上从零构建并训练 2500 万参数 LLM

    freeCodeCamp.org 发布一小时视频教程,演示在笔记本或普通 CPU 上从零构建、预训练并微调一个 2500 万参数语言模型。课程涵盖混合线性/稀疏注意力、MoE、绑定嵌入权重和多模态图像 patch 输入等现代架构,并搭建轻量 RL 循环让模型写代码、跑单元测试、拿奖励,任务成功率从 0% 提升到通过多数评测。教程还讲解如何形成可检验假设、调节温度与奖励结构并检查统计显著性。

  3. QdrantAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测 Jev:把通用分类器用在重排序、去重等任务上

    TypeSafe 推出的决策模型 Jev 经由 OpenRouter 提供服务,无需任务特定训练即可输出受限于候选标签的数值分数。

  4. cat(@_catwu)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 产品经理用法:生成上周功能使用 Top 10 用户 artifact 并约聊

    一位 PM 分享自己最常用的 Claude 用法:让 Claude 找出上周使用某功能最多的用户,生成按使用量排序的 Top 10 artifact,再自动联系这些人并安排 15 分钟交流。他称这是获取用户反馈最快的方式。

  5. 浮之静AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lencx 见闻汇总:Strata 本地推理引擎、ArtCraft 创作七件套与 Agent Memory Repo 等开源项目

    开源本地推理引擎 Strata 主打在消费级电脑上运行 1250 亿参数的 Qwen3.8-Flash-Next 量化版,通过量化、GPU 专家缓存和 CPU/GPU 协同推理降低显存门槛,RTX 5070(12 GB 显存)下 Q2_0 量化版短对话生成速度约 94 tokens/s。

  6. Stack Overflow BlogAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 系统的安全与治理:guardrail、PII、审计与记忆(第 4 部分)

    LLM 系统成熟度模型第 4 级聚焦安全与治理,要求用分层 guardrail 做纵深防御:从输入检查、grounding 约束、输出清洗到验证、judge 和第二模型置信度路由共 6 层,且必须 fail closed,任一层出错即阻断或升级。

  7. Stack Overflow BlogAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让 Agent 知道自己不知道:置信度层

    Stack Overflow 博客“Running LLM systems in production”系列第 3 篇,介绍六层成熟度模型中的 Level 3 置信度层。

  8. Stack Overflow BlogAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何把评测做成部署门禁并检测基线漂移

    Stack Overflow 博客的 LLM 生产系列 Level 2 讲解如何把评测当作 CI 门禁:用版本化 golden set 编写显式打分器,一条 CI 命令在通过率低于阈值时让构建失败,并按 slice 自动路由用例、逐 slice 设门槛。

  9. 技术前沿AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何将 dbt ETL 管道迁移到 Databricks

    把已在运行的 dbt 项目迁移到 Databricks 无需重写业务逻辑,只需更换 dbt-databricks 适配器和连接配置,再处理少数 SQL 方言差异。

  10. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用数字孪生和 AI 智能体验证 AI 工厂变更

    NVIDIA 提出用数字孪生与 AI 智能体验证 AI 工厂的变更:AI 工厂由 GPU、CPU、交换机、DPU 与 SuperNIC 组成,并叠加调度器、编排服务、安全控制和快速迭代的软件栈。这类基础设施、软件与策略是否能为目标负载协同工作,本身就难以验证。

  11. 大模型智能AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 TIS 到 score centering,重新理解 LLM RL 中的训推不一致

    文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。

10月7日周三
  1. AWS Machine Learning BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    超越节省的工时:如何为智能体自动化构建商业论证

    AWS 提出 Agentic Value Model 框架,用于替代 RPA 时代的 ROI 模型,衡量智能体自动化的四类价值:工时节省、异常处理、决策质量与变更韧性,并以价值实现机制决定收益能否落到 P&L。

  2. Milvus(@milvusio)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 如何用语义检索、BM25 与标量过滤帮师生找到对的那道题

    Milvus 提出一套五步架构,把语义检索、BM25 关键词搜索与标量过滤结合,用于在持续增长的题库中找题。

  3. 印记中文AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JavaScript 中文周刊 #256:为何我们常常重新发明浏览器已有的能力

    Nolan Lawson 撰文反思开发者为何不「用平台」原生能力、反复重新发明浏览器已有能力,该文在 Hacker News 引发广泛讨论。同期 Preact 11 历经六年正式发布,Nuxt 4.6 解耦 Nitro 并内置 session 支持,Claude Code 新增 Mods 扩展,允许用 JavaScript 监听事件、改变行为并绘制自定义 UI。

  4. Rowan Cheung(@rowancheung)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Rundown 社区工作流中心发布完整工作流与提示词

    The Rundown 的 Community Workflow Hub 上发布了一套完整工作流和配套提示词,作者在推文中给出了该帖子的直达链接。推文附带的数据显示该帖获得 6 条评论、8 个点赞、5832 次浏览。

  5. Rowan Cheung(@rowancheung)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT-6 Astra 搭建每日穿搭推荐应用

    有人用 GPT-6 Astra 做了一个每天早上根据实时天气挑选穿搭的应用,并把自己当作模特。流程是上传几张全身照和一张人脸照,填入身高、尺码和版型偏好,再列出喜欢与拒绝的颜色,粘贴主提示词后让它构建 1 到 2 小时。

  6. ByteByteGo NewsletterAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Netflix 如何训练 LLM 推荐电影以留住观众

    Netflix 工程团队构建了推荐系统 GenRec,用 LLM 理解用户观看历史并给内容库中的电影和剧集打分。GenRec 分两阶段训练:先用 Netflix 专有数据让开源基础模型熟悉内容与用户行为,再针对排序任务做后训练;用户点击、观看时长、点赞等行为被转成对话式样本来训练。

  7. DatawhaleAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 十月组队学习开放报名,首次开设 Jev 课程共 11 门

    Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。

  8. Qdrant(@qdrant_engine)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测 Google EmbeddingGemma 2:向量内存降 77 倍,保留 94.5% 检索质量

    Qdrant 提前拿到 Google EmbeddingGemma 2 并测试其 Matryoshka 兼容嵌入在 Qdrant 中可压缩到何种程度。通过更短向量、量化与重打分组合,向量内存占用降低约 77 倍,同时保留基线 94.5% 的检索质量。Google 在 EmbeddingGemma 2 发布公告中也提到了这项工作。

  9. 有机大橘子AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    分享一个自用的「播客转文章」Skill

    橘AI 发布开源 MIT 许可的「播客转文章」Skill,用于把播客逐字稿改写成文章。其核心做法是按话题而非时间线重新梳理内容,并规定数字和原话一条都不砍,只删掉与本节无关的段子、蹭新闻和举例。作者称实测阅读量与互动不错,用户反馈没有人吐槽 AI 味儿。

  10. 花叔AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    花叔开源 huashu-art-motion skill,用 Claude Code 把口播做成解说动画

    花叔把自己做艺术动画的方法整理成开源 skill huashu-art-motion,面向 Claude Code 这类 coding agent,用代码画出不同艺术风格场景并让角色和画面动起来,也能把口播配成白板、Vox、3b1b 等风格解说动画。

  11. 逛逛GitHubAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Codex 把婚礼流程做成仪式感网页

    一位开发者用 Codex 把接亲、典礼流程整理成手机端静态网页,通过腾讯云 CloudBase 静态网站托管加自购域名部署,并让 Codex 代为完成域名申请、备案与微信访问拦截申诉。他称 GPT-6 生成前端页面的审美能力已足够强,无需额外 skill,后续修改直接在会话中提需求,还能加上亲友签名送祝福功能。

  12. 歸藏(guizang.ai)(@op7418)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    尝试让 Opus 5.5 做个网站解释奇门遁甲

    有人尝试让 Opus 5.5 生成一个用于解释奇门遁甲的网站,相关帖文获得 31 条回复、4 次转发、77 次点赞和 39769 次浏览。

  13. 优设AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI美食解构提示词:把一道菜拆成食材信息图

    一套 AI 美食解构提示词可将完整菜品拆成食材信息图,成品保留真实美食照片,主要食材被单独拆出,用手绘、箭头和注释重新排版,效果类似美食观察手账。该玩法适合做菜谱、美食分享和探店笔记,提示词已整理完毕,可在评论区留言获取。

  14. AI科技评论AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    至简动力冯宗宝 IROS 2026 演讲:在 0.5 毫米间隙下用机器人造机器人

    至简动力强化学习负责人冯宗宝在 IROS 2026 介绍,其团队让机器人单机自主值守两台 CNC 机床,在工件与卡盘间隙仅 0.5 毫米的条件下完成抓取、上料、插入、取件与放置,精密插入任务成功率达 100%,训练仅用 600 条真实机器人轨迹。

  15. meng shao(@shao__meng)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 插件 html-plan:把计划文档生成为可交互 HTML

    Claude Code 开发者 @trq212 分享了插件 html-plan,运行 /html-plan 后不再输出纯文本 Markdown,而是生成自包含的单文件 HTML 页面。

  16. meng shao(@shao__meng)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    别让 LLM 既当运动员又当裁判:数据分析 Agent 引入独立审查层

    Sumanth 构建的数据分析 Agent 采用三层职责分离架构:Qwen(经 Vercel AI Gateway 调用)只负责理解问题、生成只读 SELECT 并解释结果。

  17. meng shao(@shao__meng)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI Cookbook 新增 5 个示例 App 覆盖 Grok API 四条主线

    xAI Cookbook 更新了 5 个新 App,加上原先的 5 个,组成 Grok API 示例集,每个围绕一个真实可跑的产品级场景,覆盖实时语音智能体(4 个)、多模态生成流水线(4 个)、X 实时数据分析(2 个)四条主线,开源地址为 github.com/xai-org/xai-co。

  18. Viking(@vikingmute)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vibe Coding 用 Cloudflare Durable Objects 需警惕 alarm 死循环导致天价账单

    有开发者因 Vibe Coding 写出的 Cloudflare Durable Objects alarm 死循环,读写达 6 万亿次,账单爆到 1 万美元。

  19. meng shao(@shao__meng)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MIT 公开课 6.S950「Agency with AI」第 4 讲更新:The Abstraction Ladder (of Programming)

    MIT 公开课 6.S950「Agency with AI」第 4 讲已更新,主题为 The Abstraction Ladder (of Programming),分梯子本身、何时以及为何向下一层看、AI agent 改变了什么、守住命令行四部分。

  20. 跨国串门儿计划AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Huberman Lab 43 期混剪:一份学习、专注与深度工作指南

    从 43 期 Huberman Lab 中剪辑出的一集「学习指南」发布,按主题分 12 章重新编排,内容取自 Andrew Huberman 与 Cal Newport、Matthew Walker、James Clear 等 20 位嘉宾的原话,未添加旁白,时间跨度 2021-02-08 至 2026-08-31。

  21. Geek(@geekbb)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 AI 优化博客并把 Hexo 主题 Stellar 升级到 V2.0,全程 AI 接管

    作者让 AI 全程接管,优化了自己的博客,并把 Hexo 主题 Stellar 升级到 V2.0,称过程省心。他表示在用过 Hexo 主题中,Stellar 是最棒的,并附上该主题的 GitHub 仓库链接。

  22. DeepLearning.AI(@DeepLearningAI)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与 Qdrant 合作课程:本地构建无需联网的 AI 助手,记住你的钥匙放在哪

    DeepLearning.AI 推出与 Qdrant 合作、由 Dylan Couzon 讲授的免费课程,教你亲手搭建一个能记住物品位置(如钥匙放在哪)的 AI 助手,无需网络连接、不依赖远程服务器。课程现已开放免费注册。

  23. 架构师之路AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code:skill 的 desc 不是摘要,而是触发器

    Claude Code 团队指出,skill 里的 description 字段不是给人看的摘要,而是写给模型看的触发条件。用户界面显示的是 display_name 和图标,模型则拿 desc 与用户消息做语义匹配,因此写 desc 等于写一段给模型的路由规则。官方规范要求 desc 至少包含具体能力清单、具体场景和用户触发关键词三项。

  24. AI Engineer(@aiDotEngineer)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Linear 工程负责人谈编程智能体的上下文难题:有代码还不够

    Linear 工程负责人 tommoor 将在 AI Engineer New York 分享"Your Coding Agent Has a Context Problem",探讨编程智能体有了代码之后是否具备足够上下文。活动时间为 Oct 14,需购票参加。

  25. AI Engineer(@aiDotEngineer)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ArizeAI 的 Fuad Ali:如何把智能体线上失败转化为 evals 测试

    ArizeAI 的 Fuad Ali 展示了一套方法:把 AI 智能体的生产环境失败案例转化为 evals,用于测试修复是否引入回归,并加入人工审核环节。相关内容将在 10 月 12 日 AI Engineer New York Workshops 上讲解,该工作坊为会议附加环节。

  26. Fireworks AI(@FireworksAI_HQ)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 用纯 SFT 微调 9B Jev 分类器,完整配方开源

    Fireworks 的 AI 开发者教育负责人用纯 SFT、公开数据集和两个简单技巧,在 Fireworks 上微调出一个 9B Jev-style 决策分类器,无需前沿实验室级别的预算。完整训练配方已开源,可自行训练同类模型。

  27. 宝玉(@dotey)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Boris Cherny 谈如何给 Claude 写提示词:给目标、定投入、说验证

    Claude Code 作者 Boris Cherny 表示,给 Claude 写提示词没有秘密,像对同事说话一样即可,大多数任务不必过度铺垫或规定步骤,给出目标模型会自己想办法。他认为在 Sonnet 3.5 时代提示词影响很大,如今更关键的是说清三件事:想让它做什么、希望投入多少精力、以及它该如何验证自己做对了。

  28. 宝玉(@dotey)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Boris 用 Opus 5.5 为 Acquired 播客剧集打造互动网站,提示词只需三点

    Boris 让 Opus 5.5 为 Acquired 播客最新一期 Home Depot 内容制作互动网站,水彩插图全部由 Claude 绘制。其提示词核心只有三点:要它做什么、消耗多少算力推理、如何验证自己做对了,其中"做什么"和"如何验证"是形成 Agent 自我验证闭环的关键。

  29. NVIDIA Technical BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Megatron Core 实现可扩展的比特级确定性预训练

    NVIDIA Megatron Core 支持比特级确定性预训练,让大规模预训练更易调试、验证和可复现地恢复。在数千块 GPU 上训练万亿参数模型时,多维并行、低精度计算和分布式检查点会让故障复现与修复验证变难,比特级确定性可应对这一问题。