跳到正文

#教程/实践

今日 37 条
9月25日周五
  1. QdrantAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Rust 重写 cross-encoder 推理:cross-encode-rs 对比 Python 实测

    Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。

  2. Midjourney(@midjourney)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney 发布新编辑模型使用教程:如何保持角色一致性

    Midjourney 为其新编辑模型发布了一支使用视频,回应大量用户关于如何用该模型实现角色一致性等效果的疑问。视频通过推文发布,附有浏览器端播放链接。

  3. LlamaIndex 🦙(@llama_index)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 用 ExtractBench 对比文档抽取置信度过滤效果,LlamaParse Agentic Plus 在 97% 精度下召回 66.48%

    LlamaIndex 发布新文章,从"能否用于决定自动化与人工审核"的角度审视文档抽取中的置信度评分,覆盖置信度阈值、精度与召回、分数覆盖率、分数粒度和人工审核量。借助 ExtractBench,其对比了不同抽取系统在置信度过滤后的表现:在 97% 精度目标下,LlamaParse Agentic Plus 过滤后在预期字段上达到 66.48% 召回。

  4. Grafana LabsAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 SLO 给 AI 智能体的幻觉设定预算

    Grafana Labs 把可靠性工程中的错误预算(error budget)用于 AI 智能体质量,通过 evaluations 让模型裁判对 groundedness、fulfillment、toxicity、latency、cost 等行为分别打分,再把分数变成带目标的 SLO,例如设定 30 天内 95% 的对话被判定为 fulfilled。

  5. Justine Moore(@venturetwins)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Seedance 2.5 换脸实测:上传参考视频和角色图即可替换人物

    Seedance 2.5 支持上传参考视频与新角色图片来替换画面中的人物,只需替换一位表演者并保留其余人物的动作、表情与镜头信息。部分参考视频会被拒绝,可先用 Codex 模糊人脸后重新提交,且最好每次只处理两个角色。作者用它把《The Office》剧集里的演员依次换成 Dario、Jensen 和 Sam。

  6. Suhail(@Suhail)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有哪些好用的 LLM 数据检查工具?用于查看 SFT traces、RL env tasks 等

    有人在征集 LLM 数据检查工具,重点关注 SFT traces 和 RL env tasks 等场景的查看需求。该帖获得 19 条回复、5 次转发和 98 个点赞,浏览量 16626。

9月24日周四
  1. Qdrant(@qdrant_engine)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 与 DeepLearning.AI 推出新课:用端侧记忆构建 AI 助手

    Qdrant 与 DeepLearning.AI 合作推出新课程 Building AI Assistants with On-Device Memory,由 Qdrant 开发者关系负责人 Dylan Couzon 讲授。

  2. Anton Osika – eu/acc(@antonosika)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika 用 Lovable 为播客嘉宾搭建品牌业务工具,含 AI 评分收件箱

    Anton Osika 在播客录制中与 @siliconvalleymm 用 Lovable 搭建了一套业务工具:重做旧网站、上线品牌合作开放表单,并用 AI 按相关度给所有投稿排序的收件箱。新站点还做了 SEO 与 AI 搜索优化,便于 Google 和 AI 智能体发现;团队会在每次投稿时收到邮件通知,Lovable 还提交了一条假投稿做端到端测试,并完成深度安全扫描。

  3. 优设AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    24条提示词技巧去除文章AI味

    优设发布《超实用!24条提示词技巧教你文章去AI味》,将文章中的AI味问题拆解为24条具体修改方法,覆盖开头、用词、句式、情绪和语气,逐条说明哪些地方该删、该换、该保留。作者特别提到最后一遍真人化检查值得反复使用。

  4. Viking(@vikingmute)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gumroad 创始人将《The Minimalist Entrepreneur》做成 skills 上线 GitHub

    Gumroad 创始人 Sahil Lavingia 把《The Minimalist Entrepreneur》(中文版《小而美》)做成了一系列 skills,已发布在 GitHub 的 slavingia/skills 仓库。这些 skills 按几个常见场景和步骤拆分,适合想做产品和个人品牌的人参考。

  5. 印记中文AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JavaScript 中文周刊 #254:tinyjs 打造不到 10MB 的 JavaScript 桌面应用

    tinyjs 能用不到 10MB 的体积构建 JavaScript 桌面应用,内置 txiki.js 驱动的后端,可访问包括 FFI 在内的完整系统能力,配合原生 WebView 渲染,支持打包到 macOS、Linux 和 Windows。

  6. 京东技术AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    拆解京东海博 AI-Native 落地保障:海博团队 AI 知识库能力建设

    京东海博团队把大模型“读不懂业务全貌”重新定义为“经营好上下文”,采用 OKF 规范将知识编译从运行时前移到维护期,构建项目知识×领域知识矩阵、角色化知识层与 Skill 能力层三层结构,并用 AB 实验验证带知识库“更快更全”。以 40w 行代码的 yzt-erp-wms 仓库为例,共沉淀约 1051 篇知识文档,其中 flows/ 接口与流程 1001 篇、chains/ 业务链路 41 篇。

  7. Qdrant(@qdrant_engine)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kaivid Labs 将 40 万+文档向量从 Milvus 迁移至 Qdrant

    Kaivid Labs 团队将 40 万+文档向量从 Milvus 迁移到 Qdrant,并记录了整个过程。他们说明了迁移的处理方式、验证数据完整性,并对比了两套系统在延迟、吞吐量和内存占用上的表现。完整记录已发布在 kaivid.com 博客。

  8. Vercel NewsAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Klaviyo 如何在 Vercel 上两周内交付 356 个内部应用

    Klaviyo 在 Vercel 上搭建内部应用平台,向全员开放后头两周就有 512 名员工部署了 356 个应用,其中 196 个是带独立数据库的全栈应用。应用默认 SSO 门控且私有,员工从想法到上线不超过 3 分钟;Klaviyo 还自建 K:Forge 流水线,借助 Secure Compute 让应用直连自有数据库而不经公网。

  9. Viking(@vikingmute)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 支持跨频道通信,可让一个 bot 给另一个 bot 发消息并回传结果

    Grok Bot 支持跨频道发送通信,可让一个 bot 给另一个 bot 发信息,对方执行完成后再发通知回来,类似 herdr 的跨 panel 通信。该技巧被评价为实际使用中相当实用。

  10. 超人的电话亭AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    审美刻意练习法|学习思路分享

    中秋前夕,一节面向新手设计师的公开课将分享审美提升的练习思路,强调好审美是设计师的基础。公开课定于当天下午两点半开讲,需通过按钮预约。

  11. Elastic BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 如何用原子化断言核查对抗 LLM 幻觉

    Elastic 工程师 Toby Sutor 分享了用原子化断言核查(atomic claim checking)把 LLM 合并知识库文章变得可控的做法:合并与验证分成两遍,第二遍把每篇源文章拆成最小的可核查断言,逐条比对合并结果并标记为 present、partial 或 missing,同时记录两篇文章的冲突。

  12. GitHub(@github)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 团队为大型 PR 搭建无人值守测量闭环,检测空白间隙、卡顿与观察者泄漏

    团队为超大 pull request 搭建了一套无人值守运行的测量闭环,用生产环境埋点检测空白间隙、卡顿(jank)、观察者泄漏和滚动校正。该闭环在无人干预下持续跑测,用于捕捉大型 PR 中的这些性能问题。

  13. GitHub(@github)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 深潜:如何让百万行、数百条评论的 pull request 像普通评审一样轻松

    GitHub 发布工程实践深潜,探讨如何让百万行规模、附带数百条评论的 pull request 变得像普通代码评审一样易于处理。该内容以 github.blog 工程博客形式发布,聚焦超大型 PR 的评审体验问题。

  14. GitHub(@github)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用两套独立几何布局解决代码块与评论重排问题

    该方案将布局拆成两套独立几何:代码高度确定、可提前获知,评论块高度则懒测量并在视口附近校正。这样评论重排就不会触发代码布局重建。

  15. NVIDIA Technical BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA:AI 工作负载上线前如何验证 GPU 集群就绪状态

    GPU 集群即使每块 GPU、网络链路和 pod 都报健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄把流量引向慢速路径。这类问题往往要等到训练运行数小时后才被发现,因此需要在 AI 工作负载落地前验证集群就绪状态。

  16. eric zakariasson(@ericzakariasson)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 通过优化读取将 token 成本降低 7%,智能体质量不下降

    Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更精简的提示词、选择性工具加载、更好的缓存以及压缩文件读取。开发者建议构建智能体的人给智能体阅读相关发现并让其落地实现。

9月23日周三
  1. 超人的电话亭AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    半年度干货总结:UI/作品集/AI/求职资源盘点

    超人电话亭发布半年度干货合集,覆盖UI界面设计、作品集优化、AI生成UI与求职四大方向。AI部分包含三篇文章,分别讲解AI生成UI的应用逻辑、切入点和工具,以及AI Agent、Skill和Vibe Coding概念,并附Figma Make建站个人主页的实操,从提示词到上线。Figma系列课已重新录制完毕,AI生成UI系列正在陆续上传。

  2. Recraft(@recraftai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft 公开其速度测量方法

    Recraft 发布文章说明其模型生成速度的测量方法,并给出方法说明链接 go.recraft.ai/8CF9MC/。该内容未披露具体的速度倍数、基准或模型版本信息。

  3. Weaviate • vector database(@weaviate_io)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 发布 Engram 记忆指南:四个决策决定 AI 智能体记得对不对

    Weaviate 发布新指南,梳理配置 Engram 记忆时的四个关键决策:记住哪些内容、记忆如何划分作用域与更新、用哪种检索模式读回、以及放在提示词的哪个位置。指南用真实输出和测试运行展示调整每项决策后的变化,包括过滤掉过程噪声、避免动态记忆破坏 prompt caching。全文见 weaviate.io/blog/engram-me。

  4. Patrick Loeber(@patloeber)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini API 技能解析及如何在编码智能体中调用

    Patrick Loeber 与 @timeyoutakeit 联合发布一份实用指南,拆解 Gemini API 技能并演示如何在编码智能体中使用,内容涵盖 Gemini API、Live API 与 Omni。

  5. vivo互联网技术AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    知识不是文件也不是向量:KDC 如何定义可治理的知识对象

    vivo 互联网存储团队提出知识驱动计算(KDC)理论,将知识定义为"已经验证、可复用,并能降低预测、推理、决策或行动不确定性的认知成果",而非文件、向量或 RAG 检索片段。

  6. 得物技术AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    得物交易搜索如何用生成式召回实现范式跃迁

    得物交易搜索团队过去一年将召回从判别式检索改为生成式建模,让模型主动生成候选商品而非从商品池中找最相似的。方案覆盖基于LLM的文本索引语义增强、基于MLMM的多模态向量表征、基于HLLM的深度语义表征、基于HSTU的生成式行为序列建模及基于语义ID的统一生成式召回,并推进召粗一体架构。

  7. 奇舞精选AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mattpocock-skills 上手指南:从安装配置到把一个需求做完

    面向使用 Claude Code 或 Codex 的开发者,这篇指南按项目 v1.2.3 的技能集合介绍了 Matt Pocock 维护的 mattpocock-skills 的安装与使用流程。

  8. 腾讯技术工程AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯错误码治理 Agent:3~8 小时排查缩短到分钟级,action_type 一致率从 66% 提升到 88%

    腾讯技术工程基于智能体编排平台搭建错误码治理 Agent,把知识库、代码关系图谱、可观测平台和代码托管平台四类能力挂载到同一个 Agent,由它自主编排五步排查流程,分钟级产出根因分析与修复建议。

  9. 腾讯研究院AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 EURISKO 到 GPT-5.6:一份讲清 RSI(递归自我改进)的科普综述

    OpenAI 在 2026 年 7 月发布的 GPT-5.6 首次把自我改进列为评测科目,其 RSI 指数从 GPT-5.5 的 41.7% 升至 GPT-5.6 Sol 的 57.9%,相差 16.2 个百分点。文章按四条标准(持久改进、自主闭环、递归增益、稳健可控)划分 RSI 层级,指出前两层已有实现,递归自我加速尚无充分公开证据。

  10. 小米技术AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米黑客松 Sensaro OS:用 Xiaomi MiMo 让智能家居从听懂指令到理解意图

    小米黑客松 Sensaro OS 团队在 48 小时内基于 Xiaomi MiMo 赛道搭建了一套智能家居系统原型,把用户意图转化为包含目标、作用范围、动作、安全边界和时长的“Sensaro State”,而非单条设备指令。

  11. 阿里技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布《AI Native 研发范式实践手册》,提出企业级 Agent 基础设施三大缺口

    阿里巴巴在云栖大会发布《AI Native 研发范式实践手册》,从 AIDC 数字投手、千问用增 Agent、万有无界三个业务案例提炼出环境与验证驱动、平台能力升级、提效度量、数字员工、组织配套五个共性挑战。

  12. 大淘宝技术AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    淘天团队自迭代小游戏 Agent:两周上线 6 款游戏,3 天迭代 12 款

    淘天营销&交易技术团队公开了一套覆盖小游戏选型、生产、上线与迭代全链路的多 Agent 系统,由人定义北极星指标与行动边界并审核关键方案,AI 负责策略、开发与数据归因。

  13. 优设AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI时代Vibe Design必备的10种UI风格名词

    优设整理了一套AI做界面常用的10个UI风格和界面名词卡片,涵盖Editorial Design、Swiss Style、Glassmorphism、Grain & Noise,以及AI产品常见的Prompt-bar-first和Agent Status等。每种风格都附有适用场景、避坑提醒和可直接放进提示词的关键词,另附一张10种风格速查表,供写Prompt时参考。

  14. cat(@_catwu)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人用 Opus 5.5 结合 Lean 形式化验证 Claude Agent SDK

    Boris Cherny 表示自己用 Opus 5.5 对 Claude Agent SDK 做形式化验证,仅用几个简短提示词就产生 16 个 PR,修复多个 bug 和竞态条件。

  15. 腾讯云开发者AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 写得快不等于真正提效:Harness 的记忆与验证闭环

    作者认为用 AI 写代码时记忆缺失、改完即停、会犯错是三个主要断点,因此给 AI 套上一层 Harness 系统。做法上先建两级索引知识库并只记阴性知识、代码位置索引和隐含关联关系,再用 hook 硬拦截让 AI 先读索引;随后用访问、提交、等待、本地验证四个 skill 补上手脚,并把排查到线上验证的步骤写死成 close-loop 等 command。

  16. Modal BlogAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何为万亿参数编码智能体服务万亿 token:Kimi K2.6 推理优化实践

    Modal 分享了为 Moonshot AI 的 Kimi K2.6 模型优化推理服务以支撑编码智能体的实践,单副本每用户性能提升 2.8 倍、跨用户提升 5.6 倍。

  17. Suhail(@Suhail)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降低 21.2%

    Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。

  18. LangChain BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    医疗 AI 的可靠性层:LangSmith 的典型用例

    LangChain 发文介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准后的评估器和自动化发布门禁。