跳到正文

全部动态

今日 33 条
10月6日周二
  1. 宝玉(@dotey)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:不用破解我的提示词,《图解 Skill》图书配套素材里就有

    宝玉回应提示词被破解一事,表示无需费力破解,相关提示词已放在其《图解 Skill》图书的配套素材中,并给出 GitHub 地址 github.com/JimLiu/Illustr…。

  2. 宝玉(@dotey)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉用 Opus 5.5 设计篆书印章:JS + Canvas 逐笔坐标绘制

    宝玉用一段提示词让 Opus 5.5 以 JS + Canvas 画篆书印章,印文为繁体「宝玉」、自右向左读,字形按《说文》小篆而非字体,每一笔用坐标画出再加粗。模型被要求先拆解各字部件与印面布局,再做白文与朱文两个版本,用朱砂色印泥、带刀刻质感与边缘残破、背景为宣纸纹理,导出 1200×1200 透明底 PNG,完成后截图自查字形可辨与笔画间距。

  3. AI Engineer(@aiDotEngineer)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 解析量化、投机解码与推理控制带来的"更快模型"隐藏成本

    MiniMax 的 Morgan Suo 将在 AI Engineer New York 演讲《The Hidden Costs of a Faster Model》,拆解量化、投机解码与推理控制在生产环境中究竟改变了什么。该分享定于 10 月 14 日举行。

  4. 宝玉(@dotey)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何 Debug Codex/ChatGPT Mac App 的 UI 实现

    宝玉给出 Debug Codex/ChatGPT Mac App UI 的步骤:退出正在运行的 Codex App,在命令行执行 open /Applications/ChatGPT.app --args --remote-debugging-port=8315 --remote-allow-origins= http。

  5. LlamaIndex 🦙(@llama_index)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 解读 OCR 为何仍未过时

    LlamaIndex 发布博客《OCR is dead?》,讨论 OCR 在 AI 文档处理中的现状。推文仅给出博客链接,未披露具体模型、参数或评测数据。

  6. Simon Willison(@simonw)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 复测 Qwen 3.8 27B 本地长数字加法,对比推理与非推理模式

    Simon Willison 重跑了 Colin Fraser 早前针对 GPT-4o 的长数字加法实验,这次改用本地运行的 Qwen 3.8 27B,并分别测试推理模式与非推理模式。原帖未给出具体得分,仅附上实验记录链接。

10月5日周一
  1. AWS Machine Learning BlogAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 与 Amazon Bedrock Knowledge Bases 的智能体检索实践

    Amazon Bedrock Managed Knowledge Bases 现已支持 agentic retrieval,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环检索并判断证据是否充分,而 Retrieve API 只做一次混合搜索。

  2. Milvus(@milvusio)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus HNSW 的 SQ、PQ 与 PRQ:向量压缩方式对比

    Milvus 为 HNSW 提供 HNSW_SQ、HNSW_PQ 和 HNSW_PRQ 三种向量压缩索引,用于降低图构建与距离计算中的内存占用。SQ 对每一维量化,SQ8 与 SQ6 分别用 8 位和 6 位,SQ4U 用 4 位无符号值并共享统一范围;PQ 将向量切分为子向量并以码本索引表示;PRQ 在 PQ 基础上分阶段编码残差,代价是额外训练、构建与距离计算开销。

  3. LangChain(@LangChainAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 举办 Deep Life Sci Workshop,演示科研智能体工作流

    LangChain 的 Deep Life Sci Workshop 将实操一套真实科研智能体工作流,内容包括把智能体接入科学数据与研究源、追踪智能体推理与工具调用、评估智能体表现,以及借助 trace 定位并修复问题、持续改进复杂研究工作流。活动分 NAMER 与 EMEA 两场,已在 events.langchain.com 开放报名。

  4. 向阳乔木(@vista8)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多款 ASR 实测:豆包语音(极速)、Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR、小米 MiMo-ASR 对比

    为给无字幕的 Youtube 和 B 站视频做转写,作者实测了豆包语音(极速)、硅基流动上的 Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR 和小米 MiMo-ASR 多家 ASR。豆包语音表现最完善,自带毫秒时间轴且速度较快。相关功能将上线乔木剪藏插件,新增本地 Whisper 与本地 Qwen3 ASR,并支持各类云端语音转文本 API。

  5. Recraft(@recraftai)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft 发布三组写实时尚编辑图像 Prompt:温室、站台与洗衣店场景

    Recraft 分享三组写实高细节时尚编辑图像 Prompt,分别描绘玻璃温室中修剪花枝的年轻黑人女性、清晨空站台上用合成器与鼓机制作音乐的年轻黑人男性,以及洗衣店里用平板绘制动画帧的年轻成人。每个 Prompt 均指定了服装、道具、光线条件与胶片颗粒等细节,并大量使用自然日光、玻璃反射和轻微运动模糊等写实质感描述。

  6. 李继刚(@lijigang_com)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚分享提示词:如何追问自己一直绕开却未真正提出的更深问题

    李继刚(@lijigang_com)分享了一条提示词,用于追问自己:在最近反复讨论的问题背后,是否藏着一个一直绕着走、却没真正问出口的更深问题。该条内容获得 1064 次点赞、114 次转发和 104921 次浏览。

  7. The JetBrains BlogAI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains dotInsights 2026 年 10 月:.NET 与 AI 开发动态汇总

    JetBrains 发布 10 月 dotInsights 通讯,汇总 .NET 与软件开发社区动态,涵盖 C# 15 集合表达式参数、C# 14 扩展类型、ASP.NET Core 中的 RAG 入门以及 Agent Skills 101 等话题。

  8. 掘金本周最热AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小说转漫画 skill:用 Codex 与 ChatGPT 生图降低漫剧成本

    作者开源了一个「小说转漫画」skill,为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并配合 ChatGPT 生图模型出图,最终提供离线阅读器、PDF 和 CBZ 漫画文件。

  9. freeCodeCamp.orgAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何打断 AI 编码智能体的修复死循环

    freeCodeCamp 发布教程,讲解 AI 编码智能体为何会陷入反复修复不成功的循环,并给出停止、回退、重新描述、单点修改、真实验证五步流程。文章以一次重复扣费 bug 为例,展示先写失败测试再向智能体提精确需求的做法,修复本身只有十几行代码,并附一份可复用的检查清单。作者指出该模式在 Lovable、Replit、Cursor、Claude Code、Base44 等工具上都会出现。

  10. freeCodeCamp.orgAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NestJS Observe 使用指南:面向开发者的可观测性手册

    NestJS Observe 是面向 NestJS 的框架感知可观测性方案,利用框架对 controller、provider、guard、interceptor、GraphQL resolver 和微服务处理器的认知来定位请求耗时。

  11. freeCodeCamp.orgAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如何改变邮件送达率:发件人声誉与收件箱放置的技术指南

    邮件服务商正用机器学习取代固定规则来判定发件人声誉,模型会同时分析正文措辞、链接与附件特征、发送频率突增,并结合历史发件行为和收件人实时互动做出整体判断,因此上下文比单个关键词更重要。

  12. meng shao(@shao__meng)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Emil Kowalski 的 Skills 仓库新增 /break-ui 技能

    43K 星、1.9M 安装的 Skills 仓库「Skills For Designers and Engineers」新增 /break-ui 技能,用真实但极端的数据压测 UI 组件,并报告哪里乱了、怎么修。

  13. 优设AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    5类AI反推教程:把参考图拆成可用提示词

    作者整理了一套图片反推教程,从主体、风格到细节,教读者把参考图拆成能用的提示词描述。教程覆盖字体排版、场景、摄影、插画和3D角色五类,各有一条完整模板,替换括号内容即可使用,并以水果海报为例说明哪些元素固定、哪些可替换。

  14. meng shao(@shao__meng)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Uber 分享企业级 MCP 网关设计:已托管 800+ 服务器、5000+ 工具

    Uber 工程团队分享了面向 AI Agents 的企业级 MCP 管理平台设计,用“控制平面 + 数据平面”的网关体系把全公司数千个存量 API 自动转译成 MCP 工具,目前已托管 800+ MCP 服务器和 5000+ 工具。

  15. 架构师之路AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    想30分钟写出好skill?用Anthropic官方五项标准评审internal-comms

    写好 skill 的前提是先看懂好 skill 的标准,评审优秀 skill 有五项标准:description、触发策略、正文、第三层、一致性。

  16. meng shao(@shao__meng)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Hands-On Large Language Models》全书近 300 张自制图解拆解 LLM 原理与架构

    JayAlammar 与 MaartenGr 合著的《Hands-On Large Language Models》全书绘制近 300 张自制图,作者称之为 "The Illustrated LLM Book"。

  17. 逛逛GitHubAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    盘点 20 个 9 月份 GitHub 上顶顶顶的开源项目

    逛逛GitHub 盘点 9 月 GitHub 上 20 个热门开源项目,月增 Star 最高的是 Archify,约 3.34 万,用 Skill 把系统描述或代码仓库画成交互式架构图;Ponytail 以约 3.12 万 Star 教 Agent 优先复用现有代码。

  18. 十字路口CrossingAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1 Flash Preview 前端能力:三个案例对比 Opus 5.5

    MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。

  19. meng shao(@shao__meng)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 CME 295《Transformers & Large Language Models》开课,第二讲 138 页讲义公开

    斯坦福 2026 秋季新课 CME 295《Transformers & Large Language Models》已开课,由双胞胎兄弟 @afshinea 与 @shervinea 主讲,9 讲覆盖 Transformer 架构、RoPE、LoRA 微调、RLHF/GRPO 训练、Flash Attention、MCP 与 AI Agent、扩散语言模型。

10月4日周日
  1. Viking(@vikingmute)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Matt 的 /codebase-design 与 /improve-codebase-architecture skill:用规范词典找出浅模块

    Matt 的 /codebase-design skill 不修改任何代码,只用一套词典把 module、interface、depth、seam、adapter、leverage、locality 等词定义死,禁用 component、service、API、boundary 等含糊替代。

  2. Harrison Chase(@hwchase17)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 编程智能体成本连续两月大幅下降,Harrison Chase 分享三步降本做法

    LangChain 的编程智能体成本连续第二个月显著下降。Harrison Chase 给出的三步做法是:用 LangSmith 追踪全部用量实现成本可见性、通过 LLM gateway 设置用户级成本上限、并借助其开源云智能体框架 OpenSWE 做模型路由来优化 harness。第三方 harness 优化难度更大,相关长文将后续发布。

  3. 向阳乔木(@vista8)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木发布 Skill,让豆包、Claude Code 等调用 Codex 生图能力

    向阳乔木发布一个 Skill 或 MCP,装上后豆包、Workbuddy、Claude Code、Deepseek Harness 等 Agent 工具都能调用 Codex 的内置生图能力,用于制作小红书、YouTube 封面或把内容转成信息图。

  4. AI寒武纪AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 公开私藏提示词:大模型4级玩法

    Andrej Karpathy 时隔两个月发文,公开了自己日常让大模型把内容讲透的四级递进技巧。第一级是写作,用航空维护文档规范 ASD-STE100 让模型产出受控文本。

  5. 向阳乔木(@vista8)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木实测让任意 Agent 调用 Codex Computer Use

    向阳乔木发现并测试通过一种方法,可让任意 Agent 调用 Codex 的 Computer Use,他借此把常用的 Claude Opus 5.5 与 Codex 的 Computer Use 能力结合使用。安装后建议配置 Hook,指定白名单以控制哪些 App 可被调用,安装地址在评论区。

  6. meng shao(@shao__meng)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 OpenSandbox 等六款开源 Agent Sandbox 盘点:腾讯云、字节、AWS、Google 方案对比

    阿里「AI Native 研发范式实践手册」的 Agent 运行环境章节介绍了阿里开源的 OpenSandbox,其支持 Docker/Kubernetes、多语言 SDK、MCP 及浏览器、桌面等执行环境。

  7. Viking(@vikingmute)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 官方发布《Getting the most out of Opus 5.5 in Claude and Claude Code》实战指南

    Claude 官方博客发布 Addy Osmani 撰写的《Getting the most out of Opus 5.5 in Claude and Claude Code》,围绕 Opus 5.5 讲实战用法:如何下任务、Long Run 控制、结果验收和 Claude App 使用技巧。

  8. 向阳乔木(@vista8)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    把 ASD-STE100 航空航天写作规范做进学习 Skill

    有人把 ASD-STE100 这套航空航天技术文档写作规范融进了一个学习 Skill,安装指令为 `npx skills add joeseesun/qiaomu-learning`。该规范最早由航空航天领域在 1980 年制定,限定约 900 个批准词汇、53 条写作规则,要求描述性句子每句最多 25 词、程序性句子每句最多 20 词且每句只写一条指令。

  9. meng shao(@shao__meng)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 MS&E 319「高效生成式语言模型」课程:公开前四节讲义,覆盖预训练到后训练效率设计

    斯坦福在线课程 MS&E 319「高效生成式语言模型」开课,聚焦从预训练、架构、推理到后训练的效率设计,已公开前四节课程讲义。授课教师为 Amin Karbasi、Anay Mehrotra、Amin Saberi 和 Grigoris Velegkas 四人。

  10. 宝玉(@dotey)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:SpaceXAI 的 Lauren Tan 月并 2500 个 PR 如何不逐个 Review

    宝玉引用播客内容介绍,SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR,不逐个 Review,而是晚上让 AI 自检自合并、第二天早上抽查。

  11. 山行AIAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PowerTokens/video-studio:用 Excel 管理几十个镜头的 AI 短剧批量生产实战

    PowerTokens/video-studio 是一款面向 Windows 的 Wan 3.0 视频批量生成工具,支持 Excel/CSV 导入镜头表、任务 ID 恢复、断点下载、Key 池、CLI 与 MCP,采用 MIT License,主要代码为 Python,截至 2026 年 10 月 1 日仓库约 1 Star。

  12. Geek(@geekbb)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    oil-ui:让 Agent 按品类和品牌生成多套 UI 设计方向

    作者分享了把 AI 的 UI 设计能力推到极限的探索,让 Agent 做界面设计时先按品类和品牌推出设计方向、产出多套可对比方案,再用实际截图迭代,避免直接套用模型默认审美模板。相关项目地址为 github.com/oil-oil/oil-ui。

  13. 掘金本周最热AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 分享如何用 AI 迁移 Compose 项目

    Meta 分享了 Instagram Direct 迁移 Jetpack Compose 的经验:迁移后 UI 代码量减少 50%,AI Agent 执行时间下降 35%,工程师与 Agent 往返次数减少 32%,单次 Agent Session 的 Token 成本降低 33%。

  14. meng shao(@shao__meng)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sebastian Raschka 第 6 讲:用纯 PyTorch 从零实现 GRPO 训练推理模型

    Build A Reasoning Model (From Scratch) 系列第 6 讲由 Sebastian Raschka 讲解用 GRPO 做可验证奖励的强化学习(RLVR),这是该系列首次真正更新模型权重。

  15. AI Engineer(@aiDotEngineer)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    W&B 的 Zubin Aysola 如何把 ARIA 生产 trace 变成 eval 并验证修复

    W&B 的 Zubin Aysola 演示了把 ARIA 的一次生产 trace 转成 eval,并用它来基准测试修复效果。这是「智能体出错后能否变成测试」的实操分享,完整录播见 youtu.be/XyV6bSMyq-I。相关活动将于 10 月 12–14 日在纽约举行,报名入口 ai.engineer/nyc/2026。