跳到正文

全部动态

今日 0 条
8月31日周一
  1. Anton Osika – eu/acc(@antonosika)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika 回应称当时是清晨

    Anton Osika 就此前言论回应称"in my defense it was early morning",该帖获得 675 次点赞、32997 次浏览与 81 次互动,未作进一步说明。

  2. 李继刚(@lijigang_com)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    skill 更新缺少提醒机制,一天连更多个版本也无人知晓

    skill 的更新缺乏提醒机制,别人很难知道你更新过。有时一个 skill 一天会连续更新好几个版本,但没有更新提醒,外部使用者无法感知版本变化。

  3. 李继刚(@lijigang_com)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚:命题与言说事件——为什么某些文字不能交给 AI 生成

    语言有两种存在方式:命题可与说话者分离,真假不因谁说而改变;言说事件则必须由具体的人亲自说出才真正发生,承诺、告白、道歉、表态皆属此类。前者的价值在于说话者可以被替换,后者的价值恰恰来自说话者不可替换。李继刚认为,若文章或书属于第二种,交给 AI 自动生成就不是提高生产力,而是抽走了作品得以成立的条件。

  4. 李继刚(@lijigang_com)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    他者对投射的抵抗,才让我们第一次看见他者

    李继刚提出,只有当他者抵抗我们的投射时,我们才第一次真正看见他者。该帖获 14 次点赞、6814 次浏览,由 xgo.ing 提供支持。

  5. 屠龙之术AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型到底吃不吃应用?从 Canva、Figma 到美图,看 AI 应用公司的两种命运

    播客「屠龙之术」讨论模型是否会吃掉应用,并以美图作为样本:其财报显示 AI 收入已成规模,产品正从修图、美颜等功能集合转向 AI 工作流与结果交付。文章认为 AI 应用的核心竞争力会从"我有什么功能"变成"我能不能把事情做完",并由此提出应用公司需要建立自己的数据、评估与持续优化 Loop,"Own your intelligence"。

  6. andrew chen(@andrewchen)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代后的游戏开发将走向 three.JS 或世界模型

    关于 AI 时代后的游戏开发路径,a16z 的 Andrew Chen 认为只有两条路:three.JS 或世界模型。他引用数据称 three.js 每周 npm 下载量达 1500 万次。

  7. DeeplearningAIAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达来信:AI 工程技能图谱详解——软件工程基础

    吴恩达在来信中梳理 AI 工程技能图谱里的软件工程基础,涵盖构建全栈应用、管理数据、设计系统架构、构建安全可靠的系统、在生产环境中扩展并运维五类能力。他指出理解软件基础能帮助开发者引导编码智能体在延迟、可用性、可靠性、成本等方面做出正确权衡,而不懂基础的新手用 vibe coding 只会做出糟糕取舍。他强调深刻理解软件如何工作的开发者远优于仅凭感觉编程的人,后续两封信将继续讨论。

  8. 卫诗婕|商业漫谈Jane's talkAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和蚂蚁、千问、吉利、OPPO、vivo 五位总裁聊 Agent 的商业元年、漏斗与放大器

    在支付宝年度生态大会的闭门圆桌上,蚂蚁集团 CEO 韩歆毅、千问事业部总裁吴嘉、吉利首席工程技术科学家任向飞以及 OPPO 唐凯、vivo 周围五位高管,围绕 Agent 商业化关键元年讨论了流量漏斗向意图放大器的转变、终端从应用入口变为意图入口,以及跨端协同与开放生态的利益信任难题。

  9. 土猛的员外AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorkBuddy、豆包工作、千问办公开战,企业 AI 的机会反而更清楚了

    腾讯升级 WorkBuddy 并推出企业版 AI 工作台,阿里把多条产品线整合为千问办公并接入钉钉,字节发布豆包工作并与飞书打通,AI 办公竞争进入由 Agent 接收目标、拆解任务、调用工具并交付结果的阶段。但员工个人提效不等于企业提效,组织、流程、知识与协同四类问题仍待解决,这类市场更重、更难标准化,也并非大厂优先级最高的生意。

  10. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gavin Baker 收回数据中心批评:称数据中心对美国整体是好事

    Gavin Baker 为其此前批评数据中心的帖文语气致歉,改口称数据中心对美国整体是好事。他称18个月前关于用水、税收、就业与电价的担忧已被结构良好的项目基本解决:美国数据中心用水远少于高尔夫球场,部分旧数据被夸大约1000倍;数据中心缴纳可观房产税,Loudoun County 每年税收约10亿美元,Quincy 的数据中心占房产税名单一半以上;电工、管道工等蓝领需求大增。

  11. andrew chen(@andrewchen)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Coding in 2026:100 倍的副业项目,0 倍的真正交付

    一则关于 2026 年编程现状的讨论指出,AI 让副业项目的产出量达到 100 倍,实际交付上线的却仍是 0 倍。该帖获得 602 个点赞、23 次转发,浏览量达 74187。

  12. 十字路口CrossingAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pyromind 创始人 Kevin Ding 谈 AI 下半场:不会只剩一个超级模型,押注 AutoRL 与 PyroDash

    Pyromind 创始人兼 CEO Kevin Ding 认为,AI 终局更像 Agent 蜂群而非超级基础模型一统天下,需求世界的多元性决定了小模型不会被中心化大模型完全替代。

8月30日周日
  1. Richard Socher(@RichardSocher)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 谈德国创业环境:曾向默克尔、朔尔茨、默茨推动改革,建议设经济特区

    Richard Socher 表示,他已向默克尔、朔尔茨、默茨及其内阁成员讨论过包括对创始人股份未实现收益征税在内的多项法律改革,近年虽有改善但仍不够,德国本可释放大量创业活力,或许需要类似中国当年那样的经济特区。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:对手忙着犯错时,别打断他们

    Logan Kilpatrick 发帖称"如果对手正忙着犯错,别打断他们",该帖获得 5064 次点赞、600 条回复、139 次转发和 77 万次浏览。内容未涉及具体模型、产品或技术细节。

8月29日周六
  1. Aadit Sheth(@aaditsh)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Uber Engineering 的内容为何被称为"爆款"?

    Uber Engineering 发布的内容被评价为"banger content",该推文附带的文章链接引来 1.8 万余次浏览和 17 个点赞。发帖者借此询问还有哪些公司在产出同样水准的内容。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:AI 工程仍离不开软件工程基本功,从数据管理到用户界面

    吴恩达在本周通讯中指出,开发者若缺乏软件工程基础,就无法引导 coding agent 做出构建优秀应用所需的结构性决策,容易把玩具版直接部署上线,事后才面对延迟、可用性和算力成本问题。

  3. AI炼金术AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OPC 已凉、FDE 会消亡?AI 炼金术聊 Codex 上门装机与 DeepSeek 新 harness

    徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。

  4. andrew chen(@andrewchen)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    廉价蓝牙戒指或可当作刷 TikTok 的触发器

    有人提出,人们买来刷 TikTok 的廉价蓝牙戒指或许可以用作触发器。该想法来自一条社交平台短文,未给出具体产品型号、实现方式或验证结果,也没有说明是否已实际测试。

  5. Greg Brockman(@gdb)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Greg Brockman:GPT 5.6 Terra 和 Luna 在 OpenRouter 打折后 token 用量暴涨 13.8 倍,印证杰文斯悖论

    GPT 5.6 Terra 和 Luna 在 OpenRouter 大幅打折后,token 用量暴涨 13.8 倍。Greg Brockman 借此指出杰文斯悖论:技术让资源使用更高效时,该资源的总消耗量反而上升而非下降。

  6. Andrew Ng(@AndrewYNg)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能体编码时代,软件工程基础发生了哪些变化?Andrew Ng 发布 AI Engineering Skills 技能图谱

    Andrew Ng 发布面向软件工程基础的 AI Engineering Skills 技能图谱,回应智能体编码(agentic coding)对这一领域的改变。该图谱以软件工程基础知识为切入点,配合其 X 平台长文一并发布。

  7. DeepLearning.AI(@DeepLearningAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:缺乏软件工程基本功,编程智能体常做出损害延迟、可靠性与成本的错误取舍

    吴恩达指出,缺乏扎实软件工程基本功的编程智能体常默认做出损害系统延迟、可靠性与成本的错误取舍。本期 The Batch 还覆盖 GLM-5.3 以开放权重带来高级网络安全能力、OpenAI、Google 与 Nvidia 提升实时交互吞吐,以及 DeepSeek-V4-Pro 随附开源 harness。

  8. eric zakariasson(@ericzakariasson)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    eric zakariasson 分享完整配置

    eric zakariasson 在 X 上发布了一条帖子,分享了"full setup"的链接,并引用了自己此前发布的文章链接。帖子未披露具体模型、产品或配置细节。

8月28日周五
  1. Stack Overflow BlogAI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    保持 AI 精简,才能保持 AI 正确

    Stack Overflow 博客文章探讨让 AI 保持精简为何有助于其保持正确。文章以 Lean 为例说明:Lean 既是函数式编程语言,也是证明助手,开发者可在同一套系统内编写程序并验证其数学正确性。

  2. 阮一峰的网络日志AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    科技爱好者周刊(第 410 期):你需要知道的 AI 三种机制

    AI 能回答问题依靠三种机制:参数机制把人类知识拆成 token 并训练出权重(如 GLM 5.3 的 7440 亿个参数),推理机制补出参数里没记的知识,联网机制则通过 Agent 或应用框架搜索前两者都无法得到的知识。

  3. Richard Socher(@RichardSocher)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如果智能体看重准确率与时间,你得到了

    这条动态称,如果准确率和时间对你的 AI 智能体很重要,那你就得到了。内容由 xgo.ing 提供支持,未给出具体模型、参数或基准数据。 (说明:原文正文仅一句话加互动数据,没有可核验的模型名、版本号、参数或 benchmark,因此摘要按要求压缩至最短,不做任何补写。)

  4. Greg Brockman(@gdb)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 成功帮用户预约理发,ChatGPT Work 正成为个人 AGI

    ChatGPT 帮用户 Max Weinbach 成功预约了一次理发,他随后完成了理发。这条体验来自 ChatGPT Work,Greg Brockman 转发并评论称 ChatGPT 正日益成为你的个人 AGI。

  5. Google DeepMind(@GoogleDeepMind)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 研究副总裁 Zoubin Ghahramani 谈 AI 如何理解不确定性

    Google DeepMind 研究副总裁 Zoubin Ghahramani 与 Fryrsquared 对谈,探讨为何让系统具备"自我怀疑"与概率思维,能带来更安全可靠的现实决策。内容从天气预报、机器人等场景切入,涵盖不确定性的作用、正确性与置信度的区别、AI 中的贝叶斯思维及面向 AGI 的未来研究。

8月27日周四
  1. L先生说AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    这些小习惯,在AI时代会变得越来越重要

    面对AI日益普及,作者提出七项仍值得坚持的习惯:记录自己的想法与感受以强化思维独特性,多与真人接触交流,学外语以提升认知储备、延缓大脑老化,维护日常备忘录并让AI帮忙检索提炼,偶尔读需要动脑的内容,用AI解决生活中的"将就",以及偶尔什么也不做、让大脑习惯低刺激模式。

  2. Naval(@naval)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval:你是祖先从蝌蚪到猴子一路不间断复制的结果,别做第一个错过分支的人

    Naval 发帖称,你能存在是因为从蝌蚪到猴子再到如今的祖先链条从未中断地完成了复制,并提醒"不要成为第一个错过分支的人"。该帖获 14144 次点赞、1383 次转发,浏览量 8653430。

  3. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 更新 AI 最关键的数字:OpenAI 与 Anthropic 收入增长追踪

    Epoch AI 更新对 OpenAI 与 Anthropic 收入增长的追踪:OpenAI 过去一年收入 run rate 从 130 亿美元增至超 400 亿美元,Anthropic 2026 年第一季度 run rate 增长逾两倍,据报道 7 月底达 650 亿美元。

  4. Lex Fridman(@lexfridman)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 与 DHH 的对话已上线 YouTube、Spotify 和播客

    Lex Fridman 发布了与 DHH 的对话,内容已在 YouTube、Spotify 和其官网播客上线。该推文提供了三个平台的收听链接。

  5. Lex Fridman(@lexfridman)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 与 DHH 五小时对谈:AI 智能体编程、Omarchy Linux 与编程的未来

    Lex Fridman 发布与 DHH 的第二轮对谈,全长 5 小时,话题覆盖 AI 智能体编程、软件的演变、AI 对开源的影响、自建 Omarchy Linux 发行版,以及 vibe coding 与 agentic engineering 的区别。

  6. Sahil Lavingia(@shl)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    疫情期间被热议的"多职并存",如今真能实现却无人再提

    Sahil Lavingia 指出,新冠疫情期间人们热议"多职并存"(overemployed)却难以实现,如今远程办公让这真正可行,反而没人讨论了。

  7. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GDM 回应关注:专注让 AI 造福人类并为客户交付实用产品

    GDM 表示正高度专注于确保 AI 造福人类,并为客户交付实用产品。该表态由 @rsdgpt 发出,未披露具体产品、模型或时间表。

  8. andrew chen(@andrewchen)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当你说"我在和一个 model 约会":SF 和 NYC 的含义并不相同

    关于"我在和一个 model 约会"这句话,在 SF 与 NYC 的含义并不相同。原文未展开具体差异,也未给出更多细节。

  9. LangChain BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布 State of AI 2024 报告:AI 智能体崛起,开源模型使用量激增

    LangChain 发布 State of AI 2024 报告,基于 LangSmith 每月近 3 万新增用户的使用数据。OpenAI 仍是最常用的 LLM 提供商,使用量是第二名 Ollama 的 6 倍以上,Ollama、Groq 首次进入前五,开源模型提供商合计占前 20 名的 20%。

  10. Adam D'Angelo(@adamdangelo)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adam D'Angelo:跨模型合并统计 tokens 指标毫无意义

    Adam D'Angelo 指出,任何把多个模型的 tokens 合并计算的指标都毫无意义,因为 tokens 无法跨模型比较。他认为这一结论一直成立,而随着模型日益多样化、推理占全部 tokens 的比重越来越大,它正变得越来越成立。

8月26日周三
  1. LangChain BlogAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 谈 Wiki Memory:用文件为 AI 智能体构建记忆层

    LangChain 提出 Wiki Memory 模式,即用智能体把日志、笔记、代码、文档等原始数据压缩成持久、结构化、可检查的文件知识层,供后续智能体直接读取。它与 RAG 的区别在于预计算并维护高阶综合结果,而非查询时检索原始分块。DeepWiki、Karpathy 的 LLM Wiki 与 Factory AutoWiki 是该模式的实例,适合持久领域知识而非短期对话状态。

  2. LangChain BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 谈 Agent 可观测性:仅有 trace 不够,还需反馈驱动学习

    LangChain 发文指出,Agent 可观测性不该只当调试工具,其更深层的价值在于驱动学习,而单靠 trace 无法形成闭环。学习可发生在模型、harness 和上下文三个层面,既可由人工审查 trace 完成,也可通过在线评测等自动化方式发现值得关注的轨迹。反馈形式包括用户显式评分、间接用户行为、LLM-as-a-judge 和确定性规则,核心要求是把反馈与 trace 一起存储。

  3. LlamaIndex 🦙(@llama_index)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 旧金山第二场创始人晚宴:AI 时代护城河何在

    LlamaIndex 在旧金山举办第二场创始人晚宴,由 jerryjliu0 与 GuangyuRobert 联合主持,@Fundamental 团队参与。讨论聚焦 AI 时代护城河:前沿实验室正从模型 API 转向垂直智能体,如 ChatGPT Health、Claude for Legal,护城河落在智能体工程、基础设施优化、领域评测与数据、工作流经验及 GTM 与品牌。