跳到正文

#Agent

今日 146 条
9月2日周三
  1. Aadit Sheth(@aaditsh)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sriram Krishnan 谈 AI 智能体的运行环境之惑:代码跑在云端还是本地 Mac mini?

    Sriram Krishnan 指出当前各类 AI 智能体的一个真实痛点是「代码到底在哪里运行」:是否需要访问本地文件系统、能否从手机发起任务、任务究竟跑在云端还是需要本地 Mac mini 开机并同步。他认为围绕这一问题的现有 UX 隐喻仍待改进。

  2. eric zakariasson(@ericzakariasson)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok @bot 支持 webhook 触发,可从任意位置唤醒

    Grok 的 @bot 现已支持从任意位置唤醒:创建 routine 时点击 "add trigger" 并选择 webhook 即可。可用的触发场景包括收到特定联系人的 WhatsApp 消息、Notion 页面变更、家庭温度传感器越过阈值、GitHub action 完成或服务器错误率飙升等。

  3. 得物技术AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    得物小摊 AI Native 演进实录:用 Harness 构建可控 AI 交付

    得物小摊从 0 到 1 孵化中由一人同时负责 H5、运营后台、Node 网关和 Go 服务,AI 并行参与多模块后,作者把重点从写 Prompt 转向 Delivery Harness,用 Version Contract、Execution Boundary、Evidence Gate、Repair Loop 四个组件接管交付状态。

  4. Dify(@dify_ai)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify Agent 新手指南:如何构建、管理并接入 Workflow

    Dify 发布新 Agent 上手指南,介绍其构建、管理与两种使用方式:既可独立运行,也可接入 Workflow。正文未披露模型版本、参数规模或评测数据,仅给出 cloud.dify.ai 的入口链接。

  5. AI产品黄叔(@PMbackttfuture)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 网站上线自动更新:每日新案例置顶展示

    名为 grokbot.aihuangshu.com 的网站已实现用 Grok Bot 自动更新,每日新案例在顶部呈现,方便查看 Grok Bot 的最新变化。

  6. 阿里研究院AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    千问 Qwen3.8-Max 升级 0902 版本,主打编程与专业办公

    千问 Qwen3.8-Max 升级到 0902 版本,围绕编程(Coding)和专业办公(Cowork)进行后训练,更适合企业真实复杂任务、科研和长周期任务。在 CodeArena 前端编程总榜中,该版本提升 22 分至 1691 分夺得冠军,在多步推理、工具调用、端到端 app 生成方面刷新成绩。

  7. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    H3 Max 驱动互动电影引擎「THIS WAY」:观众投票决定剧情走向

    开发者 Henry Daubrez 用 MiniMax H3 Max(经 fal 调用)搭建了互动电影引擎「THIS WAY」,可记忆角色、故事线和后果,观众实时投票,两个未来分支同时生成,胜出者成为正史并推动剧情继续。他强调这不是无限生成,而是让 AI 服务于真实情节。

  8. DeeplearningAIAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 与 Cerebras 预览 Ultrafast,GPT-5.6 Sol 吞吐最高 750 token/秒

    OpenAI 与 Cerebras 预览 Ultrafast,这一 API 服务层运行在 Cerebras 硬件上,搭载 GPT-5.6 Sol,宣称每秒最高输出 750 个 token;Artificial Analysis 在 OpenAI 自家 API 上以最高推理强度测得 GPT-5.6 Sol 为每秒 65 个 token。

  9. AI产品黄叔AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包工作上线 Agent 能力:云端跑任务,手机派活到公众号草稿箱

    豆包工作上线 Agent 能力并推出专门的电脑版,任务在豆包云电脑上运行,手机派活后电脑、网页端可随时接续查看。作者实测把知识库搬到飞书云盘,用自建 skill 提取视频号逐字稿、调用 3 个 Agent 写 3 篇文章再经 3 个评审合成一篇,确认后直接推送到公众号草稿箱,全程约一小时。下载电脑版可限时领 30 天会员。

  10. AI产品黄叔(@PMbackttfuture)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Grok BOT 分身自动转发任务、指挥其他 BOT 并私聊汇报结果

    AI产品黄叔构建了一个 Grok BOT 分身并拉进其他群,可自动把任务转发到所在群、指挥其他 BOT 完成任务,最后在私聊窗口汇报结果。他还提到 Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘专享资源与 Grok 额度,并能自行调用 DeepSeek API。

  11. 开始连接LinkStartAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vol.129|AI 办公会战打响:WorkBuddy、豆包办公、千问办公入场,为何反而利好创业者?

    极客公园播客「开始连接 LinkStart」本期邀请创新工场汪华与 Floatboat.ai 创始人谭少卿,围绕 WorkBuddy、豆包办公、千问办公相继入场后的 AI 办公会战展开讨论。

  12. AI产品黄叔(@PMbackttfuture)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    建一个 GrokBot 社群:把任务逐个迁到 GrokBot,走向全自动化远程办公

    有人发起 GrokBot 社群并开始直播,把各项任务逐个迁移到 GrokBot 上,认为这是大部分人进入全自动化远程办公的最低门槛方案。

  13. Qwen(@Alibaba_Qwen)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 登顶 CodeArena WebDev 榜单

    Qwen3.8-Max-0902 在 CodeArena WebDev 排行榜升至第一,得分从 1669 提升到 1691,创下智能体编码(WebDev)工作流的新纪录,在多步推理、工具调用和完整应用生成方面表现突出。

  14. AI产品黄叔(@PMbackttfuture)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 被指可替代 Hermes:8核16G 云主机、多 bot 互不干扰、可连本地电脑

    有用户总结 Grok Bot 的几个特点:8核16G 云主机、速度极快,支持多 bot 互不干扰甚至可拉群,还能连接本地电脑,认为完全可以替代 Hermes。其表示随着 Grok 模型能力进一步增强会更强,计划让越来越多工作由 Grok Bot 接管,包括让它自己更新 Grok Bot 手册。

  15. AI产品黄叔(@PMbackttfuture)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 Grok Bot 接入 Mac 上的 zcode cli,公众号文章被自动收录并更新到线上

    有人把 Grok Bot 接入 Mac 上的 zcode cli,再把刘小排的公众号文章发给它,文章就被自动收录并更新到线上版本。该流程已确认上线,地址为 grokbot.aihuangshu.com。

  16. 宝玉的分享AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布高效电商 AI 智能体架构指南

    Anthropic 的 Claude 博客发布电商 AI 智能体解剖指南,基于与零售商、电商平台及旅游、娱乐、电信团队的落地合作,主张在标准智能体循环中运行单一模型,用技能承载长尾需求而非拆分多个子智能体。

  17. cat(@_catwu)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为面向编码与知识工作的先进模型。发布方表示,团队借助 Fable 5.1 承接了此前需数月才能完成的更大项目,用户可在 Claude Code、Claude Cowork、Claude Tag 中调用该模型处理任务。

  18. DeepLearning.AI(@DeepLearningAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepLearning.AI 发布 AI 工程技能图谱第二支柱:软件工程基础

    DeepLearning.AI 公布 AI 工程技能图谱第二支柱"软件工程基础",提示编码智能体虽能写出可运行代码,但仅靠"氛围编程"而缺乏软件工程基础会损害系统的长期可靠性、安全性与可扩展性。该支柱涵盖全栈应用构建、数据管理、系统架构设计、系统安全与可靠、生产环境扩展与运维五项技能,相关解读由 Andrew Ng 提供。

  19. Augment Code(@augmentcode)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code 模型选择器上线 Claude Fable 5.1

    Augment Code 的模型选择器现已上线 Claude Fable 5.1,初期沿用 Fable 5 的用例,聚焦需要深度推理的超长多步骤任务,并逐步推动模型完成可无人值守运行的任务,用户可在 Cosmos 中试用。

  20. Alex Albert(@alexalbert__)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 随 Fable 5.1 推出 Enterprise Frontier Safeguards(EFS)

    Anthropic 随 Fable 5.1 发布 Enterprise Frontier Safeguards(EFS),被称为"ZDR++":企业数据仍留在自有云中,新增的自动监控层可跨会话识别智能体的风险行为模式。该功能面向企业客户,在提供与零数据保留同等隐私的同时防止对抗性使用,将于今年秋季起分阶段推出。

  21. v0(@v0)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5.1 在 v0 的 Premium 和 Plus 套餐上线

    Claude Fable 5.1 已在 v0 的 Premium 和 Plus 套餐中上线,可在 v0.app 试用。

  22. Martin Fowler(@martinfowler)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 谈 LLM 陈词滥调高亮器、长时程自主智能体架构与 CI 中的智能体

    Martin Fowler 在 Fragments 中讨论了 LLM 陈词滥调高亮器、面向长时程自主智能体的架构、Continuous Integration 与智能体的结合,以及 AI 生成的超级病毒和"高产学术幽灵"现象。内容以碎片化条目形式发布在 martinfowler.com。

  23. Mike Krieger(@mikeyk)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5 定价维持 $10/$50,API 缓存读取降价 75% 至 $0.25/MTok

    Fable 5 定价与 Fable 5 相同,为 $10/$50,API 缓存读取价格下调 75% 至 $0.25/MTok。该模型被描述为工作方式更诚实:给它一个目标,它会持续执行直至达成,遇到卡点时如实说明,而不是谎报成功。

  24. Mike Krieger(@mikeyk)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,官方称二者是面向编码与知识工作最先进的模型。Fable 系列面向可自主运行的复杂多步任务,Fable 5.1 在编码、知识工作和长时间问题求解上设立了新标准。该内容为转述推文,正文细节有限。

  25. DeepLearning.AI(@DeepLearningAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepLearning.AI 盘点 AI 公司争夺推理速度:GPT 5.6 Sol 达 750 tokens/s

    DeepLearning.AI 指出头部 AI 公司正把推理速度视为值得投入的架构要求。OpenAI 与 Cerebras 展示 GPT 5.6 Sol 达到 750 tokens per second。

  26. Lovable(@lovable_dev)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 如何实现模型接入与路由:Fable 5.1 已可用于构建

    Lovable 说明了其模型接入方式:每周出现新 AI 模型时,团队会逐一测试、调优并决定路由方式,以保证构建效果最佳。Lovable 现已支持使用 Fable 5.1 进行构建。

  27. Alex Albert(@alexalbert__)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 评价 Claude Fable 5.1 能自动补全模糊指令

    Alex Albert 表示 Claude Fable 5.1 给他留下深刻印象,他只需用几句模糊、零散的描述说明需求,模型就能自行补全剩下的部分,并按其预期方式填补信息缺口。被引推文显示 Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,称两者是面向编码与知识工作的最先进模型。

  28. Genspark(@genspark_ai)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 推出 GenTeam:一人一天处理数百工单,AI 智能体分类修复回复

    Genspark 发布 GenTeam,由 AI 智能体承担客服工单的分类、修复与回复,人类只接管真正需要人工介入的通话,一人一天可处理数百张工单。创始用户通道开放至 10 月 8 日,提供完整产品且免费使用。

  29. Google AI Developers(@googleaidevs)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 支持智能体视频理解

    Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 已支持智能体视频理解,即日起可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上传视频及处理 YouTube 视频。更多细节见官方博客。

  30. Google AI Developers(@googleaidevs)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 如何用智能体视频理解能力数清拍手次数

    Gemini 3.7 Flash 借助新的智能体视频理解能力,可自动调整处理速度,准确识别并统计每一次拍手,解决了静态处理默认 1 FPS 下瞬间动作易被漏掉或与打响指、点击混淆的问题。该能力针对快速动作计数的难点,展示了模型按需调节视频处理速度的方式。

  31. mem0(@mem0ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 谈 AI 智能体:模型跑分差距微弱,记忆能力才是关键

    mem0 认为当前模型竞赛差距已小到一个百分点都难以决胜,但真正能"放手不管"的智能体,比拼的是能否跨会话保留信息——benchmark 上聪明 2% 却一关会话就全部遗忘的智能体反而落败。该帖还向用户征集本月被编码智能体重复追问的问题。

  32. mem0(@mem0ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 谈 AI 智能体委派:异步云 VM 中一次错误会被放大成数十次决策

    mem0 指出,缓存示例只是一次性决策,一个瞬间就能纠正;但委派意味着智能体在整轮运行中要做数十次决策。在云 VM 中异步运行、从任务队列取任务的智能体,没有人在旁边实时纠正,因此它需要的是确定性而非猜测,因为它记得上次猜错的结果。

  33. mem0(@mem0ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编码智能体终于能独立交付可用代码:关键在于无需反复交代背景

    编码智能体正迎来爆发,原因很朴素:它们终于能在无人逐行盯守的情况下交付可运行的代码。这已不是自动补全,而是任务委派,前提是被委派的人或系统不必每次都听完整背景。

  34. Google DeepMind(@GoogleDeepMind)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 推出智能体视频理解能力,上线 3.7 Flash 等模型 API

    Google DeepMind 宣布 Gemini 推出智能体视频理解能力,不再扫描整个文件,而是跨视频字幕、音频和画面进行推理,并动态调整帧率以提取所需片段。

  35. NVIDIA Technical BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 NVIDIA Nemotron 构建自适应智能体网络安全系统

    NVIDIA 发布基于 Nemotron 构建自适应智能体网络安全系统的方案,用于应对现有告警、预定义工作流和已知攻击行为难以覆盖的防御盲区。该系统让智能体跨安全运营环节协同工作、在长周期内追求复杂目标,重点识别防御遗漏并将缺口转化为改进方向。

  36. eric zakariasson(@ericzakariasson)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 grok bot 团队开发 grok bot

    作者转述 Lingxi Li 分享的做法:把 grok bot 当作带自有电脑、可管理编码智能体的实习生,按 iOS、桌面、基础设施、Android、harness 等领域分工,专项 bot 表现更稳定。

9月1日周二
  1. Philipp Schmid(@_philschmid)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编程智能体越来越偏爱 bash:又一个 Bitter Lesson 正在到来

    Philipp Schmid 指出,编程智能体正越来越多地放弃专用工具转而使用 bash,并已在 Bash 上达到超人水平。前沿模型如今能在数秒内写出复杂的一次性脚本,完成原子化 Python 多文件编辑、git worktree 操作和日志聚合。

  2. Anton Osika – eu/acc(@antonosika)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 称模型选择器时代将结束,超 10 亿条 prompt 已用于自动选型

    Lovable 联创 Anton Osika 表示,模型选择器时代正在结束,平台已收到超过 10 亿条 prompt,并借此学习每个任务上哪种模型表现最好。系统会为每条 prompt 决定合适的模型、工具、指令和上下文,并判断何时重试、何时重新规划、何时把工作路由到自家训练的模型。

  3. DeepLearning.AI(@DeepLearningAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 的 GLM-5.3 在 CyberGym 漏洞基准上达到 84.5%

    Z.ai 的 GLM-5.3 在 CyberGym 漏洞基准上达到 84.5%,超过多家头部闭源模型,也明显高于前代 GLM-5.2。据 DeepLearning.AI 介绍,这一提升完全来自对模型智能体能力的微调与优化,未改动基座模型;由于该模型在寻找和定位潜在漏洞方面能力过强,Z.ai 暂缓开放权重以进行安全测试。

  4. Richard Socher(@RichardSocher)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Braintrust 评测:加入搜索后模型差距从 47.9 分缩小到 5.6 分

    Braintrust 评测了 1329 道时事问题,覆盖 4 个模型和 14 种条件,对比 You.com、模型自带搜索和无搜索三种配置。结果显示搜索把模型间差距从 47.9 分缩小到 5.6 分,检索增益随事件变旧从约 45 分降到约 24 分,而 5 次以上搜索的运行得分仅 19%–49%。Richard Socher 转评称更好的搜索让模型之间的差异变得小得多。

最多提供 50 页,更早的内容请使用搜索或主题页。