跳到正文

#Agent

今日 160 条
10月9日周五
  1. Claude(@claudeai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,编码与电脑操作能力较 4.5 明显提升

    Anthropic 宣布 Claude Haiku 5.5 发布,称其在编码、computer use 和知识工作方面相比 Haiku 4.5 有明显提升。

  2. Claude(@claudeai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Haiku 5.5,首次为 Haiku 系列加入可调 effort 设置

    Anthropic 发布 Haiku 5.5,这是首个带有可调 effort 设置的 Haiku 模型,用户可针对每个任务自行决定侧重成本还是智能表现。

  3. meng shao(@shao__meng)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 面向超 12 亿周活 ChatGPT 用户推送,新增 Intelligent UI 能力

    GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来新的 Intelligent UI 能力:回复可用文本、视觉与交互元素共同组织,包含图形、按钮、表单、图表乃至可直接使用的交互式工具。

    为什么值得看

    原文给出 GPT-6 面向 12 亿周活用户推送的消息,并拆解 Intelligent UI 的两层技术实现。

  4. meng shao(@shao__meng)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软将 Windows 定位为 hybrid intelligence 之家,发布四层 AI Agent 架构

    微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。

  5. meng shao(@shao__meng)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 CS 329Z《Engineering AI Agents》第 4、5 讲公开:Tool Use 与 Frameworks & Orchestration

    斯坦福 Fall 2026 课程 CS 329Z《Engineering AI Agents》第 4、5 讲已公开,分别由 @Diyi_Yang 讲「Tool Use」、@Diyi_Yang @michaelryan207 @jyangballin 讲「Frameworks & Orchestration」。

  6. meng shao(@shao__meng)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 benchmark 领先 GPT-6 Luna,用户从 CodeX 迁移到 Claude Code

    Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。

  7. meng shao(@shao__meng)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里「AI Native 研发范式实践手册」四点陈述:从写代码到可靠交付仍需解决大量技术问题

    阿里在「AI Native 研发范式实践手册」结尾给出四点官方陈述:从写代码到可靠交付仍有较多技术问题待解,基础设施工程复杂度可能不亚于 Agent 应用层建设。企业知识资产尚未做到 Agent 友好,结构化、版本化、权限管理与质量治理仍有大量工作;组织设计影响更深远且更难有确定答案,AI 迭代速度还会持续冲击现有架构,需保持架构适应弹性。

  8. meng shao(@shao__meng)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为 Deep Agents 的 Skills 做了三项工程升级:工具绑定、固定与中途重载

    LangChain 为 Deep Agents 框架的 Skills 带来三项工程升级:工具绑定 Skills 通过 SKILL.md 的 metadata.include_tools 声明工具。

  9. meng shao(@shao__meng)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯云开源自托管多智能体 AI 助手平台 Octop

    腾讯云开源自托管多智能体 AI 助手平台 Octop,面向家庭和小团队,主打多用户、多智能体和数据完全留在本机。整个系统为单个 Python 进程,数据落在 ~/.octop/,默认 SQLite(WAL 模式)并可切换 PostgreSQL;模型层走 OpenAI 兼容 API,支持 DashScope、Ollama 与可替换的存储和渠道。

  10. 宝玉(@dotey)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,价格降至上一代的十分之一

    Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,长请求为 0.5 和 2.5 美元,便宜一半。

    为什么值得看

    Haiku 5.5 的降价与跑分变化并列给出,可据此判断小模型在批量任务和子智能体场景中的成本位置。

  11. 宝玉(@dotey)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lauren 30 天消耗 1.5T Token:用得最多的是 Opus 5.5,Cloud 是消耗大头

    宝玉披露,Lauren 30 天 Token 消耗达 1.5T,用得最多的模型是 Opus 5.5,Cloud 是消耗大头。Cloud 上每个任务可用独立虚拟机并行,但改动验证不如本机方便。他同时提醒,不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最好模型且有充足 Token;AI 验证只能替代一部分,方向仍需人自己把握。

  12. 宝玉(@dotey)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 推送 GPT-6 与 Intelligent UI 智能界面

    OpenAI 开始向 ChatGPT 推送 GPT-6,主打功能为 Intelligent UI,可根据问题类型生成可点击、可调节参数的界面,Plus、Pro、Business、Enterprise 用户今天起可用,免费版和 Go 版明天起陆续开放。

    为什么值得看

    对比了 OpenAI 与 Anthropic 在交互式回答上的两种路线,读者可据此判断界面生成的实现差异。

  13. 宝玉(@dotey)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 Fable 编排 SubAgent 与 Advisor 验收的 Claude Code 用法

    宝玉分享了自己在 Claude Code 中使用 Fable 的用法,把任务交给 Fable 负责分析、编排和验收,再派 SubAgent(Opus)去执行,大部分时间 Fable 在等 SubAgent 执行,因此可以持续派活而无需等待任务完成。

  14. elvis(@omarsar0)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DAIR.AI 推出 MCP 工具,可接入 Codex/Claude/Grok Bot 探索 AI 论文

    DAIR.AI 发布论文 MCP 工具,接入 Codex、Claude 或 Grok Bot 后即可发现并探索精选 AI 论文,索引涵盖其近两年在 X 上推荐的全部论文。功能包括查找与总结论文、探索 harness engineering 合集、检索 SOTA 结果、生成文献综述与调查、构建个人收藏及可视化论文。官方表示未来几周还将发布多项 benchmark,并持续更新。

  15. elvis(@omarsar0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 论文 VERA:把基准轨迹转为 9000+ 可重启沙箱并共演化模型与 harness

    NVIDIA 发布论文 VERA,将基准轨迹转化为超过 9000 个可重启沙箱并配合 rubric 评分,只保留能运行且可依据可观察证据打分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才被保留,模型 checkpoint 若分数下降超过 20% 则被拒绝。

  16. elvis(@omarsar0)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Viktor:用 AI 员工自动排查 agent 评测结果,$100 免费额度

    Dair.ai 创始人 Elvis 用 AI 员工 Viktor 自动排查 agent harness 的夜间评测结果:23 个昨天通过、今天失败的任务会被逐一检查日志、追溯到引发失败的改动并建议回滚。Viktor 在 Slack 中运行,还会主动标记问题,目前可免费试用并赠送 $100 额度、无需信用卡。

  17. elvis(@omarsar0)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    个人智能体之上的 Agent 间通信,Opus 5.5 协调能力被低估

    个人智能体之上的 Agent 间通信让 Opus 5.5 的协调能力被低估,但仍需在 automations、webhooks、系统提示词和工具调用上调优,并在合适时机检索上下文。

  18. elvis(@omarsar0)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 研究:给多模态模型接入工具会削弱其拒绝有害请求的能力

    NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。

  19. elvis(@omarsar0)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cogent 推出 Attack Path Analysis,用自研网络安全模型防御 AI 智能体集群攻击

    Cogent 发布 Cogent Attack Path Analysis,用其自研网络安全模型找出 AI 智能体集群可能利用的更长入侵路径,并指出能一次性封堵每条路径的单个修复点。

  20. elvis(@omarsar0)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DAIR.AI 推出 MCP 工具,可在 Codex/Claude/Grok Bot 中检索 AI 论文

    DAIR.AI 发布 MCP 工具,将其 AI 论文索引接入 Codex、Claude、Grok Bot,用于发现和梳理热门论文。该索引收录了 elvis 近两年在 X 上推荐的论文,支持查找与总结论文、生成文献综述、可视化论文等功能。官方称未来几周还将发布多个配套 benchmark。

  21. elvis(@omarsar0)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能体接口或许不再需要屏幕:NaturaAI 推出 99 美元戒指 Interface

    NaturaAI 推出名为 Interface 的戒指硬件,售价 99 美元,明年 1 月发货,用户按住说话、松开即可把请求发给 Claude Code、Codex、Hermes 等所连接的智能体。该产品被定位为智能体时代的首要硬件,主张更简单的接口才是趋势,因为如今智能体已足够好用,慢的一步反而是把任务交给它们,而掏出手机打字会打断专注。

  22. 小互(@imxiaohu)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok Bot 改用顶级模型驱动,包括 Claude Opus 5.5、MidJourney、Suno

    马斯克宣布 Grok Bot 今后将针对不同任务调用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 及其他领先 API,以求得最优结果。他称 SpaceX 也将采用同样策略。此举疑似为即将推出的大一统订阅服务做准备。

  23. 小互(@imxiaohu)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 发布实时数据看板 Dashboards 与动态解说工具 Claude Motion

    Claude 发布实时数据看板 Dashboards 和代码驱动动态解说工具 Claude Motion。Dashboards 可直接接入企业数仓或 CRM,用自然语言提问生成联动的业务看板,并随底层数据变动自动刷新;Motion 则把报告、图表或产品演示转成短动画并导出 MP4,由 Claude 用代码为文字、图表、形状和图片编排动画,文字、数字与节奏均可编辑。

  24. 爱范儿AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    早报|苹果一大波新品曝光,最快下周发布/全球纯汽油车份额首次跌破50%/2599 美元起,Surface Laptop Ultra发布

    OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。

  25. 爱范儿AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 Surface Laptop Ultra 与 Windows 混合智能更新

    微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。

    为什么值得看

    梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。

  26. 向阳乔木(@vista8)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木推出 Obsidian 插件 qiaomu-ui-learn,用于学习提升 Vibe Coding 审美

    向阳乔木(@vista8)开发了一款名为 qiaomu-ui-learn 的 Obsidian 插件,专门用于学习提升 Vibe Coding 审美。该插件支持一键复制 Prompt 生成类似网站,可学习网页和手机组件让 Vibe Coding 描述更精准,并内置测试题,在 Obsidian 官方插件库搜“qiaomu”即可安装。

  27. 向阳乔木(@vista8)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    yetone 的 magpie:可参考的 AI Agent 基建,支持多模型配置与 OAuth 登录

    yetone 的 magpie 是一套 AI Agent 基建,支持各种模型配置和 OAuth 登录,开发 AI 工具时可把仓库发给 Agent 学习参考。其平台图标采用 lobehub 整理的 icon,添加服务商的操作也更直观。仓库地址为 github.com/yetone/magpie。

  28. 向阳乔木(@vista8)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok bot 新增搜索、阅读与监控 X 能力

    Grok bot 现已支持搜索、阅读和监控 X。Personal Agent 竞争日益激烈,Grok bot 的用户价值正快速提升。

  29. 向阳乔木(@vista8)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    乔木剪藏发布 Agent 安装 prompt:自动装好浏览器插件与 Obsidian 助手

    乔木剪藏提供一段可直接复制给 AI Agent 的 prompt,让它读懂 README.md 与 native/README.md 后按系统与浏览器完成安装。

  30. OpenAI(@OpenAI)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 GPT-6 推出 Intelligent UI,回复可含图表与交互组件

    OpenAI 宣布 GPT-6 新增 Intelligent UI 能力,可根据用户问题自行组合文字、视觉内容和交互元素来生成回复。回复中可包含用于解释概念的图形与图表,以及按钮、表单等可直接在对话中使用的交互体验。

  31. 美团技术团队AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"

    美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。

  32. 美团技术团队AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团开源 LoHoSearch 搜索智能体评测基准,用知识图谱让机器自动出题

    美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。

  33. 美团技术团队AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团发布全场景 AI Agent 平台 CatPaw,搭载 LongCat 2.0

    美团正式发布全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 超长上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。

  34. 美团技术团队AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团技术团队:Agent评测漫谈——从观测到长程Agent的评测方法论

    美团图灵Agent评测团队公开内部博客,系统讲解Agent评测:评测需覆盖结果层、过程层、效率层、风险层四层,主张"观测+评测=持续迭代",并将模糊指标下钻为二元化Rubric以实现人人一致与人机一致,如Beam人机一致率从62%提升到92%。

  35. 美团技术团队AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    KDD'26 美团学术论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读

    美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。

  36. InfoQAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 用 AI 测试框架探测并加固其 WAF

    Cloudflare 将前沿 AI 模型放入受控测试框架中探测其 WAF,以已拦截的攻击载荷为起点让模型生成并迭代新变体,在 45 个场景中产生 1,107 次尝试,经人工筛查后留下 49 项发现。

  37. InfoQAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 智能体时代,开发团队如何重塑自身?

    Hannah Foxwell 在演讲中指出,Cursor 中智能体请求数已超过 tab 补全接受量,智能体驱动的开发成为主流工作方式。她认为开发团队需围绕三个不变锚点重塑:构建有价值的东西、速度需要安全、人很重要。多数组织尚未准备好让智能体团队向生产环境交付,但应尽早尝试。

  38. InfoQAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InfoQ 网络研讨会:AI 进入生产环境,什么会崩、什么可行、谁来把关?

    InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?

  39. lmarena.ai(@lmarena_ai)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 上线 Battle Mode 与 Agent Mode 测试

    Claude Haiku 5.5 现可在 Arena 的 Battle Mode 和 Agent Mode 中测试,入口为 arena.ai。该消息由 LMArena 发布,未披露模型参数、上下文长度或跑分数据。

  40. lmarena.ai(@lmarena_ai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,上线 Agent Arena 与 Code Arena

    Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。该模型现已加入 Agent Arena,可在其中使用网页搜索、文件系统和终端工具完成长流程智能体任务,成绩尚未公布;同时也在 Code Arena 的 WebDev、Text、Document 和 Vision 板块上线。