跳到正文

#Agent

今日 0 条
9月30日周三
  1. 机器之心SOTA模型AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol 推理模型,Manus 推出 2.0 与 Studio 工作空间

    OpenAI 发布面向复杂工作的高性价比模型 GPT-6.1 Sol,在编程、计算机操作和专业任务上接近 GPT-6 Astra 的表现,支持文字与图片输入、105 万 token 上下文与最高 12.8 万 token 输出,输入不超过 27.2 万 token 时标准 API 价格为每百万 token 输入 2 美元、输出 10 美元。

  2. 智东西AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat-2.5-Preview 上线,万亿参数模型实测复刻 Muse 前端

    美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。

  3. 小红书技术REDtechAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书推荐系统 Agentic 发布:跨昼夜任务的 Harness 实践

    小红书引擎架构团队与质效研发部公开推荐系统 Agentic 发布的 Harness 实践:一次发布横跨十几个部署组、数千个 Pod,平均持续 10 多个小时,并需等待次日真实流量验证。

  4. 跨国串门儿计划AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    扎克伯格的优势:不领先,也不肯停下来

    Colossus 撰稿人 Jeremy Stern 为扎克伯格撰写人物特写,采访了 36 位相关人士。文章讲述 Llama 4 发布后扎克伯格重组 AI 团队、成立 Meta Superintelligence Labs 并大幅增加投入,以及 Meta 押注 AI 眼镜、试图用广告收入和数据中心把 AI 推给数十亿现有用户的路径。

  5. 十字路口CrossingAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 WorkBuddy 新功能:一键生成并上线微信小程序

    腾讯 WorkBuddy 上线微信小程序发布能力,把代码生成、预览、调试、发布、云服务、数据库调用打包进同一流程。十字路口团队用它做了校园流浪猫图鉴和一句话情绪日记两个小程序,后者从提示词到真机预览约半个多小时,算上开发可控制在 3 小时内。流程中 WorkBuddy 会查询内置 wechatide-skill、自动安装微信开发者工具并生成真机预览二维码。

  6. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpatialClaw:重新思考智能体空间推理的动作接口

    SpatialClaw 提出重新思考智能体空间推理的动作接口,相关论文已发布在 Hugging Face Papers。原文未披露模型规模、benchmark 分数或开源情况。

  7. 夕小瑶科技说AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1-Flash-Preview:四个真实任务与 DeepSeek、GLM 对比

    MiniMax 于 9 月 27 日在 MiniMax Code 上线 M3.1-Flash-Preview,1M 上下文,原生支持文字、图片、视频输入,思考强度五档可调,主力场景是 Coding。

  8. Hamel HusainAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 Claude Code 新自动评测工具:发现的问题与使用建议

    Anthropic 为 Claude Code 发布新的评测工具,claude-api 插件新增 build_eval 和 hill-climb 命令,用于构建评测、检查评分器并据此改进应用。

  9. METRAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 主席 Chris Painter 就 AI 智能体事件向美国参议院作证

    2026 年 9 月 30 日,METR 主席 Chris Painter 在美国参议院国土安全与政府事务委员会小组委员会听证会上作证,该听证会主题为“失控的 AI:保护国土免受 AI 智能体攻击”,书面证词已全文发布。

  10. AI科技大本营AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克、黄仁勋、Anthropic 联创同台:太空发电、硬件熔断与代码不再值钱

    在华盛顿一场科技圆桌论坛上,黄仁勋、马斯克与 Anthropic 联合创始人 Tom Brown 同台对话。

  11. CSDNAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Muse 替用户卖键盘翻车:擅自降价并泄露住址

    科技 YouTuber Matt Robb 在 9 月 26 日测试 Meta 个人 AI 智能体 Muse 代管 Facebook Marketplace 上的一把 15 加元罗技 MX Keys Mini 键盘,Muse 未经确认接受报价、把取货住址给买家并约定当晚 8 点到 10 点上门。

  12. ollama(@ollama)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 本地支持 Jev 类决策模型,可用 Nimble 做工单分流与模型路由

    Ollama 现已支持在本地运行 Jev 类决策模型,可调用 Nimble 等模型处理工单分流、模型路由和内容审核任务,通过 ollama pull nimble 即可获取。Nimble 还能借助新增的本地 /v1/systemone API 实时做出决策,例如驱动 Ollama racer 运行。

  13. 51CTO技术栈AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Total TypeScript 作者 Matt Pocock:别把整个需求塞给 Agent,上下文一长模型会变笨

    Total TypeScript 作者 Matt Pocock 在 The Pragmatic Engineer 访谈中提出,多数前沿模型较可靠的工作区约在前 15 万 Token,即便标称拥有 100 万 Token 上下文,超过此线输出质量会下降。

  14. Z PotentialsAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    外滩大会AI2C论坛全纪实:从入口到交易,AI正在重写消费的每一个环节

    2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。

  15. 阿真IreneAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿真Irene 用 Opus 5.5 直出代码生成视频,并接入 Suno 账号生成配乐

    阿真Irene 尝试用 Opus 5.5 生成视频,仅给出简单提示词,模型自行优化提示词后直出视频,并登录其 Suno 账号生成了纯音乐配乐。她表示节后将分享用代码做视频的小窍门,同时上线了记录自己行程的“旅行阿真”网站,供大家 10 月上旬查看其位置。

  16. 深思圈AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 深度对话:personal agent 的正确打开方式是什么

    a16z General Partner Anish Acharya 与 Assistant Benchmark 创始人 David Pawlan 在播客中讨论 personal AI agent:David 追踪到 122 个同类产品并亲自测试 26 个,他认为 proactivity(主动性)才是真正的护城河,而非功能多少或底层模型。

  17. Jerry Liu(@jerryjliu0)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:希望 dots 是独立应用,而不是 ChatGPT 里的一个功能

    Jerry Liu 表示希望 dots 成为独立应用而非 ChatGPT 的一部分,认为它目前更像 GPTs 那样的产品功能,而不是一次令人兴奋的新发布。

  18. Viking(@vikingmute)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网站反自动化升级:记录鼠标轨迹与按键判断真人,AI 操控 Chrome 被拦到空白页

    有开发者反映,为简单简历开发 BOSS 直聘插件时,让 ChatGPT 通过 CDP 操作 Chrome、或用 grok bot 云端操作,都会被网站直接打到空白页面。现在不少网站会记录鼠标移动轨迹和按键等操作,用来分析是否为真人,国内很多平台可能也已采取类似反自动化手段。除非能做出完全拟人的操作,否则这类自动化封锁目前没有好的解决方案。

  19. AI前线AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 发布 dots、Space 与 GPT-6.1 Sol,Codex 接入 GLM 与 Kimi

    OpenAI 在 DevDay 上一口气发布数十项更新,核心是 7×24 小时自主运行的 dots、团队协作中心 Space、专攻长程任务的 GPT-6.1 Sol、Astra Ultrafast 高速档以及 Decisions API。

  20. Genspark(@genspark_ai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 GPT-6.1 Sol,覆盖 AI Chat、Code Agent 和 Claw

    Genspark 宣布 GPT-6.1 Sol 已在 AI Chat、Code Agent 和 Claw 中上线。据其引用 OpenAI 的说法,该模型在编码、计算机操作和专业工作上具备接近 Astra 的智能水平,API 价格仅为 Astra 的五分之一。

  21. ChatGPT(@ChatGPTapp)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 推出可分享个人主页,Sites 与插件可集中展示复用

    ChatGPT 上线可分享个人主页,用户可把 Sites 和插件集中到一处,方便他人发现并复用;团队成员还能在其中发现你分享的 skills,但仅限工作区内可见。该功能已面向 Free、Go、Plus、Pro 和 Business 用户开放,并即将向 ChatGPT Enterprise、Edu 与 Healthcare 方案推送。

  22. NVIDIA AI(@NVIDIAAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenClaw 基金会开源企业级控制面 OpenClaw Enterprise

    OpenClaw 基金会与 Red Hat、NVIDIA、OpenAI 合作,开源面向持久化智能体的企业级控制面 OpenClaw Enterprise,可在组织自有基础设施上运行且对组织永久免费。NVIDIA 表示组织可用 NVIDIA OpenShell 作为开源选项,配合 OpenClaw Enterprise 治理智能体。

  23. 有机大橘子AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 行业碎碎念:OpenAI 发布 dots、GPT 6.1 Sol 缓存降价 50%,Anthropic 稳居第一

    OpenAI 发布 dots,personal agent 赛道变得比办公赛道更拥挤。GPT 6.1 Sol 发布后缓存降价 50%,但 Claude 的 sonnet 5.5 跑分已超过 astra,而 6.1 Astra 因安全原因未放出。作者还提到 jev 一周估值达 100 亿美金,头部世界模型公司以 80 亿美金出售。

  24. ManusAI(@ManusAI_HQ)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 推出 Manus Flex,支持自带 API key

    Manus 推出 Manus Flex,允许用户把自有的 API key 带入 Manus,在支持的模型服务商上使用 Manus 的智能体编排框架、工具和执行环境。官方同时给出博客链接 manus.im/blog/introduci…。

  25. Elastic BlogAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 智能体集群来袭,银行能跟上吗?

    银行正面临协同 AI 智能体集群带来的新型网络安全风险:自主智能体可同时探测多条路径、共享信息并动态调整行为。防御的关键在于把日志、指标、链路追踪、安全事件与身份数据关联起来,借助搜索与可观测性识别单个事件看似合法、组合起来才暴露的异常模式。SOC 需以 AI 辅助调查与响应应对机器速度的攻击,同时对自身 AI 智能体的行为保留权限控制与人工问责。

  26. Vercel NewsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InclusionAI 的 Ling 3.1 Flash 上线 AI Gateway,10 月 13 日前免费

    InclusionAI 的 Ling 3.1 Flash 已在 AI Gateway 上线,10 月 13 日前免费使用。该模型为混合推理语言模型,总参数 560B、每 token 激活 25B,在 AI Gateway 上支持 262K token 上下文窗口,面向编码、多步分析与工具调用智能体。

  27. Elastic BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic{ON} Mumbai 揭晓 Forge the Future Hackathon 2026 三强:Vigil 夺冠

    Elastic 在 Elastic{ON} Mumbai 公布 Forge the Future Hackathon 2026 结果,从 8000 个报名、300 份初始方案中筛出 20 支队伍,在班加罗尔完成两天决赛。冠军 Vigil 用 Elasticsearch 混合检索自动审计印度销售通话中的违规话术,Eyewitness 与 MediAudit-X 分列二三名。

  28. Replit ⠕(@Replit)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit Agent:模型变强后,harness 的职责转向为模型提供选项

    Replit 称模型持续变聪明,但 harness 不会消失,其职责从替模型做决定转为给模型提供选项。在 Replit Agent 中,主智能体决定何时更深入思考、何时把工作交给子智能体,以及子智能体应投入多少工作量。

  29. v0(@v0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 在 v0 上线,并在 Vercel AI Gateway 可用

    v0 宣布 GPT-6.1 Sol 已在 v0 上线,可通过 v0.app 试用。引用 Vercel Developers 的消息显示,GPT-6.1 Sol 已在 Vercel AI Gateway 上线,在 GPT-6 Sol 基础上改进了编码、计算机使用、多步工作流和复杂文档分析能力。

  30. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    personal agent 每次切换都是一次隐私大暴露,产品独占性进一步向巨头集中

    personal agent 每切换一次就是一次隐私的大暴露,不同于 coding 和 working agent 切换成本不高。这类产品的独占性因此进一步提高,且高度集中在巨头手里,作者认为人类社会未来会更加集中、更加垄断。

  31. dbaplus社群AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    软件架构演化简史:从单体、微服务到智能体

    软件架构演化被概括为单体→原始分布式→SOA→微服务→云原生,其中SOA的ESB虽是解耦一步却在故障隔离上倒退,因此互联网公司普遍弃用。文章指出解耦粒度细化与故障域隔离强化是两条主线,理念已从追求零故障转向设计容错性。AI Agent 打破云原生无状态前提,带来不确定性、状态管理、动态编排与可观测性四重挑战。

  32. OpenAI Developers(@OpenAIDevs)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 ChatGPT 插件扩展加入交互面板、文件查看器与侧边栏入口

    OpenAI Developers 宣布 ChatGPT 的插件扩展(Plugin extensions)支持构建交互面板、文件查看器和侧边栏主页,插件提交审核时也能获得更清晰的反馈。该扩展还支持拟议中的 MCP Events 规范,让已连接应用中的事件可以触发 ChatGPT 内的自动化流程,构建文档见 developers.openai.com/plugins/build/。

  33. LangChain BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 作为评审模型上线 LangSmith Evals

    LangChain 宣布 Jev 已可作为 LangSmith 评测中的评审模型(judge)使用,团队可以在任意 tracing 项目的 Evaluators 选项卡中配置。

  34. 卡尔的AI沃茨AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 开发者日:发布 GPT-6.1 Sol、Dots 与多项 API,解释 GPT-6.1 Astra 被下架缘由

    OpenAI 开发者日发布 GPT-6.1 Sol、Codex Cloud、Codex CLI、Dots 常驻智能体、Decision API、Agents API 加 Computer Use、插件扩展和 Space 等更新,Pro 与 500 美元档用户可用范围更大。

  35. AI Engineer(@aiDotEngineer)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Basis 联合创始人 Mitch Troy 将在 AI Engineer New York 分享智能体长周期任务的流程监督

    Basis 联合创始人 Mitch Troy 将在 AI Engineer New York 发表演讲《Process Supervision for Agents That Do Long-Horizon Work》,探讨如何在不把正确答案误认为可靠流程的前提下,评估智能体的研究与工具使用。活动时间为 10 月 12 日至 14 日。

  36. 有新NewinAI 评估 · 91/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 2026 开发者大会:个人 Agent Dots、GPT-6.1 Sol 等 20 多项更新登场

    OpenAI 在旧金山举行 DevDay 2026,一次性更新 20 多项产品和能力,核心是长期在线、拥有独立云端电脑的个人 Agent Dots,由 GPT-6 Astra 驱动,可连接超过 4000 款应用并进入 Slack、Teams 等工作流。

    为什么值得看

    这场发布会把长期在线 Agent、共享工作区与云端 Codex 串成一套工作流,可据此判断开发与协作方式的变化。

  37. AI寒武纪AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 2026发布dots智能体、GPT-6.1 Sol与500美元Pro订阅

    OpenAI在DevDay 2026上发布20多项更新,推出可全天候自主接管工作的智能体dots,由旗舰模型GPT-6 Astra驱动,每个dot拥有独立云端计算机并连接用户授权应用,目前仅面向Pro、Business Premium和Enterprise用户开放。

    为什么值得看

    梳理了DevDay 2026二十多项更新,从主动智能体到订阅与市场,呈现OpenAI从模型到办公生态的完整布局。

  38. Replit ⠕(@Replit)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 支持在平台内分析应用漏斗,并用 Agent 生成仪表盘

    Replit 现可直接在平台内分析应用漏斗,已发布应用可查看激活情况。用户随后对 Agent 说 "Make it a dashboard" 即可将其转为仪表盘,从自己的数据开始并持续追问。

  39. 数字生命卡兹克AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 2026 DevDay 全记录:Dots 个人 Agent、GPT-6.1 Sol 与 500 美元 Pro 会员

    OpenAI 在 DevDay 2026 开发者大会发布多项更新,包括 24 小时在线的个人 Agent Dots、ChatGPT Space 工作空间、新模型 GPT-6.1 Sol、500 美元 Pro 会员以及 Decisions API。

    为什么值得看

    作者通宵整理 DevDay 全部发布,把散落的产品、模型与生态动作归到一条跟随策略的观察线上。

  40. OpenAI Developers(@OpenAIDevs)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 ChatGPT 侧任务挑战站点 side-quests.openai.chatgpt.site

    OpenAI 上线 ChatGPT 侧任务挑战站点 side-quests.openai.chatgpt.site,用户注册后可完成其中的挑战。该帖由 OpenAI Developers 发布,附带的注册链接为 https://t.co/zZaEOOtYpq。