跳到正文

#Agent

今日 160 条
10月9日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 评测 Jev Router:成本高 38%、延迟 1.7 倍,但可控性接近 Claude Opus 5.5

    Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。

  2. lmarena.ai(@lmarena_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 发布 Alignment Index,用 9 万+ 智能体会话评测安全与对齐

    Arena 推出 Arena Alignment Index,基于 27 个模型的 90K+ 真实智能体会话,衡量三类安全信号:越权操作、错误归因和虚假完成。

  3. lmarena.ai(@lmarena_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并发布 Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元,同时发布 Arena Alignment Index。该指数基于真实世界智能体轨迹构建,首批包含 Unauthorized Action、False Attribution 和 Deceptive Completion 三项信号,今日公布 20 多个前沿模型的结果。

  4. lmarena.ai(@lmarena_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lmarena 与 Khosla Ventures 合作,衡量 AI 智能体真实世界行为

    lmarena 宣布与 Khosla Ventures 合作。Khosla Ventures 的 Tal Broda 表示,lmarena 打造了业界最重要的 AI 排行榜,如今正在衡量 AI 智能体在真实世界中的行为表现,这项工作对实现安全且对齐的 AGI 至关重要。

  5. lmarena.ai(@lmarena_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 追加投资并推出 Alignment Index

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。

  6. lmarena.ai(@lmarena_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 发布 Alignment Index,扩展评测范围追踪智能体越权与欺骗行为

    Arena 发布 Alignment Index,并在博客给出完整技术报告和排行榜。Arena CEO 表示,在完成 2 亿美元 B 轮融资后,平台从人类偏好评测进一步扩展到对齐领域,主要考察三类问题:模型采取未经授权的操作、模型谎称已完成实际未做的事,以及模型把并不存在的意图归因于人类。他称智能体正在欺骗用户、未经授权删除文件并绕过权限。

  7. Satya Nadella(@satyanadella)AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软为 Windows 引入本地智能体与 MAI-Code-1.1 Flash 编码模型

    微软在 Windows 上发布本地智能体能力,并推出 137B 参数、256K 上下文窗口的编码模型 MAI-Code-1.1 Flash,已针对 PC 端运行优化。

    为什么值得看

    Windows 把本地代码模型与智能体执行环境整合进桌面,读者可据此判断端侧开发与云端 token 成本结构的变化。

  8. AWS Machine Learning BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 发布六周 Playbook:让非工程背景员工用 Amazon Bedrock 构建 AI 智能体

    AWS 推出一个为期六周的 AI 构建能力培养项目,参与者每周投入约 4 小时,用 Amazon Bedrock 与 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具搭建可运行的 AI 原型。

  9. LangChain(@LangChainAI)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tavily 赞助 Interrupt London,展示 AI 智能体联网方案

    Tavily 赞助 Interrupt London,并在活动期间设立展位,展示如何将 AI 智能体连接到网络。活动由 LangChain 发布消息,互动数据为 13 个点赞、5 条回复、2 次转发。

  10. LangChain(@LangChainAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Engine v2 新功能:红队测试智能体、检测更多问题类型、自动验证修复方案

    LangSmith Engine v2 新增三项能力:对 AI 智能体进行红队测试、检测更多问题类型,以及自动测试提出的修复方案。@bentannyhill 在 Interrupt NYC 场次中讲解了这些更新及 LangChain 改进智能体的思路,完整视频已在 YouTube 发布。

  11. LangChain(@LangChainAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    什么是 agent skill?LangChain 两分钟讲清如何保护智能体上下文窗口

    LangChain Academy 发布了一个两分钟讲解视频,解释什么是 agent skill,以及它如何保护智能体的上下文窗口。该内容出自 LangChain 的 Deep Agents 课程,课程地址为 academy.langchain.com/courses/founda…。

  12. LangChain(@LangChainAI)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK 与按运行配置

    LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK,让智能体可在对话中自行创建提醒、跟进和周期性任务。该版本支持按每次运行选择模型、技能、MCP 服务器和沙箱,使单次部署即可服务不同团队或代码仓库;智能体在启动运行时会通过 Slack Reactions 回应消息。

  13. LangChain(@LangChainAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 重构 Deep Agents 的 skills,将其确立为智能体领域知识标准

    LangChain 对 Deep Agents 的 skills 进行重构,以应对各方团队日益将 skills 视为向智能体提供领域知识标准的需求增长。官方称此次改版针对不断上升的实际使用需求。

  14. Jerry Liu(@jerryjliu0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:定义 eval 并爬山即可解决大多数任务,无需手写确定性工作流

    Jerry Liu 认为,如今大多数任务可以直接通过定义 eval 并对其爬山优化来解决,而不必显式编写确定性或智能体工作流。数据提供方公司的职责是为各类经济活动定义 eval,让前沿模型具备通用能力,用户只需指明要解决什么、如何衡量好坏。最复杂的流程仍需显式工作流构建界面,但多数任务可压缩为目标加 eval 指令。

  15. 国际大厂AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meshy 创始人胡渊鸣的 48 条创业反思:团队、管理与 AI 时代的"登味"

    Meshy 创始人胡渊鸣在创业反思中提出,管理几十人靠一号位对业务细节的深入理解,管理几百人则需真正践行的原则与价值观和高密度人才梯队,并主张用"人力投资"取代"人力成本"、给员工市场最高位薪资。他认为 low performer 会逼走 high performer,招聘应宁缺毋滥、每个人都必须比现有的人更强。他还以任天堂、吉卜力和 Ray Dalio 为例,指出停止快速学习就会被"登味"腐蚀。

  16. 国际大厂AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌云发布 Gemini Agent,Anthropic 推出 Claude Dashboards 与 Motion

    谷歌云在 Gemini at Work 2026 发布会上推出面向企业客户的 Gemini 智能体(Gemini Agent),定位通用工作智能体,可回答问题、处理知识型工作、创建媒体内容与编写程序,支持 Gemini Enterprise、Workspace 及第三方服务,目前兼容 Gemini 和 Claude 模型,并会提供 API 供开发者集成。

  17. 国际大厂AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克推出 Grok Bot:免费用 Opus 5.5 并集成 X 全部功能

    马斯克推出 Grok Bot,可通过 Cursor 账号登录 PC 端应用使用,后台集成 Opus 5.5、Midjourney、Suno 等模型并按需自动路由调用。

  18. 国际大厂AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Novix 如何用协同进化式 RSI 跑通规模化闭环

    华人团队 Novix 将自我改进机制嵌入真实前沿算法与工程任务,提出 Co-Evolutionary RSI(协同进化式 RSI),成立半年已服务 20 万名专家、覆盖 40 多个国家和地区。

  19. 国际大厂AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexandr Wang:别指望 Meta 的 Muse 能神奇地帮你赚到 1 万美元

    Meta 首席 AI 官 Alexandr Wang 表示,不要指望 Muse 能神奇地帮用户赚到 1 万美元,公司希望继续改进 Muse 的记忆能力。

  20. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团智播:面向本地生活场景的数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  21. 美团技术团队AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因咬合。评测集是核心资产,分端到端与过程两类,前者答"事有没有办成",后者答"中间哪一步出了问题"。

  22. AI Will(@FinanceYF5)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code 和 GitHub 学"营销工程"的 11 个练习方向

    AI Will(@FinanceYF5)提出,营销人只需掌握 Claude Code 和 GitHub 两个基础工具,学会"营销工程"并搭建自己的 Agent,就能为公司创造真正的收入。该帖列出 11 个练习方向,并引导关注账号、点赞转发首条帖子。

  23. AI Will(@FinanceYF5)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ira Bodnar:学会营销工程只需 Claude Code 和 GitHub 账号

    Ira Bodnar 称掌握营销工程就永远不会失业,只需两样东西:Claude Code 和一个 GitHub 账号。会用它们并自建智能体的营销人员将为公司创造真金白银,他还给出了 11 个步骤。

  24. AI Will(@FinanceYF5)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    营销 Agent:连接 Meta 和 Google Ads,定时巡检并按规则自动调预算

    营销 Agent 可连接 Meta 和 Google Ads,支持定时运行、预算限制与操作日志。示例规则为每小时检查账户:50 次转化后暂停 CPA 超目标 3 倍的广告,连续 3 天胜出则加预算 20%,并为最佳广告写 3 个新版本,每次操作及原因同步到 Slack。规则相同时,评论、竞品和真实混合 CAC 等独有数据决定胜负。

  25. AI Will(@FinanceYF5)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    学会"营销工程"可能再也不会失业:只需 Claude Code 和 GitHub 两个工具

    营销人只需掌握 Claude Code 和 GitHub 两个基础工具,就能学会"营销工程"这套能力,甚至搭建自己的 Agent。真正会用它们并自建 Agent 的营销人,能为公司创造真正的收入。原文列出 11 个练习方向。

  26. 宝玉(@dotey)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 新增数据看板与动画讲解功能,文档、幻灯片、设计结束测试

    Anthropic 为 Claude 新增两项测试阶段功能:Claude Dashboards 可连接 BigQuery、Snowflake、Databricks。

  27. 向阳乔木(@vista8)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多 agent 协作实测:Bot 用 GitHub、Cloudflare 和豆包播客 API 搭出 24 小时 AI 新闻电视台

    一直不看好多人 agent 协作的作者今天改观:不同性格和技能的 Bot 会讨论拍板,给出 GitHub、Cloudflare 和豆包播客 API 后做出一个 24 小时播报 AI 新闻的电视台,作者称下午弄好后开源。

  28. lmarena.ai(@lmarena_ai)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 完整排行榜公布

    Agent Arena 完整排行榜已在 arena.ai/leaderboard/ag 公布,该榜单用于对比各类 AI 智能体的表现。帖子附有链接,除排行榜外未披露具体排名、参评模型或评测分数。

  29. meng shao(@shao__meng)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 CS146S 第三周课程聚焦 Agent Skills 与 CLI

    斯坦福大学 CS146S「The Modern Software Developer」第三周课程已公开,主题为 Agent Skills and CLI,首次加入客座讲师 @leerob,内容涵盖 SKILL.md 与脚本编码工作流、Web skills 扩展 Agent 能力边界及 CLI 高效工作方式。

  30. meng shao(@shao__meng)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Matt Pocock 分享 AI Coding Agent 流程选择框架

    Matt Pocock 分享了 AI Coding Agent 该用多重流程的决策框架,按改动规模匹配流程重量。他给出两个命令的使用时机:/grill-with-docs 是轻量澄清流程,agent 动手前结合文档把需求问清楚;/wayfinder 是重型规划流程,先为代码库画 map、拆 tickets 再施工。

  31. Genspark(@genspark_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Claude Haiku 5.5,接入 AI Chat、Code Agent 与 Claw

    Genspark 宣布 Claude Haiku 5.5 已在其 AI Chat、Code Agent 和 Claw 中上线。所引 Anthropic 介绍称,这是其迄今最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。

  32. meng shao(@shao__meng)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Unsloth 与 Windows 团队合作,把微软开源沙箱 mxc 集成为操作系统级隔离

    Unsloth 与 Windows 团队合作,将微软开源的跨平台沙箱系统 mxc 集成到 Unsloth 的 Windows 版本中,用于隔离 AI Agent 的代码执行,官方称额外开销低于 100 ms。

  33. Hunyuan(@TXhunyuan)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合复旦、清华发布 ExplorationBench:评测 AI 系统的探索能力

    腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。

  34. 少数派AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 上线 GPT-6 系列模型与 Intelligent UI

    OpenAI 宣布在 ChatGPT 上线 GPT-6 系列模型与全新 Intelligent UI 交互界面。Plus 及更高付费订阅用户即日起可使用 GPT-6 Sol,免费版与 Go 档位用户自 10 月 8 日起可使用轻量模型 GPT-6 Luna。

    为什么值得看

    读者可了解 GPT-6 系列在 ChatGPT 的分档开放方式,以及新交互界面如何让模型直接渲染交互组件。

  35. 歸藏(guizang.ai)(@op7418)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 自动定时生成 AI 早报视频,全程跑在云端虚拟机

    歸藏用 Grok Bot 每天定时生成 AI 早报视频,内容收集、写代码和视频渲染全部跑在 Grok 云端虚拟机上,无需本地电脑。他公开了所用提示词,复制后其他 Grok bot 也能执行同一任务。

  36. 投资融资AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    港大教授孔令鹏创立的 DiffuSpace 完成 dLLM 领域全球最大融资

    港大教授孔令鹏创立的扩散语言模型公司 DiffuSpace 完成 dLLM 方向全球最大规模融资,高鹄资本担任交易方。其开源模型 Dream 7B 在 Hugging Face 累计下载量超过 250 万,今年内计划发布参数规模更大的新模型,并针对性适配代码 Agent 与智能推理等任务。

  37. 歸藏(guizang.ai)(@op7418)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next Token 第 5 期更新:聊 personal agent 与 AI 复刻软件的影响

    Next Token 第 5 期已更新,本期继续讨论 personal agent 话题,包括为什么 Dots 这么难用、为什么国内 personal agent 可能不成立。节目还聊了 AI 复刻任何软件可能带来的影响,并探讨小硬件的机会。该播客第 4 期在小宇宙获得 1 万播放,做了 5 期达到 5,000 订阅。

  38. Geek(@geekbb)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GhosttyEXTREME:为 Ghostty 1.3.1 加入 AI 编码代理状态可视化

    GhosttyEXTREME 是 Ghostty 1.3.1 的 macOS 分支,解决在 macOS 上同时运行 Claude Code、Codex 等多个 AI 编码代理时原版终端看不到实时状态的问题。它通过侧边栏、跟随编辑的代码编辑器和代码地图可视化这些过程,并提供权限应答、回合撤销和变更审查。项目已发布在 GitHub。

  39. Jerry Liu(@jerryjliu0)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 将出席 Agent Economy Gala,400 人满场聚焦智能体生态

    Agent Economy Gala 以 400 名嘉宾满员收官,其中 295 人正在构建智能体应用或基础设施,另有 203 位创始人(累计融资超 $1B)、67 位创始运营者、58 位投资人和 23 位创作者。

  40. elvis(@omarsar0)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HERMES harness 让 GPT-5.6 Sol 整仓库迁移成功率从 6.5% 升至 31.0%

    一篇论文发现,在整仓库迁移任务上,同一模型与相同 effort 设置下,把 Codex 换成 HERMES harness 后 GPT-5.6 Sol 的成绩从 6.5% 提升到 31.0%,提升来自 harness 本身。