跳到正文

#Agent

今日 146 条
今天10月10日周六
  1. elvis(@omarsar0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Superintelligence Labs 提出 agent plasticity,用每美元学习收益衡量 AI 智能体自我改进

    Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。

  2. elvis(@omarsar0)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    elvis 谈后训练门槛降低与长上下文 RL 成本下降

    elvis 对后训练变得更易获取这一趋势表示乐观,认为新的后训练时代已经到来。他指出在智能体 RL 中,长上下文任务成本高、效率低且难以扩展,rollout 消耗了大部分 token,每一轮都要重新读取不断增长的上下文,包括工具输出、文件和此前的轮次。

  3. Fireworks AI(@FireworksAI_HQ)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Armadin Security 如何在 Fireworks Forge 上后训练开源模型监控安全智能体

    Armadin Security 创始研究员 Yonatan Oren 分享了其团队如何在 Fireworks Forge 上后训练开源模型,用于监控生产环境中的安全智能体。相关分享将于 11 月 3 日在旧金山举行。

  4. 宝玉(@dotey)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GrokBot 开放邮箱申请:绑定 X 后 @bot 即可领取

    GrokBot 邮箱现已开放申请:用户需先拥有 Grokbot 账号并绑定 X,然后在 X 上 @bot 说明想要的邮箱地址,Grokbot 会发来消息要求授权,地址被占用还可以修改。该邮箱可用于注册服务、代你联系商家或与他人约时间。

  5. 宝玉(@dotey)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grokbot 能连接 X 还是很有优势,可帮你推送 X 上值得关注的 AI 资讯

    Grokbot 能连接 X,这是它的一大优势,可以让它帮你推送 X 上值得关注的 AI 资讯。

  6. Cognition(@cognition_labs)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 支持接入个人 ChatGPT 订阅:Go、Plus、Pro 额度可直接抵扣 GPT 模型用量

    Cognition 宣布 Devin 可接入个人 ChatGPT 订阅,用户连接 Go、Plus 或 Pro 计划后,所有 GPT 模型用量将从该订阅的配额中扣除。

  7. Z FinanceAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    原 TRAE 负责人石扬离职创业做 AI 办公,联手前字节数据安全负责人傅越,首轮估值 2 亿美元

    原字节 AI 编程产品 TRAE 负责人石扬于国庆前夕离职,与前字节 AI 数据与安全负责人傅越联手创办 AI 办公公司,已敲定首轮融资,投后估值约 2 亿美元。石扬此前在字节操盘豆包 MarsCode 与 TRAE,傅越曾组建字节 Global Data 团队;新公司目前仍处于 Stealth Mode。

  8. 宝玉(@dotey)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:用 Agent 开发让 loop 转得更快,瓶颈是设备和 Token

    宝玉描述自己的功能开发和 bug 修复都跑在一个 loop 循环里,Agent 和自己都能快速拿到反馈,loop 转得越快效率越高。Loop 跑通后可尝试多任务并行,因为大部分时间由 Agent 生成和验证,人可以专注定义问题和验证。当前主要瓶颈是电脑设备不够多和 Token 不够用,他计划多在云端开任务来缓解设备不足。

  9. 宝玉(@dotey)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉建议将 Claude Code 自动压缩上下文限制在 400k

    宝玉建议用 /autocompact 400k 限制 Claude Code 的自动压缩上下文长度,认为 400k 左右比较合理,他自己设置为 300k。他还表示此前建议在 ~/.claude/settings.json 中禁用 1M 上下文的 "CLAUDE_CODE_DISABLE_1M_CONTEXT" 现已没必要,应删除,否则最多只能到 200k。

  10. Guillermo Rauch(@rauchg)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel CLI 支持 AI 智能体直接购买域名

    Vercel 扩展其 CLI 能力,AI 智能体现在可直接通过命令行购买域名。此前智能体已在其 marketplace 中频繁通过 CLI 购买基础设施产品和服务,如今加上域名后,智能体可完成从想法到上线业务的全栈流程。

  11. lmarena.ai(@lmarena_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 如何衡量智能体能力:用因果追踪替代成对偏好投票

    Agent Arena 采用因果追踪(causal tracing)方法衡量智能体能力,替代成对偏好投票,从真实、长时程的智能体会话中提取五项信号。

  12. Vercel NewsAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel CLI 让 AI 智能体直接购买域名

    Vercel CLI 新增域名购买能力,智能体可通过 vercel domains search/check/price/buy 完成从搜索到下单的流程,购买决策仍由用户确认。该命令非交互运行时返回结构化错误和建议的后续命令,避免智能体未经批准消费;CLI 还附带面向智能体的技能,覆盖发现、定价与购买全流程。

  13. ElevenLabs(@elevenlabsio)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 在 ElevenAgents 推出合成语音检测

    ElevenLabs 在 ElevenAgents 中推出合成语音检测,用于识别代个人、其他公司乃至恶意行为者拨入企业的 AI 智能体来电。ElevenLabs 同时加入新成立的 Personal Agent Protocol 工作组,参与制定智能体之间的交互规范。

  14. 宝玉(@dotey)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 baocut 开发方法论:技术方案、原型 UI、编码与验收全流程

    宝玉将文章中的开发方法论完整应用于开源项目 baocut,流程涵盖技术方案文档、原型与 UI 设计、编码实现和测试验收。他让 Agent 先做调研并撰写技术方案文档,反复沟通定稿后再产出接近正式 UI 的高保真原型,最后才实现代码。验收阶段 Agent 借助 Electron 的浏览器能力自行测试,多数活由 Agent 完成,人只负责定义问题和验收。

  15. 宝玉(@dotey)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 AI Agent 开发 baocut 的四步工作流:技术方案、原型 UI、编码、测试验收

    宝玉将其文章方法论完整应用于开源项目 baocut,流程分四步:先让 Agent 写技术方案文档并反复修改定稿,再做高保真原型与 UI 设计,然后实现代码,最后由 Agent 自行测试验收、人工复测收尾。他把技术栈改回 Electron,Agent 通过浏览器即可验证绝大部分功能,仅复杂场景才用 Computer Use 辅助。人主要负责定义问题和验收两端。

  16. lmarena.ai(@lmarena_ai)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lmarena.ai 分享 arena.ai 的 Agent 资源链接

    lmarena.ai 发布了一条指向 arena.ai/resources/agen… 的链接,正文未附任何说明文字,仅显示 0 条回复、0 次转发、5 次点赞和 2675 次浏览。该帖由 xgo.ing 提供数据支持。

  17. LangChain(@LangChainAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith LLM Gateway 支持 OpenAI Decisions API,为智能体提供低延迟推理

    LangSmith LLM Gateway 现已支持 OpenAI Decisions API,可为智能体提供低延迟推理。该网关同时提供模型回退、数据脱敏策略和支出限额,作为集中管控入口。

  18. 腾讯科技AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果发布会的光环为何褪去:AI 开发者大会接棒“科技春晚”

    苹果发布会的“科技春晚”地位正在消退,OpenAI、Google、Anthropic 等 AI 开发者大会成为新的关注中心。2026 年 9 月 OpenAI DevDay 发布二十多项更新,重点推出可长期运行的个人 Agent Dots,并新增每月 500 美元会员档位、调整 GPT-6.1 Sol 价格体系,但新能力增量有限、悬念减弱。

  19. eric zakariasson(@ericzakariasson)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok @bot 模板:4 个可在 X 上直接使用的构建方案

    4 个 Grok @bot 模板现已可在 X 上直接使用,分别覆盖 launching、threat hunting、threat intel 和 X API 集成四类场景。

  20. eric zakariasson(@ericzakariasson)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    X API Engineer 上线 Grok Bot:提想法、构建测试并部署项目

    X API Engineer 已在 Grok Bot 中上线,可帮助开发者基于 X API 从案例中获取灵感、完成构建与测试,并直接部署项目供他人使用。该功能由 Paul Vann 介绍,意在解决开发者不知从何入手的问题。

  21. 歸藏(guizang.ai)(@op7418)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 正式推出专属邮箱,可用于注册服务、联系商家和约时间

    Grok Bot 正式推出专属邮箱,Bot 可用它注册服务、替你联系商家或与他人约定时间。该邮箱前缀可在评论区 @ Grok Bot 或转发推文领取。

  22. elvis(@omarsar0)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    elvis 用 Jev 搭建自动化流程,索引 X 上 Jev 用例

    elvis(@omarsar0)用 Jev 驱动的自动化流程追踪并索引 X 上分享的 Jev 用例,整理成一份灵感清单,发布在 academy.dair.ai。他表示 Jev 已成为 dair_ai 构建软件的核心工具,并称其减少了可靠性问题。该索引自动化本身也由 Jev 完成。

  23. elvis(@omarsar0)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Jev 和 Pi 构建自定义 harness

    内容指向在 academy.dair.ai 的 dashboard 资源页用 Jev 和 Pi 构建自定义 harness。原文未给出更多模型版本、参数或可用性细节。

  24. elvis(@omarsar0)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 向 Pro 用户推出 composer predictions 测试版

    Codex 面向 Pro 用户开放 composer predictions 测试版,可基于对话内容和你与它的交流方式预测你的下一条消息。有开发者表示自己在 agent orchestrator 中已自建同类功能数月,并用 Haiku、Luna 等小模型实现,可随使用调优并适配个人偏好。

  25. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 最新公开信:智能体每天 5000-10000 次网页搜索,将需要更多数据中心

    Andrew Ng 在 The Batch 本周公开信中指出,他的一个智能体每天执行 5000 到 10000 次网页搜索,智能体将需要远更多的数据中心。本期还提到 GPT-6.1 Sol、Gemini 4 Argon、FLUX 3 Action 和 HYSET。

  26. LangChain(@LangChainAI)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 提出每个 AI 智能体开发者都应能回答的 3 个问题

    LangChain 提出每个 AI 智能体开发者都应能回答的 3 个问题:智能体在哪里失败、如何复现、如何让它停止失败。相关分享来自 Jake Broekhuizen 的一场演讲,视频已在 YouTube 上线。

  27. OpenAI NewsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Asana 用 GPT-6.1 Sol 在浏览器测试中将模型成本降低 76 倍

    Asana 借助 GPT-6.1 Sol 让浏览器智能体在测试中成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。

  28. Vercel NewsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Rillet 如何用 Vercel 上的 AI 智能体将交付速度提升 3 倍

    Rillet 借助 Vercel 开源智能体框架 eve 将上线速度提升 3 倍,两人前端团队 4 个月内关闭 800+ Linear 工单,客户需求最快 2 小时上线。其智能体通过 Vercel Connect 接入 Slack 和 Linear,并借 AI Gateway 统一路由 Anthropic、OpenAI 等模型请求,配置只需在 agent.ts 中改一个模型字符串。

  29. a16z(@a16z)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 对谈 TypeSafe AI:AI 三年贬值幅度堪比 PC 十五年,廉价智能让模型走出聊天框

    a16z 对谈 TypeSafe AI 的 Diogo Almeida 指出,AI 在 3 年内的"贬值"幅度相当于 PC 用 15 年才完成的水平,廉价智能正让模型走出聊天机器人、进入真正干活的软件。TypeSafe 称其在为软件打造 AI,目标是让 AI 不只服务"人类在环",而是真正构建软件。Martin Casado 认为这带来重建系统的机会,因为行业多了一个全新原语。

  30. eric zakariasson(@ericzakariasson)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 获得专属邮箱,可代用户注册服务和联系商家

    Grok Bot 现在拥有自己的邮箱,可用于注册服务、代用户联系商家或与某人约时间。该功能由 xgo.ing 提供支持。

  31. ChatGPT(@ChatGPTapp)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 的 dot 现可在 Codex 中代你启动任务并跟进已有线程

    ChatGPT 的 dot 现在能在 Codex 中启动工作、跟进已有线程,并调用你的 ChatGPT 对话、Codex 线程和自动化任务,还能判断何时续用线程、何时新开。dot 也可在 ChatGPT Work 中查看和编辑 Scheduled Tasks,支持查询已排期任务或随计划变化更新重复任务。

  32. freeCodeCamp.orgAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    freeCodeCamp 发布 n8n 可扩展 AI 自动化课程

    freeCodeCamp.org 在 YouTube 上线免费 n8n 与 AI 自动化课程,时长约 1 小时,讲解如何把 n8n 打造成 AI 驱动的编排引擎。

  33. LangChain BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何用 Managed Deep Agents 构建开箱即用的智能体体验

    LangChain 在 Managed Deep Agents v0.9 中新增 reactions API,可为 Slack 等渠道的分布式智能体动态分配 emoji 回应,取值可以是 emoji 字符串或返回 emoji 的可调用对象。

  34. LangChain BlogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 harness 中构建模型路由器:LangChain 的 Open SWE 实践

    LangChain 在 Open SWE 中把模型路由做进 agent harness,按任务类型和难度在 GLM-5.3-Flash、GPT-5.6 Sol、GPT-6 Astra 三档模型间选择,相比始终使用顶级模型的基线把每线程中位成本降低 64%,质量没有可测量变化。

  35. THE DECODERAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Claude 托管智能体加入动态工作流,单次可编排至多 1000 个智能体

    Anthropic 为 Claude Managed Agents 加入动态工作流,实现多智能体编排:由主智能体制定计划、向子智能体分发任务并合并结果,单次执行最多可并行运行 1000 个智能体。

  36. 特工宇宙AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eazo 发布:Personal Agent 的起点是 Agent,终点是 Person

    谢扬团队国庆期间正式发布 Personal Agent 产品 Eazo,以定制 App 为中心,用户用自然语言描述需求,Agent 生成 6 个以上视觉方向并完成前端、后端、数据库、登录与 Stripe 收款,自带 49 个 AI 模型。

  37. a16z(@a16z)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 对话 TypeSafe AI:Ben Horowitz 与 Diogo Almeida 谈"造产品,别造神"

    a16z 发布 Ben Horowitz 与 TypeSafe AI 的 Diogo Almeida 对谈,主推其"build prod, not God"路线。Diogo 透露其模型意外每天服务数万亿 token,29.4% 的《财富》500 强客户找上门,并于 3 周前从 a16z 完成一笔大额 A 轮融资。他称大多数 AI 圈内人"没搞懂",只把问题当成分类器层面的抱怨。

  38. a16z(@a16z)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TypeSafe AI 的 Diogo Almeida:最“无聊”的 SaaS 公司最有希望赢下 AI

    TypeSafe AI 的 Diogo Almeida 认为,最“无聊”的大型 SaaS 公司最有希望赢下 AI,因为它们最懂该自动化哪些工作流。他称 SaaSpocalypse 关于“软件易复制”的叙事站不住脚,很多关键逻辑藏在底层,SaaS 将成为 AI 最大赢家之一。他透露其模型曾意外每天服务数万亿 token,并有 29.4% 的财富 500 强客户出现。

  39. Fireworks AI(@FireworksAI_HQ)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EngramLab 联创 JessyLin 将在 Fireworks Forge 分享如何让智能体在权重与上下文中原生记忆

    EngramLab 联合创始人 JessyLin 将在 Fireworks Forge 上演讲,主题是构建具备原生记忆的智能体——让智能体既能在权重中记忆,也能在上下文中记忆。活动于 11 月 3 日在旧金山举行。

  40. 大模型智能AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 GPT-6.1 Sol Ultrafast 版本,速度提升 8 倍

    OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。