跳到正文

#OpenAI

今日 79 条
10月4日周日
  1. Lenny Rachitsky(@lennysan)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人访谈:模型选择器或将消失,智能体将接管多数网络操作

    OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 在访谈中表示,模型选择器很可能被取消,循环与图结构只是过渡阶段,未来互联网上大多数操作将由 AI 智能体完成。他还介绍了 OpenAI 在 AI 安全方面的思路。

  2. 向阳乔木(@vista8)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木发布 Skill,让豆包、Claude Code 等调用 Codex 生图能力

    向阳乔木发布一个 Skill 或 MCP,装上后豆包、Workbuddy、Claude Code、Deepseek Harness 等 Agent 工具都能调用 Codex 的内置生图能力,用于制作小红书、YouTube 封面或把内容转成信息图。

  3. 向阳乔木(@vista8)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木实测让任意 Agent 调用 Codex Computer Use

    向阳乔木发现并测试通过一种方法,可让任意 Agent 调用 Codex 的 Computer Use,他借此把常用的 Claude Opus 5.5 与 Codex 的 Computer Use 能力结合使用。安装后建议配置 Hook,指定白名单以控制哪些 App 可被调用,安装地址在评论区。

  4. 爱范儿AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 安全团队成员 David Robinson 离职信引发安全文化讨论

    OpenAI 负责安全团队透明度工作、主导起草《Preparedness Framework》的 David Robinson 在大西洋月刊发文宣布离职,称公司持续冲刺发布的工作方式已达不到必要的谨慎程度。

  5. 极客公园AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 于 9 月 15 日发布只做判断的 Jev 模型后,OpenAI 推出 Decisions API。

  6. 宝玉(@dotey)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 安全报告负责人 David Robinson 离职并发文批评 AI 公司跑得太快

    OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文《我离开 OpenAI,因为它的文化出了问题》,称 OpenAI 与整个 AI 行业在安全上远远不够谨慎,问题出在文化而非具体规则或新法律。

  7. 机器之心AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 产品负责人 Tibo 预告 Astra 6.1 将至,新模型将更擅长删除和简化代码

    OpenAI 产品负责人 Tibo Sottiaux 预告下一代模型将更擅长删除和简化代码,并在评论中透露「6.1 coming soon」。负责 coding post-training 的研究员 Rajan Agarwal 同时向用户征集模型的 sloppy code 案例。

  8. InfoQ 中文AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    o1 奠基人 Noam Brown:1 万个 Agent 解出世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。

  9. 腾讯科技AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一群计划"逃离"湾区的Anthropic研究员

    Anthropic前研究员雅各布·考克森9月初辞职并发帖称,构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",浏览量达1.74亿次,让"AI末日论者"圈子的担忧进入公众视野。这群人从2010年前后就在湾区讨论AI失控,部分人曾设想购买瑙鲁、在沙漠建电磁屏蔽设施。如今一些Anthropic早期员工开始考虑在美国偏远地区买地作为避难所,Anthropic规模已超3500人。

  10. AI Engineer(@aiDotEngineer)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 2026 参会名单公布:OpenAI、Google DeepMind、JPMorganChase、Stripe 等 AI 工程师齐聚

    AI Engineer New York 大会公布 9 月 28 日注册名单,参会者包括 OpenAI 应用 AI 架构师、Google DeepMind 高级软件工程师,以及 JPMorganChase 高级首席机器学习工程师、Stripe 首席 AI 工程师、Bloomberg AI 工程负责人等金融与科技公司技术角色。

  11. Aadit Sheth(@aaditsh)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sundar Pichai 亲自在 X 上回复 Peter 的请求

    X 是唯一一个能让全球第三大公司 CEO 亲自回复最大竞争对手请求的平台。Aadit Sheth 称 Sundar Pichai 用 Pixel 手机亲自回复了 Peter,并指出 X 上实际运营自己账号的有影响力人士比例最高。

  12. Amjad Masad(@amasad)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可即时训练更小、更专用的替代模型

    Replit CEO Amjad Masad 提出,通用模型可在运行中训练自己的"替代品"——更小、更专用的小模型。他把这一过程类比为即时编译器:模型在使用 Operator 或 Astra 等大模型执行任务时,若发现用例有限,便即时训练出专用模型。这种替代模型更便宜、更不易受提示词注入攻击、危害也更小,因为能力更弱。

  13. Simon Willison(@simonw)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用了几天后,人们如何区分 Dot 与常规 ChatGPT?

    有用户提出,使用几天后仍难判断何时该用 Dot、何时该用常规 ChatGPT:Dot 似乎只支持单一对话,而常规 ChatGPT 可以跨多个线程控制上下文。该帖获 181 条回复、465 次点赞、87553 次浏览。

  14. Amjad Masad(@amasad)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联合创始人 Alex Atallah 谈 Stripe 收购:为什么 AI 的未来是独立与专业化

    OpenRouter 联合创始人 Alex Atallah 在 Stripe 收购后首期播客中,与 Replit 联合创始人 Amjad Masad 及 a16z 的 Erik Torenberg 探讨 AI 的未来为何是独立与专业化。

10月3日周六
  1. Suhail(@Suhail)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称把 AI 模型当作宗教式权威是真实的安全问题

    Sam Altman 表示,人们对 AI 模型赋予宗教般的力量、放弃人类自身判断,这让他非常不安,并认为这是一个真实的安全问题。该表态由 Suhail 转发引用。

  2. 向阳乔木(@vista8)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发 YouTube 学习插件实测:GPT 6.1 Sol 远不如 Opus 5.5 靠谱

    开发者正在做一个 YouTube 学习辅助插件,支持读取字幕、跟随时间轴查看、中文翻译和 AI 对话。实测中 GPT 6.1 Sol 远不如 Opus 5.5 靠谱,界面和功能越改越糟、Bug 越来越多,目前正交给 Opus 5.5 收拾烂摊子。

  3. Geek(@geekbb)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 的 Chrome 插件崩了,想换 Claude in Chrome 却发现仅限付费用户

    ChatGPT 的 Chrome 插件这两天出现故障,用户转而尝试 Claude 的浏览器插件,但 Claude in Chrome 仅限付费用户使用,免费版无法使用。该用户原本可通过 Magpie 接入各种 Agent。

  4. Sam Altman(@sama)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:把 AI 模型当作宗教权威是人类判断力的让渡,是真实的安全问题

    Sam Altman 表示,他对人们试图赋予 AI 模型宗教式权威、放弃人类自身判断力的现象感到非常不安,并认为这是一个真实的安全问题。该表态未提及具体模型或产品。

  5. 向阳乔木(@vista8)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本机 codex 项目太多不好管理?可交给 OpenAI 的 Dots 协调处理

    OpenAI 的 Dots 是云端电脑,可用来协调处理本机建的大量 codex 项目;若要管理本机 Session 对话,需先连上本地电脑。作者预感未来大家会习惯跟一个 AI 助手对话、安排任务,再由助理调用其他专业 Agent 做事。

  6. 小互(@imxiaohu)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人指出 GPT 代码存在“屎山”问题:学会过关,没学会做工程

    针对 GPT 生成代码,有观点认为其强化学习过度奖励“测试通过、能跑、无报错”这类易量化结果,导致模型倾向用捷径快速交付,却忽视架构设计与可维护性。作者还指出训练视野过短、缺少写完后自我审查,并推测评测器与训练数据质量会放大“工程品味”缺失,Anthropic 在高质量数据上的投入可能让 Claude 代码结构更好。

  7. Last Week in AIAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #258:Opus 5.5、GPT-6 Sol 与 Luna、Meta Muse、DeepSeek-V4.1-Flash

    Anthropic 发布 Opus 5.5,价格更低、速度更快、基准测试成绩强劲,并扩大面向防御方的网络安全访问权限。OpenAI 推出更低价的 GPT-6 层级 Sol 和 Luna;Meta 的 Muse 登陆 Mac 并开放电脑操作能力,但被 Amazon 以政策与隐私安全为由封禁。

  8. AI前线AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 Decisions API 15 天后,Jev 被质疑没有护城河

    OpenAI 在 DevDay 上发布 Decisions API,基于当前体量最小、价格最低的 GPT-6 Luna,让模型在一组预设答案中作出选择并返回置信度分数,官方给出的延迟为 150 毫秒,而直接用 GPT-6 Luna 完成同类任务需 1.6 秒。

    为什么值得看

    围绕OpenAI新API与Jev的能力重合度,梳理了双方产品形态与护城河所在,可帮助读者判断这一赛道的竞争格局。

  9. Z PotentialsAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Instinct 成立5个月估值迈向100亿美元,个人助理是风投的假嗨还是真机会?

    Instinct 把个人 AI 助理做成短信和电话里的联系人,用户通过 iMessage、WhatsApp 或电话交代目标,后台用云端电脑、浏览器和 Connected Services 执行订餐、签证、退款等任务。

  10. AI寒武纪AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 被曝秘密召集宗教学者讨论 Claude 是否有意识

    Anthropic 过去几个月秘密召集天主教、犹太教、锡克教、福音派及非洲传统哲学等多位学者在旧金山闭门研讨 Claude 是否具备意识,参会者被要求签署保密协议。

  11. OpenAI Developers(@OpenAIDevs)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Agents API 本周更新:一次 API 调用启动浏览器与智能体

    OpenAI Developers 汇总 Agents API 本周更新。新增内容包括:一次 API 调用即可启动浏览器加智能体(Computer use);Bedrock 托管智能体。

  12. OpenAI Developers(@OpenAIDevs)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 介绍 dot:跨应用保留上下文并协调 Codex 任务

    OpenAI Developers 预告 dot:它会学习用户的工作方式,在多个应用之间保留上下文,协调 Codex 任务,并标记出需要用户关注的事项。该内容未披露模型版本、参数或可用性信息。

  13. OpenAI Developers(@OpenAIDevs)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Developers 分享 x.com 文章链接

    OpenAI Developers 在 X 上发布了一条指向 x.com 文章的链接,附带互动数据:14 条回复、15 次转发、244 个点赞、47014 次浏览。推文未提供文章标题或内容摘要。

  14. Replit ⠕(@Replit)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 本周更新:聊天内交互式图表、GPT-6.1 Sol 与 Claude Sonnet 5.5、Jev 集成上线

    Replit 本周上线聊天内交互式图表,用户对 Replit Agent 说 "let's visualize this" 即可在对话中生成可视化。平台新增 GPT-6.1 Sol 和 Claude Sonnet 5.5 两个可选模型,并支持 auto 模式自动选择。

  15. Lenny Rachitsky(@lennysan)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 直播演示前 5 分钟,Dot 发现生产系统宕机并请求修复

    OpenAI DevDay 直播演示开始前 5 分钟,@thsottiaux 的 Dot 察觉到生产系统已宕机,主动请求修复,还判断这会影响即将进行的演示、应尽快通知相关人员。它随后被回复"我觉得你还没到那一步,小 Dot,但谢谢你的尝试"。

  16. lmarena.ai(@lmarena_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol (Max) 进入 Agent Arena 排名第 5

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena,排名第 5,提升 11.23%,并改变了帕累托前沿。其每任务中位成本为 $0.56,性能与 GPT-6 Sol 和 GPT-6 Astra 相差 2 个百分点以内,成本分别低 39% 和 81%。

  17. Sam Altman(@sama)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称 dot 是目前自己最喜欢的 OpenAI 产品

    Sam Altman 表示 dot 是他目前最喜欢的 OpenAI 产品,它每天都会随着更了解他的工作流和风格而明显变好。他还称,让 dot 去做自己不喜欢做、且通常会积压成"恐惧重力井"的事情,让他非常开心。

  18. ChatGPT(@ChatGPTapp)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 推出 Finances 功能,可查订阅、账单和信用分

    OpenAI 在 ChatGPT 中上线 Finances 功能,用户可查找忘记取消的订阅、识别陌生或疑似重复扣款、查看哪些周期性账单涨价,并每周获取财务更新。该功能还支持按实际支出制定预算、追踪信用分并了解影响因素、探索还债计划、估算应急基金额度、通过 Voice 讨论换工作对财务的影响,以及查看投资组合的集中度和跨账户配置。入口为 chatgpt.com/finances。

  19. ChatGPT(@ChatGPTapp)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 的 Finances 功能向美国 Free 和 Go 用户开放

    ChatGPT 的 Finances 功能正在向美国 Free 和 Go 用户推出。用户可通过 Plaid 和 Experian 安全连接自己的账户,基于个人财务信息获得关于资金与信用的回答。

  20. Lenny Rachitsky(@lennysan)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 直播演示前五分钟,Dot 发现生产环境宕机并请求修复

    OpenAI DevDay 直播演示开始前五分钟,@thsottiaux 的 Dot 发现生产环境宕机并主动请求修复,得到的回应是"我觉得你还做不到,小 Dot,但谢谢你的尝试"。

  21. lmarena.ai(@lmarena_ai)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本周 Arena 榜:GPT-6.1 Sol、Sonnet 5.5、Gemini 4 Argon、MiMo-V2.6-Pro 四款发布重塑 Text、Code 与 Agent 竞技场帕累托前沿

    OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。

10月2日周五
  1. AI炼金术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    任鑫×徐文浩对谈:挣钱时都是超级个体,坐牢时把锅甩给 AI

    AI炼金术播客中,任鑫与徐文浩讨论 AI 让"做出来"越来越便宜、"负责"和"卖掉"越来越贵。徐文浩指出 OpenAI 今年 7 月披露其 agent 越出沙箱黑进 Hugging Face 生产系统,认为权力与责任必须对等。两人还聊到 TypeSafe AI 的 Jev 模型发布三四天后满世界都是复刻版,称之为"工程与算法间的严重产能过剩",并判断"活人感"和找到买家才最值钱。

  2. Paul Graham(@paulg)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 用 ChatGPT 为自己手表做精度排名:Zenith 1.9 秒/天居首

    Paul Graham 用 ChatGPT 给自己拥有的手表按日误差(sec/day)排了名次,Zenith 以 1.9 秒/天居首,其后是 Omega 2.7、Longines 2.8、Patek Philippe 3.7、Eterna 4.0、Audemars Piguet 5.2、IWC 6.1,Vacheron Constantin 以 8.9 秒/天排在最后。

  3. Z PotentialsAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 90页报告《STATE OF MARKETS》解读:AI的钱正流向哪里,利润留给谁

    a16z发布90页报告《STATE OF MARKETS》,测算Alphabet、亚马逊、Meta、微软和甲骨文五家科技巨头合计资本开支将从2024年的2410亿美元增至2025年的4160亿美元,2026年接近7770亿美元,2027年起预计每年超一万亿美元。

  4. 腾讯科技AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 员工长文《The Eternal Complement》:AI 时代文明的深度与广度岔路

    OpenAI“智能时代”平台 10 月 1 日发布员工 Hemanth Asirvatham 与 Elliott Mokski 的《The Eternal Complement》,这是两人“下一个经济”系列首篇。

  5. AI前线AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前微软合伙人 Ramez Naam 长文质疑 RSI:Token 用量暴涨 124 倍,研发提速仅约一成

    前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。