跳到正文

#OpenAI

今日 79 条
10月6日周二
  1. a16z(@a16z)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    人们究竟想让 AI 智能体做哪些任务?a16z Top 100 消费级 AI 应用榜单更多图表解读

    a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。

  2. lmarena.ai(@lmarena_ai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MTS Arena CEO 呼吁建立中立评估平台,OpenAI 与 Anthropic 不能自评模型安全

    MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。

  3. SemiAnalysisAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:Anthropic订阅的API等效价值约为OpenAI的5倍

    SemiAnalysis用自建Tokenomics模型测量各AI订阅计划的额度与API等效价值,发现在中端模型档位上Anthropic提供约5倍于OpenAI的API等效价值。

  4. a16z(@a16z)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    原文标题直译不足,未给出明确模型或产品主体;a16z Top 100 消费 AI 应用榜:ChatGPT 月活超 10 亿,Claude 升至网页第三

    a16z 发布第七版 Top 100 消费 AI 应用榜,新增收入排行,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 在网页端升至第 3,月访问量接近 1B。

  5. a16z(@a16z)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 的 Olivia Moore:消费级 AI 商业模式搞反了,85% 靠订阅、仅 13% 靠广告

    a16z 的 Olivia Moore 认为消费级 AI 商业模式被搞反了:目前几乎所有收入都来自直接订阅,在其 Web 榜单中 85% 的产品靠订阅变现,62% 另有 credits 或超额使用付费,仅 13% 采用广告等"用户即产品"的模式。

  6. Lenny Rachitsky(@lennysan)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人 Tibo:我们的工作方式仍将发生剧烈变化

    OpenAI ChatGPT 与 Codex 负责人 Tibo 在 Lenny Rachitsky 的访谈中表示,我们的工作方式仍将继续发生相当剧烈的变化。他讨论了模型选择器可能消失、loops 与 graphs 只是阶段性产物、互联网上大多数操作很快将由智能体完成,以及 OpenAI 在 AI 安全上的做法。

  7. lmarena.ai(@lmarena_ai)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 智能体能力排名:Anthropic 与 OpenAI 领跑各领域

    Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。

  8. 宝玉(@dotey)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将在欧盟为 ChatGPT 和 Codex 文字加水印

    OpenAI 宣布未来几周内,欧盟用户在 ChatGPT 和 Codex 里生成的文字会带上看不见的水印,以满足欧盟《人工智能法案》的透明度要求;8 月 Anthropic 已给 Claude 加了水印,原因是同一法案的透明度条款在今年 8 月 2 日生效。

  9. The Rundown AI(@TheRundownAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将在数周内为 ChatGPT 和 Codex 文本嵌入 EU AI Act 要求的隐形水印

    OpenAI 表示将在数周内按 EU AI Act 要求在欧盟范围内的 ChatGPT 和 Codex 文本中嵌入隐形水印。OpenAI 称测试中水印未影响模型能力、速度或回答读感,但用同义词替换会显著降低检测率,短文本检测率也明显更低。检测工具将仅面向获批的研究人员和专家机构提供。

  10. 宝玉(@dotey)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 28 天更新第 1 天:GPT-6 Astra 与 GPT-6.1 Sol 默认速度提升约 50%

    OpenAI 在 28 天更新第 1 天公布,通过 ChatGPT 订阅使用 GPT-6 Astra 和 GPT-6.1 Sol 的默认速度提升约 50%,用户无需改设置,两小时内生效。

  11. OpenAI(@OpenAI)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI:文本水印有局限,检测器暂只向获批研究者开放

    OpenAI 表示文本水印存在明显局限:短文本中往往无法检出,重写或翻译就能将其完全去除。因此其检测器目前仅向获批研究者开放,用于评估和改进该技术,文本水印被定位为持续研究领域,后续将结合用户、开发者、政策制定者与研究者的反馈继续测试优化。

  12. OpenAI(@OpenAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为满足 EU AI Act 将扩展内容溯源至文本水印

    OpenAI 宣布扩展内容溯源方案,将文本纳入其中,以回应欧盟监管要求,同时承认当前文本水印技术存在显著局限。未来几周内,OpenAI 将在欧盟对 ChatGPT 和 Codex 中符合条件的文本加注水印,以遵守 EU AI Act;使用 API 的客户即日起可在全球范围内为部分模型开启文本水印。

  13. OpenAI(@OpenAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 谈文本水印:能判断是否由其模型生成,但无法识别作者与归属

    OpenAI 表示文本水印通过在生成文本中嵌入隐形统计信号,可帮助检测器判断内容是否可能由其模型生成。该水印不添加可见标记或特殊字符,也无法识别作者、归属方、账号、对话或提示词。OpenAI 测试显示,水印未影响模型能力、速度或回答的可读性。

  14. a16z(@a16z)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 居首,Claude 升至网页端第 3

    a16z 发布第七版 Top 100 消费级 AI 应用榜,新增收入排行榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量接近 1B。

  15. Lenny Rachitsky(@lennysan)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将向高使用量的第三方插件分成收入

    OpenAI 将向使用量高的第三方插件分享收入。Lenny Rachitsky 在与 ChatGPT 和 Codex 负责人 @thsottiaux 的对话中透露了这一此前未知的信息。该对话还谈及模型选择器可能取消、loops 和 graphs 只是阶段性产物,以及未来互联网上的多数操作将很快由 AI 智能体完成。

  16. Gary Marcus(@GaryMarcus)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Morgan Dwyer 称可承诺不发布不安全的模型

    OpenAI 的 Morgan Dwyer 表示公司可以承诺不发布其认为不安全的模型。Gary Marcus 称这一承诺近乎伪证,怀疑公司不会遵守,并指出 OpenAI 已知 Astra 造成了许多问题且更难监控。

  17. Lenny Rachitsky(@lennysan)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人:Dots 将成与 AI 对话的主要方式,模型选择器和循环编排只是过渡

    OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 认为,Dots 将成为人们与 AI 对话的主要方式,手动设置和调整循环(loops)的做法行不通。他还表示模型选择器很可能消失,loops 与 graphs 只是过渡阶段,互联网上大多数操作很快将由智能体完成。

  18. 宝玉(@dotey)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 会话交互多借鉴自 Slack,Claude 最新 Projects 脱胎于 Thread 设计

    Agent 会话的交互设计有很多借鉴自 Slack,Claude 最新的 Projects 就脱胎于 Thread 设计,简洁好用。有观点指出,OpenAI 的一切产品决定都是从 Slack 上交流和协调的,而当年收购 Slack 的却是 Salesforce。

  19. 宝玉(@dotey)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    amontlabs/lcu 把 Codex 的 Computer Use 拆给其他 Agent 调用

    amontlabs/lcu 将 Codex 的 Computer Use 能力单独拆出,让 Claude Code、Codex CLI、Pi 等 Agent 工具通过 MCP 调用。

  20. 大模型智能AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton等22人发布首篇RSI论文,讨论AI研发自动化是否触发智能爆炸

    Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?

10月5日周一
  1. andrew chen(@andrewchen)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SF Tech Week 在 Jackson Square 新办公室开幕,议程超 1700 场活动

    SF Tech Week 今日开幕,Speedrun 将在其 Jackson Square 新办公室办活动,并与 1000+ 投资人举办 Demo Day。官方议程超过 1700 场活动,两年翻倍以上,来自 1058 家公司的 1266 位主办方参与,包括 OpenAI、Anthropic、Google、Mistral 等,Speedrun 投资组合公司主办 100+ 场。

  2. Lenny Rachitsky(@lennysan)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tibo 谈 AI 智能体的五大判断:模型选择器将消失,互联网大多数操作将由智能体完成

    Tibo 认为互联网上的大多数操作很快将由 AI 智能体完成,Notion 上线 MCP server 后流量激增、被迫重新考虑其经济模型,每个产品团队迟早都要决定是否为智能体而构建。

  3. a16z(@a16z)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜单发布,新增付费维度

    a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入消费者实际付费情况这一维度。数据显示,目前仅少数消费者为 AI 付费,但支出高度集中在头部,开发者、创作者等重度用户是主力;Olivia Moore 与 Josh Elman 还讨论了个人智能体、ChatGPT、Claude、Gemini 的不同走向,以及 OpenAI 的 $1B 广告收入规模。

  4. elvis(@omarsar0)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ContextQA 推出 Ship:从 Slack 和 Linear 复现 bug,交给 Claude Code 或 Codex 修复

    ContextQA 推出自主质量工程师 Ship,可从 Slack 或 Linear 接收 bug 报告并复现,再把上下文交给 Claude Code 或 Codex 完成修复。该工具面向已部署的 PR 进行测试,用户可免费在 ship.contextqa.com 试用。作者指出,编码智能体需要这类反馈闭环,才能更好地修复自身 bug,而验证 agent 写的代码正成为软件工厂的一大瓶颈。

  5. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 仍居首,Claude 升至网页端第 3

    a16z 发布第七版 Top 100 消费级 AI 应用榜,首次新增收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 10 亿;Claude 升至网页端第 3,月访问量近 10 亿。

  6. AI Breakfast(@AiBreakfast)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 测试 ChatGPT 图像生成过程中的图片广告

    OpenAI 正在测试会在 ChatGPT 图像生成过程中出现的图片广告,相关说明发布在 OpenAI 官网。该消息由 AI Breakfast 转述,原文未披露广告的具体形式、投放范围与上线时间。

  7. The Rundown AI(@TheRundownAI)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Rundown AI 分享 OpenAI 相关文章链接

    The Rundown AI 在 X 上发布了一条推文,附带指向 therundownai.beehiiv.com 上关于 OpenAI 的文章链接。推文本身未提供更多正文内容。

  8. The Rundown AI(@TheRundownAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日 AI 头条:OpenAI 安全报告负责人因"破碎"文化离职,Anthropic 为养育 Claude 寻求宗教智慧

    OpenAI 安全报告负责人因"破碎"文化离职。The Rundown 圆桌讨论分享了自家的 AI 用例,AI 101 栏目则讲如何在不同模型间做选择。Anthropic 正为"养育"Claude 寻求宗教智慧。

  9. Viking(@vikingmute)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 体验崩坏:Astra 太贵、Sol 6 又慢又幻觉,Luna 档任务也做不完

    用户吐槽近期 ChatGPT 体验灾难性:Astra 太贵用不起,Sol 6 慢、幻觉、忽略指令、来回拉扯,Luna 这档也垮了,指令明确的小任务以前表现不错现在各种崩,没做完就说提前做完了,服务重启失败就直接放弃不修复。原本用它搭档 Coding 很享受,如今需频繁检查实现方式,稍复杂任务就来回搞不定,变成一种折磨。

  10. InfoQ 中文AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 负责人 Tibo:未来 28 天每天交付一项用户可感知改进,否则重置额度

    OpenAI 的 ChatGPT 和 Codex 负责人 Tibo Sottiaux 承诺,未来 28 天每天推出一项对大多数 Codex 和 Work 用户明显有用的改进,否则进行一次完整的额度重置。

  11. 深思圈AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Tibo 谈 agent:留存就是分发,工作流只是过渡

    深思圈整理了 OpenAI 负责 ChatGPT 和 Codex 的 Tibo Sottiaux 在 Lenny's Podcast 上的访谈,他认为让用户自己设计循环、画流程图调教工作流只是过渡,未来是 Dots 这类会学习、永远在线的个人 agent。

  12. Justine Moore(@venturetwins)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 用 Astra 写词、Suno 与 MiniMax H3 生成 Threads 用户吐槽音乐视频

    有人给 Codex 几个小时和一个 API key,做出一支调侃 Threads 用户的音乐视频:Astra 负责写词,Fal 负责媒体生成,歌曲用 Suno、视频用 MiniMax H3。作者称歌词相当犀利,并反问谁说 LLM 不好笑。

  13. 机器之心AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宋晓冬 Virtue AI 团队被曝与 Meta 分道扬镳,理由为工作风格不合

    外媒 Semafor 报道,Meta 发言人 Andy Stone 称公司正裁减一批今年 6 月从 AI 安全初创公司 Virtue AI 招聘而来的员工,入职仅四个月,理由是工作风格不合。

  14. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    VA-Bench 测出大模型空间智能执行断层:目标识别接近满分,完整任务成功率仅约一半

    VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。

  15. AI前线AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 研究员 Noam Brown:1 万个 Agent 解出千禧年难题,多 Agent 贡献不到 10%

    OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,用 1 万个智能体在 88 小时内消耗 1300 亿 token 解决一道千禧年大奖难题,功劳主要不在多智能体,他估计多智能体的贡献不到 10%,核心原因是拥有一个强大的通用模型。

  16. 极客公园AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克拟将 SpaceXAI 更名为 SpaceXSI;OpenAI GPT-6 Astra 破解拿破仑密信|极客早知道

    马斯克回应社交平台提问时确认,旗下人工智能业务 SpaceXAI 将更名为 SpaceXSI,并称 SpaceX 本质上是一家「超级智能公司」;该业务由 xAI 今年 2 月被 SpaceX 收购、7 月更名为 SpaceXAI 而来。

  17. Epoch AIAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI 编码智能体使用量约每月翻倍

    Epoch AI 基于 OpenAI 2026 年 9 月发布的内部数据整理发现,OpenAI 研究人员的编码智能体使用量约每月翻倍。按 API 价格计价,中位数研究员的日均编码智能体支出从 2026 年 1 月的不足 1 美元升至 8 月中旬的 601 美元,第 90 百分位研究员同期超过 7000 美元。

  18. Guillermo Rauch(@rauchg)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    fx v0.0.13 发布 Ultrafast 支持:启动最高快 23 倍

    fx v0.0.13 新增 Ultrafast 支持,针对支持的 OpenAI 模型,启动最高快 23 倍、shell 调用最高快 8.6 倍、退出最高快 44 倍,并支持可配置的自动压缩(automatic compaction)。

  19. 宝玉(@dotey)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 承诺连续 28 天每天上新,否则重置用量额度

    OpenAI 给 Codex 用户立下 28 天规矩:每天要么上线一项对多数 codex/work 用户明显有用的改进,要么把用量额度整个重置一次。该承诺由 Tibo(@thsottiaux)在 X 上发布。

  20. Jerry Liu(@jerryjliu0)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:ChatGPT/Codex 是目前最好的深度工作智能体界面,但 Claude 应用缺少分支功能

    Jerry Liu 认同 ChatGPT/Codex 拥有当前最好的深度工作智能体界面,理由是它把编程与知识工作统一在一个界面中,ChatGPT 与 Codex 之间切换没有明确分离的流程,并支持分支(forking)。他仍喜欢 Opus 5.5,尤其用于产品演示,也认为 Claude Code CLI 已是 CLI 应用能做到的最好水平。