人们究竟想让 AI 智能体做哪些任务?a16z Top 100 消费级 AI 应用榜单更多图表解读
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。
MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。
SemiAnalysis用自建Tokenomics模型测量各AI订阅计划的额度与API等效价值,发现在中端模型档位上Anthropic提供约5倍于OpenAI的API等效价值。
a16z 发布第七版 Top 100 消费 AI 应用榜,新增收入排行,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 在网页端升至第 3,月访问量接近 1B。
a16z 的 Olivia Moore 认为消费级 AI 商业模式被搞反了:目前几乎所有收入都来自直接订阅,在其 Web 榜单中 85% 的产品靠订阅变现,62% 另有 credits 或超额使用付费,仅 13% 采用广告等"用户即产品"的模式。
OpenAI ChatGPT 与 Codex 负责人 Tibo 在 Lenny Rachitsky 的访谈中表示,我们的工作方式仍将继续发生相当剧烈的变化。他讨论了模型选择器可能消失、loops 与 graphs 只是阶段性产物、互联网上大多数操作很快将由智能体完成,以及 OpenAI 在 AI 安全上的做法。
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
OpenAI 宣布未来几周内,欧盟用户在 ChatGPT 和 Codex 里生成的文字会带上看不见的水印,以满足欧盟《人工智能法案》的透明度要求;8 月 Anthropic 已给 Claude 加了水印,原因是同一法案的透明度条款在今年 8 月 2 日生效。
OpenAI 表示将在数周内按 EU AI Act 要求在欧盟范围内的 ChatGPT 和 Codex 文本中嵌入隐形水印。OpenAI 称测试中水印未影响模型能力、速度或回答读感,但用同义词替换会显著降低检测率,短文本检测率也明显更低。检测工具将仅面向获批的研究人员和专家机构提供。
OpenAI 在 28 天更新第 1 天公布,通过 ChatGPT 订阅使用 GPT-6 Astra 和 GPT-6.1 Sol 的默认速度提升约 50%,用户无需改设置,两小时内生效。
OpenAI 表示文本水印存在明显局限:短文本中往往无法检出,重写或翻译就能将其完全去除。因此其检测器目前仅向获批研究者开放,用于评估和改进该技术,文本水印被定位为持续研究领域,后续将结合用户、开发者、政策制定者与研究者的反馈继续测试优化。
OpenAI 宣布扩展内容溯源方案,将文本纳入其中,以回应欧盟监管要求,同时承认当前文本水印技术存在显著局限。未来几周内,OpenAI 将在欧盟对 ChatGPT 和 Codex 中符合条件的文本加注水印,以遵守 EU AI Act;使用 API 的客户即日起可在全球范围内为部分模型开启文本水印。
OpenAI 表示文本水印通过在生成文本中嵌入隐形统计信号,可帮助检测器判断内容是否可能由其模型生成。该水印不添加可见标记或特殊字符,也无法识别作者、归属方、账号、对话或提示词。OpenAI 测试显示,水印未影响模型能力、速度或回答的可读性。
a16z 发布第七版 Top 100 消费级 AI 应用榜,新增收入排行榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量接近 1B。
OpenAI 将向使用量高的第三方插件分享收入。Lenny Rachitsky 在与 ChatGPT 和 Codex 负责人 @thsottiaux 的对话中透露了这一此前未知的信息。该对话还谈及模型选择器可能取消、loops 和 graphs 只是阶段性产物,以及未来互联网上的多数操作将很快由 AI 智能体完成。
OpenAI 的 Morgan Dwyer 表示公司可以承诺不发布其认为不安全的模型。Gary Marcus 称这一承诺近乎伪证,怀疑公司不会遵守,并指出 OpenAI 已知 Astra 造成了许多问题且更难监控。
OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 认为,Dots 将成为人们与 AI 对话的主要方式,手动设置和调整循环(loops)的做法行不通。他还表示模型选择器很可能消失,loops 与 graphs 只是过渡阶段,互联网上大多数操作很快将由智能体完成。
Agent 会话的交互设计有很多借鉴自 Slack,Claude 最新的 Projects 就脱胎于 Thread 设计,简洁好用。有观点指出,OpenAI 的一切产品决定都是从 Slack 上交流和协调的,而当年收购 Slack 的却是 Salesforce。
amontlabs/lcu 将 Codex 的 Computer Use 能力单独拆出,让 Claude Code、Codex CLI、Pi 等 Agent 工具通过 MCP 调用。
Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?
SF Tech Week 今日开幕,Speedrun 将在其 Jackson Square 新办公室办活动,并与 1000+ 投资人举办 Demo Day。官方议程超过 1700 场活动,两年翻倍以上,来自 1058 家公司的 1266 位主办方参与,包括 OpenAI、Anthropic、Google、Mistral 等,Speedrun 投资组合公司主办 100+ 场。
Tibo 认为互联网上的大多数操作很快将由 AI 智能体完成,Notion 上线 MCP server 后流量激增、被迫重新考虑其经济模型,每个产品团队迟早都要决定是否为智能体而构建。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入消费者实际付费情况这一维度。数据显示,目前仅少数消费者为 AI 付费,但支出高度集中在头部,开发者、创作者等重度用户是主力;Olivia Moore 与 Josh Elman 还讨论了个人智能体、ChatGPT、Claude、Gemini 的不同走向,以及 OpenAI 的 $1B 广告收入规模。
ContextQA 推出自主质量工程师 Ship,可从 Slack 或 Linear 接收 bug 报告并复现,再把上下文交给 Claude Code 或 Codex 完成修复。该工具面向已部署的 PR 进行测试,用户可免费在 ship.contextqa.com 试用。作者指出,编码智能体需要这类反馈闭环,才能更好地修复自身 bug,而验证 agent 写的代码正成为软件工厂的一大瓶颈。
a16z 发布第七版 Top 100 消费级 AI 应用榜,首次新增收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 10 亿;Claude 升至网页端第 3,月访问量近 10 亿。
OpenAI 正在测试会在 ChatGPT 图像生成过程中出现的图片广告,相关说明发布在 OpenAI 官网。该消息由 AI Breakfast 转述,原文未披露广告的具体形式、投放范围与上线时间。
The Rundown AI 在 X 上发布了一条推文,附带指向 therundownai.beehiiv.com 上关于 OpenAI 的文章链接。推文本身未提供更多正文内容。
OpenAI 安全报告负责人因"破碎"文化离职。The Rundown 圆桌讨论分享了自家的 AI 用例,AI 101 栏目则讲如何在不同模型间做选择。Anthropic 正为"养育"Claude 寻求宗教智慧。
用户吐槽近期 ChatGPT 体验灾难性:Astra 太贵用不起,Sol 6 慢、幻觉、忽略指令、来回拉扯,Luna 这档也垮了,指令明确的小任务以前表现不错现在各种崩,没做完就说提前做完了,服务重启失败就直接放弃不修复。原本用它搭档 Coding 很享受,如今需频繁检查实现方式,稍复杂任务就来回搞不定,变成一种折磨。
OpenAI 的 ChatGPT 和 Codex 负责人 Tibo Sottiaux 承诺,未来 28 天每天推出一项对大多数 Codex 和 Work 用户明显有用的改进,否则进行一次完整的额度重置。
深思圈整理了 OpenAI 负责 ChatGPT 和 Codex 的 Tibo Sottiaux 在 Lenny's Podcast 上的访谈,他认为让用户自己设计循环、画流程图调教工作流只是过渡,未来是 Dots 这类会学习、永远在线的个人 agent。
有人给 Codex 几个小时和一个 API key,做出一支调侃 Threads 用户的音乐视频:Astra 负责写词,Fal 负责媒体生成,歌曲用 Suno、视频用 MiniMax H3。作者称歌词相当犀利,并反问谁说 LLM 不好笑。
外媒 Semafor 报道,Meta 发言人 Andy Stone 称公司正裁减一批今年 6 月从 AI 安全初创公司 Virtue AI 招聘而来的员工,入职仅四个月,理由是工作风格不合。
VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。
OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,用 1 万个智能体在 88 小时内消耗 1300 亿 token 解决一道千禧年大奖难题,功劳主要不在多智能体,他估计多智能体的贡献不到 10%,核心原因是拥有一个强大的通用模型。
马斯克回应社交平台提问时确认,旗下人工智能业务 SpaceXAI 将更名为 SpaceXSI,并称 SpaceX 本质上是一家「超级智能公司」;该业务由 xAI 今年 2 月被 SpaceX 收购、7 月更名为 SpaceXAI 而来。
Epoch AI 基于 OpenAI 2026 年 9 月发布的内部数据整理发现,OpenAI 研究人员的编码智能体使用量约每月翻倍。按 API 价格计价,中位数研究员的日均编码智能体支出从 2026 年 1 月的不足 1 美元升至 8 月中旬的 601 美元,第 90 百分位研究员同期超过 7000 美元。
fx v0.0.13 新增 Ultrafast 支持,针对支持的 OpenAI 模型,启动最高快 23 倍、shell 调用最高快 8.6 倍、退出最高快 44 倍,并支持可配置的自动压缩(automatic compaction)。
OpenAI 给 Codex 用户立下 28 天规矩:每天要么上线一项对多数 codex/work 用户明显有用的改进,要么把用量额度整个重置一次。该承诺由 Tibo(@thsottiaux)在 X 上发布。
Jerry Liu 认同 ChatGPT/Codex 拥有当前最好的深度工作智能体界面,理由是它把编程与知识工作统一在一个界面中,ChatGPT 与 Codex 之间切换没有明确分离的流程,并支持分支(forking)。他仍喜欢 Opus 5.5,尤其用于产品演示,也认为 Claude Code CLI 已是 CLI 应用能做到的最好水平。