xAI 联创 Christian Szegedy 长文《数学何去何从?》:AI 让数学「毕业」,两千年英雄攀登史落幕
xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。
xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。
Gary Marcus 质疑 Anthropic 的 IPO 是否建立在其最佳季度表现之上。据 The Information,Microsoft 已将内部 Claude 支出削减超过三分之一,Meta 的 Claude Code 用户数也已减半;Microsoft 此前为 Copilot 功能每年在 Anthropic 模型上的支出预计至少 20 亿美元。
Codex Project 与 Claude Projects 的组织方式被类比为论坛板块与 Slack Channel:前者像容器或分类,相关内容都放进来并可不断新开会话,但容易歪楼、上下文较乱;后者所有消息集中在一起,想深入某个子话题时新开 Thread 展开讨论,借此聚焦上下文。
据 The Information,微软已将内部 Claude 支出削减超过三分之一,Meta 的 Claude Code 用户数减半。微软原本每年在 Anthropic 模型上支出至少 20 亿美元,用于为其生产力软件客户提供 Copilot 的 AI 功能,现已在 Copilot 中用部分自研模型替换 Claude。
Mercor 等数据公司正以时薪低至 45 美元起的零工,雇人编写评分细则、标准答案和推理轨迹来训练 AI,部分项目任务量骤减、时薪下调 8 美元,劳动者还被 Insightful 软件逐秒监控。Mercor 由三名 19 岁创始人于 2023 年创办,去年估值达 100 亿美元,每周约 3 万名专业人士在其平台工作,OpenAI 和 Anthropic 都曾是客户。
一些Anthropic研究员正考虑在美国偏远地区买地,作为AI失控后的避难选项。Anthropic前研究员Jacob Coxon今年9月初辞职,称构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",该帖获1.74亿次浏览。
Baseten 工程师 Shawn Rushefsky 分享实验,让 Claude Code 为 Qwen-3.6-35B-A3B 自主编写并优化推理引擎 VibeQwen。
Anthropic Claude Code 团队核心成员 Thariq Shihipar 在 Latent Space 播客中表示,Claude Code 将支持 AGENTS.md,但随着模型能力提升,CLAUDE.md 这类静态指令文件最终可能不再需要,新项目甚至可以先不写。
a16z 发布第七版 Top 100 消费级 AI 应用榜,首次加入收入榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第三,月访问量近 1B。
宝玉推荐多用 Claude Projects,指出每个 Project 可拥有自己的 System Project 和记忆,也能使用 skills,项目下所有任务在同一会话中进行,子任务以 Thread 形式展开。
作者卡兹克解读 A16Z 第七版《Top 100 消费级 AI 应用》与 9 月底更新的《市场状况 II》两份报告,整理出其中的反常识数据。
Epoch AI 发布研究,梳理中国六家头部 AI 公司(阿里、字节、Z.ai、月之暗面、DeepSeek、MiniMax)的五类收入来源:面向消费者的 AI 应用、售卖模型访问、面向企业和政府的定制部署、授权费,以及用 AI 带动既有产品线。
据 The Information 10 月 5 日报道,Meta 和微软正在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。Meta 内部使用 Claude Code 的员工从年初约 6 万人降至最近约 3 万人,同时推广自研 Muse Code(已有超 6000 名员工使用,8 月起对外部客户测试)和内部工具 MetaCode(用户超 3 万)。
NotebookLM 在 a16z 第七版 Top 100 消费级 AI 应用榜单中进入生成式 AI 网页产品前十。该榜单首次加入收入排行榜,ChatGPT 以移动端超 10 亿月活继续居首,Claude 以近 10 亿月访问量升至网页端第三,品类还扩展至 Lovable、Cursor、Suno、ElevenLabs、Kling、Manus 等。
半导体和 AI 产业研究机构 SemiAnalysis 实测了 Anthropic、OpenAI 等九家的 AI 订阅套餐,在两家主推的日常主力模型上,Claude 订阅折算出的价值约为 OpenAI 的 5 倍。
Thomas Wolf 表示希望 Opus 4.6 能长期保留,起因是 David Holz 让 LLM 自由玩耍并自评谁玩得最开心,结果较新的模型似乎乐趣更少。多数模型选择了文字游戏,而 Opus 4.6 反复胜出,方式是想象由矛盾构成、存在于下落水滴中的短暂世界。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。
MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。
SemiAnalysis用自建Tokenomics模型测量各AI订阅计划的额度与API等效价值,发现在中端模型档位上Anthropic提供约5倍于OpenAI的API等效价值。
a16z 发布第七版 Top 100 消费级 AI 应用榜,ChatGPT 仍居首,移动端月活超 10 亿;Claude 升至网页端第 3,月访问量近 10 亿。榜单新增收入排行,品类已扩展到 vibe coding、音乐、设计、语音、视频、智能体乃至硬件,但 15 个消费互联网品类中有 9 个的前 100 名里没有任何 AI 产品。
a16z 的 Olivia Moore 认为消费级 AI 商业模式被搞反了:目前几乎所有收入都来自直接订阅,在其 Web 榜单中 85% 的产品靠订阅变现,62% 另有 credits 或超额使用付费,仅 13% 采用广告等"用户即产品"的模式。
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
OpenAI 宣布未来几周内,欧盟用户在 ChatGPT 和 Codex 里生成的文字会带上看不见的水印,以满足欧盟《人工智能法案》的透明度要求;8 月 Anthropic 已给 Claude 加了水印,原因是同一法案的透明度条款在今年 8 月 2 日生效。
a16z 发布第七版 Top 100 消费级 AI 应用榜,新增收入排行榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量接近 1B。
Agent 会话的交互设计有很多借鉴自 Slack,Claude 最新的 Projects 就脱胎于 Thread 设计,简洁好用。有观点指出,OpenAI 的一切产品决定都是从 Slack 上交流和协调的,而当年收购 Slack 的却是 Salesforce。
Anthropic 推出扩展版 Cyber Verification Program,面向符合条件的安全从业者开放高级网络安全能力和放宽的拦截分类器,共设 Defense、Red Team、Specialized 三个访问层级,均可用 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型。
Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?
SF Tech Week 今日开幕,Speedrun 将在其 Jackson Square 新办公室办活动,并与 1000+ 投资人举办 Demo Day。官方议程超过 1700 场活动,两年翻倍以上,来自 1058 家公司的 1266 位主办方参与,包括 OpenAI、Anthropic、Google、Mistral 等,Speedrun 投资组合公司主办 100+ 场。
a16z 发布第七版 Top 100 消费级 AI 应用榜,新增收入排行。榜单显示,AI 支出排名前 1% 的用户月均花费 903 美元,已超过后 50% 用户的总和,中位数用户仅 25 美元。ChatGPT 仍居首,移动端月活超 10 亿;Claude 在网页端升至第 3,月访问量接近 10 亿;品类已扩展到 vibe coding、音乐、设计、语音、视频、智能体和硬件等方向。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入消费者实际付费情况的维度。数据显示付费高度集中于开发者、创作者等重度用户,Olivia Moore 与 Josh Elman 在播客中讨论了 ChatGPT、Claude、Gemini 的不同走向、个人智能体的隐私墙、OpenAI 的 10 亿美元广告收入规模,以及订阅制为何可能不是把消费级 AI 带给所有人的最终商业模式。
ContextQA 推出自主质量工程师 Ship,可从 Slack 或 Linear 接收 bug 报告并复现,再把上下文交给 Claude Code 或 Codex 完成修复。该工具面向已部署的 PR 进行测试,用户可免费在 ship.contextqa.com 试用。作者指出,编码智能体需要这类反馈闭环,才能更好地修复自身 bug,而验证 agent 写的代码正成为软件工厂的一大瓶颈。
a16z 第七版 Top 100 消费者 AI 应用榜发布,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页榜第三,月访问量近 1B。
freeCodeCamp 发布教程,讲解 AI 编码智能体为何会陷入反复修复不成功的循环,并给出停止、回退、重新描述、单点修改、真实验证五步流程。文章以一次重复扣费 bug 为例,展示先写失败测试再向智能体提精确需求的做法,修复本身只有十几行代码,并附一份可复用的检查清单。作者指出该模式在 Lovable、Replit、Cursor、Claude Code、Base44 等工具上都会出现。
OpenAI 安全报告负责人因"破碎"文化离职。The Rundown 圆桌讨论分享了自家的 AI 用例,AI 101 栏目则讲如何在不同模型间做选择。Anthropic 正为"养育"Claude 寻求宗教智慧。
写好 skill 的前提是先看懂好 skill 的标准,评审优秀 skill 有五项标准:description、触发策略、正文、第三层、一致性。
VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。
有用户提醒,收到任何 Claude 的奖励、问卷或邮件都不要点击,例如所谓 250 刀云额度。该用户称,Anthropic 虽然模型非常厉害,但行为可能不那么正派。
MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。
Anthropic 的 Claude Managed Agents 实操 workshop 将于 10 月 12 日在 AI Engineer New York 开讲,由 cjav_dev 和 Harrison Stall 主讲,内容为 Managed Agent 的最新功能。活动 10 月 12 日至 14 日在纽约举行,workshop 需在会议通票之外另行购买。
Andrej Karpathy 时隔两个月发文,公开了自己日常让大模型把内容讲透的四级递进技巧。第一级是写作,用航空维护文档规范 ASD-STE100 让模型产出受控文本。