Last Week in AI #346:OpenAI 发布 719 份数学手稿、两个西方开源模型、又一位安全研究员离职
OpenAI 于 10 月 6 日公开了由一款未发布内部前沿模型产出的 719 份数学手稿,覆盖 372 个主题族,并包含大量 Lean 形式化证明。Mistral 发布 1 万亿参数多模态模型 Mistral Large 4(绰号 Le Chonk),Reflection AI 推出 5010 亿总参数、230 亿激活的 MoE 开源模型 Beam。
OpenAI 于 10 月 6 日公开了由一款未发布内部前沿模型产出的 719 份数学手稿,覆盖 372 个主题族,并包含大量 Lean 形式化证明。Mistral 发布 1 万亿参数多模态模型 Mistral Large 4(绰号 Le Chonk),Reflection AI 推出 5010 亿总参数、230 亿激活的 MoE 开源模型 Beam。
开发者 @blended_jpeg 开源的 badclaude 已发布,可通过 `npm install -g badclaude` 全局安装。项目托管于 GitHub(GitFrog1111/badclaude),作者同步给出了 yaml 配置示例。
软银转向海湾地区寻求 1000 亿美元 AI 融资。同一份 FirstFT 简报还提到马士基的收购动作和瑞银的选择。
AI Will(@FinanceYF5)提出,营销人只需掌握 Claude Code 和 GitHub 两个基础工具,学会"营销工程"并搭建自己的 Agent,就能为公司创造真正的收入。该帖列出 11 个练习方向,并引导关注账号、点赞转发首条帖子。
Ira Bodnar 称掌握营销工程就永远不会失业,只需两样东西:Claude Code 和一个 GitHub 账号。会用它们并自建智能体的营销人员将为公司创造真金白银,他还给出了 11 个步骤。
营销 Agent 可连接 Meta 和 Google Ads,支持定时运行、预算限制与操作日志。示例规则为每小时检查账户:50 次转化后暂停 CPA 超目标 3 倍的广告,连续 3 天胜出则加预算 20%,并为最佳广告写 3 个新版本,每次操作及原因同步到 Slack。规则相同时,评论、竞品和真实混合 CAC 等独有数据决定胜负。
营销人只需掌握 Claude Code 和 GitHub 两个基础工具,就能学会"营销工程"这套能力,甚至搭建自己的 Agent。真正会用它们并自建 Agent 的营销人,能为公司创造真正的收入。原文列出 11 个练习方向。
软银寻求从海湾投资者处募集 1000 亿美元,用于扩大其 AI 领域投资。创始人兼首席执行官孙正义近几周已与阿联酋高层人士进行商谈。
宝玉(@dotey)发帖呼吁封号,强调"必须得封号",但未说明具体针对哪个账号或何种违规行为。该帖互动数据为 54 条回复、10 次转发、184 次点赞、49846 次浏览。
Sharpa 在 IROS 发布首款全自研通用人形机器人 D01、新一代灵巧手 W02 和外骨骼触感数据手套 AE01。D01 电子皮肤覆盖全身、触觉覆盖上半身,触觉采样率 100Hz,重复定位精度 0.2mm;W02 主动自由度从上一代 W01 的 22 个减到 21 个,整手尺寸缩小约 30%。
Anthropic 今天给 Claude 加了两个新功能:Claude Dashboards 能把公司数据做成自动更新的数据看板,Claude Motion 能把报告、图表做成几十秒的动画讲解,两者都在测试阶段。
廉价 AI「深度伪造」正涌入美国中期选举前的电视与网络政治广告,为攻击性宣传提供了新手段。距 11 月中期选举尚有一段时间,被篡改的图像已在各类渠道大量传播。
全球最大独立 AI 原生影视公司 Utopai Studios 正以自研视频模型 Utopai X 与制片平台 PAI 推进多部院线长片,定制视频模型 Utopai X 曾在 Artificial Analysis 文生视频盲评榜排到全球第二、全美第一。
软银正寻求海湾地区资金以扩大其 AI 布局,孙正义近几周与阿联酋投资者举行了会谈。
Milvus 3.0 Meetup 将于 10 月 21 日在旧金山举办,Milvus 正从向量搜索扩展为更广泛的检索引擎,融合向量、全文与结构化搜索,并支持开放 lake 格式数据。
一位开发者改变了对多 agent 协作的看法:不同性格和技能的 Bot 会讨论拍板,接入其 GitHub、Cloudflare API 和豆包播客 API 后,做出了一个 24 小时播报 AI 新闻的电视台。作者表示当日下午完成开源。
Agent Arena 完整排行榜已在 arena.ai/leaderboard 公布。该榜单来自 LMArena(lmarena.ai),用于对比不同 AI 智能体的表现,原文未披露具体排名、参评模型或评测分数。
Mistral Large 4 预览版进入 Agent Arena 前 15 实验室榜单,在超过 5K 场真实智能体会话中取得 -6.6% 的净提升分数,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次,目前在 Agent Arena 整体排名第 43。
星动纪元自研的世界动作模型VPP2登顶RoboDojo仿真榜单,平均成功率32.26%、平均得分39.26分,两项均列第一,领先GPT-6-Astra。该模型未额外加数据、未用Agent RSI等增强手段,仅靠标准数据集,在泛化、精细操作、记忆三个维度也拿下第一。团队将视频预测与动作学习分阶段训练,真机ALOHA零样本操作平均成功率58.5%,高于π0.5的40%,现已在GitHub开源。
Anthropic 因低估需求,暂停 Claude Startups 项目的 Claude Team 套餐与 $1,000 API 额度两项福利,该项目申请量达数十万份,官方正重新审核申请。已领取的福利仍保留在账户中,但部分此前已获批、尚未领取的账号可能失去资格。Startup Stack 与 Applied AI office hours 等其余权益继续保留。
Kling AI 将于 10 月 14 日在 LA Tech Week 2026 举办活动,联合 Oxen AI 与 Obsidian Studio 探讨 AI 视频从模型能力、平台集成走向企业工作流与专业内容生产。活动时间为下午 4:00–7:00,地点在 Santa Monica 的 Met Her at a Bar - Patio,需通过链接 RSVP。
Qwen3.8-Max、Qwen3.8-Flash 和 Wan3.0 在 GMI Cloud 上线,免费访问延长 7 天,三款模型的速率限制同步提高。GMI Cloud 发起作品征集,按最具创意、最具挑战、投入最多选出 3 名获奖者,各得 200 美元现金加 200 美元 GMI 额度。
斯坦福大学 CS146S「The Modern Software Developer」第三周课程已公开,主题为 Agent Skills and CLI,首次加入客座讲师 @leerob,内容涵盖 SKILL.md 与脚本编码工作流、Web skills 扩展 Agent 能力边界及 CLI 高效工作方式。
Guillermo Rauch 表示,发现新人才是工作和生活中最令人享受的事情之一,能在别人尚未完全看清自己时就看出其伟大之处。
Anthropic 进一步明确了 Claude 支持地区的执行口径:不再只看账号注册地或使用者所在国家。受限范围包括使用者本人身处不受支持地区、注册地或总部设在非支持地区的企业及其员工,以及由非支持地区个人或实体直接或间接持有多数股权或实际控制权的企业。
Anthropic 在新版使用政策中加入禁令,用户不得持续、无必要地虐待 Claude。被禁止的行为包括持续羞辱或贬低模型、反复逼模型表演痛苦、代码出错后的尖锐批评,以及用黑暗故事诱导或研究模型反应。该政策适用于 Claude 网页版、Claude Code、API、通过云平台或授权经销商使用 Claude 的客户,以及集成产品的所有终端用户。
近期网络上出现大量涉及懂车帝的梗图,相关内容在社交平台引发传播与讨论。
特朗普 10 月 8 日在白宫颁发国家科学奖章与国家技术与创新奖章,Google 联合创始人 Sergey Brin、英伟达 CEO 黄仁勋、马斯克、AMD CEO 苏姿丰获国家科学奖章,戴尔创始人 Michael Dell 与微软 CEO Satya Nadella 获国家技术与创新奖章。
Edge0 团队开源一个月后,其 35B 模型已能在 iPhone 飞行模式下运行,峰值内存仅 1.8GB,无需云端、远程服务器,也没有按 token 计费成本。该模型已从手机扩展到耳机、智能眼镜、机器人和 AI 玩具,并获得 8 万+客户。转发者还发起讨论,期待 Edge0 接下来跑在哪种设备上。
Matt Pocock 分享了「AI Coding Agent 该用多重流程」的决策框架,按改动规模匹配流程重量。
Genspark 宣布 Claude Haiku 5.5 已在其 AI Chat、Code Agent 和 Claw 中上线。据 Anthropic 介绍,Claude Haiku 5.5 是其目前最便宜、最快且能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。
博通正为其与OpenAI合作的定制AI芯片项目安排逾500亿美元融资,阿波罗全球管理与黑石集团是洽谈参与的贷款机构之一,甲骨文也在与阿波罗、高盛商谈为购买芯片筹资。另有消息称三星电子移动体验事业部已开始削减第四季度产量,减产幅度最高达30%,外界认为与假日季内存芯片价格上涨、营业利润率承压有关。
奕斯伟计算10月9日登陆港交所,发行价1.55港元,发行市值341亿港元,募资净额23.86亿港元,被称为RISC-V第一股。这家由京东方创始人王东升于2019年创办的芯片公司,2025年营收24.31亿元,但三年累计净亏损近49亿元,最大客户收入占比曾达82.1%。
成都恒瀚微电子2026年8月完成近亿元天使轮融资,投资方为北京国泰、成都科创投、成都高新创投和中信聚信投资,资金用于产品迭代、人才引进和市场拓展。其首款400G RDMA智能网卡已完成送样验证并拿到正式订单,自研RDMA架构结合credit-based主动拥塞管理,部分测试场景动态时延为英伟达同类产品(CX-7)的1/2至1/3。
获 Nvidia 投资的澳大利亚数据中心运营商 Firmus 放弃在悉尼上市、规模 50 亿美元的 IPO 计划,归因于“近期市场波动与当前市场状况”。
有观点提出,刹车未来是否可以用 AI 代替。该讨论未给出具体模型、技术方案或测试数据,只抛出这一疑问。
向阳乔木正在开发一个 AI 驱动的 Obsidian 封面设计工具,目前处于制作阶段,尚未公布具体模型、功能细节或发布时间。
Unsloth 与 Windows 团队合作,把微软开源(MIT 协议)的跨平台沙箱系统 mxc(Microsoft eXecution Container)集成为 Windows 上的操作系统级沙箱,用于隔离 AI Agent 的代码执行,官方称额外开销低于 100 ms。
Joma Tech 发布了一支模仿 OpenAI GPT-6 Astra 广告的恶搞视频,虚构「ChatGPT for Dishwashing」宣称 GPT-6 在长时间洗涤与顽固污渍的洗碗基准上取得 SOTA。视频借 Navier–Stokes 千年大奖难题玩梗,称现实中 OpenAI 曾用 10,000 个 AI 智能体在 88 小时内找到证明。
腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。