Ideogram 推出 MCP,让 Claude 变身世界级设计智能体
Ideogram 发布 Ideogram MCP,可在对话中直接生成图像、设计并训练自定义模型,无需离开聊天界面。该 MCP 同样支持 ChatGPT、Cursor、Hermes 等。
Ideogram 发布 Ideogram MCP,可在对话中直接生成图像、设计并训练自定义模型,无需离开聊天界面。该 MCP 同样支持 ChatGPT、Cursor、Hermes 等。
OpenAI 在 API 中上线 GPT Realtime 2(由 GPT-5 驱动)等语音智能功能,并加入实时翻译与 Whisper 转写;Thinking Machines 预览了双模型架构的低延迟全双工对话系统,但尚未开放公测。
Codex 官方团队的 jason(@jxnlco)分享了把 Codex 用到极致的组合用法,核心是从写代码延伸到终端命令、浏览网页、调用 API 等各类电脑工作。
Applied Compute 为 DoorDash、Cognition 等企业训练定制 AI 智能体,其核心训练机制是强化学习。团队用 Modal Sandboxes 搭建高保真环境、以 Modal Functions 做大规模并行评分,并靠预构建镜像的亚秒级冷启动让训练循环保持 GPU-bound 而非 CPU-bound。
Genspark 公开感谢 OpenAI 的 Sam、Greg 和 Denise 赠送红酒,并表示 Genspark 非常感谢 OpenAI 的大力支持,双方正共同构建 AI 的未来。
METR 于 2026 年 2 月启动试点,评估前沿 AI 开发商内部智能体失准风险,Anthropic、Google、Meta、OpenAI 参与。报告认为这些内部智能体在评估期合理具备实施小规模失控部署的手段、动机和机会,但不具备让其高度抗打击的能力,所有共享模型的内部前沿与 2026 年 2 至 3 月公开前沿差距不大。
METR 首次以机构为单位评估前沿实验室内部智能体的失控风险,披露了内部与公开模型差距及作弊行为的具体证据。
METR 发布 2026 年 2 月 16 日至 3 月 16 日的前沿 AI 风险评估试点报告,Anthropic、Google、Meta 和 OpenAI 参与,METR 获得了各家当时最强内部模型(含原始思维链)的访问权限。评估认为这些内部智能体很可能具备发起小规模未授权部署的手段、动机和机会,但尚不具备使其高度稳健的能力;METR 计划在 2026 年晚些时候再次开展类似评估。
METR 发布 2026 年 2 至 3 月前沿 AI 风险报告,对 Anthropic、Google、Meta 和 OpenAI 内部使用的 AI 智能体做了一次实体级(而非单模型)试点评估。
Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。
SentinelOne 拆解出一个约 20 年前、比 Stuxnet 更早的病毒 fast16.sys,它专门篡改 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件的计算结果。
Google 宣布扩展内容透明与验证工具,把 SynthID 的水印核查能力从 Gemini app 扩展到 Search 和 Chrome,此前该功能已被全球使用 5000 万次。
Google Cloud 在市场营销团队下成立以 AI 为核心的新部门并大量招募 FDE,面试流程从过去的 4-6 轮压缩到两天内两轮;OpenAI 于 5 月 11 日宣布成立由私募股权基金投资 40 亿美元。
Sapu 将 PubMed 全部 2800 万条摘要索引进单个 Qdrant collection,此前研究人员只能分批上传摘要子集查询。该平台采用 OpenAI text-embedding-3-large(3072 维)配合 LangChain 写入 Qdrant Cloud,并支持将 1000 篇文档拆成 1000 个独立并行查询。
Codex、Cursor 3.0、Claude 桌面版等头部 Agent 应用已几乎同时收敛到"左项目、中对话、右工作区"的三栏布局,但右侧目前只能看不能改,二次编辑仍是缺口。
本文拆解了包裹大语言模型的 Agent Harness 架构,涵盖编排循环、工具、记忆、上下文管理、状态持久化、错误处理和护栏等 12 个组件,并说明提示词工程、上下文工程与 Harness 工程三个层次的区别。
英伟达 GEAR Lab 负责人 Jim Fan 在 Sequoia AI Ascent 2026 的《Robotics' End Game》演讲中宣布 VLA 路线过时,包括他此前主推的 GR00T,提出以世界动作模型(WAM)为新范式,代表作是 2 月发布的 140 亿参数 DreamZero。
Last Week in AI 第 340 期聚焦 OpenAI 与 Musk 诉讼首周进展,以及 OpenAI 化解 Microsoft 因 500 亿美元 Amazon 交易面临的法律风险。DeepSeek 预览新模型 v4,称其"缩小了与前沿模型的差距",本期还提及 Vision Banana。
俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。
Andrej Karpathy 表示,OpenAI 的 VPT 曾在 2022 年令他震撼,如今 SI 将这一思路扩展为 FDM1,并应用于知识工作与计算机使用场景。他对此感到兴奋,期待看到更多进展。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中表示,2025 年 12 月后最新模型生成的代码已开始直接可用,他进入凭感觉让 AI 写代码的状态。
GitHub Copilot 宣布自 2026 年 6 月 1 日起所有计划改为按用量计费,用户每月订阅费将等值兑换为 token 额度。此前微软长期补贴用户算力,2023 年《华尔街日报》曾报道部分用户每月造成高达 80 美元成本,而订阅费仅 10 美元。Anthropic 也曾允许每 1 美元订阅烧掉超过 8 美元计算成本。
GPT-5.5 已在 Monica AI 正式上线,官方称其在推理、编程和创作能力上有大幅提升。用户可直接在 Monica AI 上体验该模型,应对复杂问题求解与内容创作等任务。
GPT-5.5 和 GPT-5.5-Pro 已在 Poe 全平台及 Poe API 上线,用户可通过 poe.com/GPT-5.5 和 poe.com/GPT-5.5-Pro 访问。
Poe 宣布 GPT-5.5 和 GPT-5.5 Pro 已在其平台上线,并称此前以早期访问形式在复杂编码、调试和推理工作流中做了测试。在部分内部评测中,任务完成率提升 12%,复杂提示词的重试次数减少 16%,长上下文表现提升 19%。
DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。
DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。
Monica AI 已上线 Claude 4.7 Opus 和 GPT Image 2,前者带来更强的推理与深度分析能力,后者提供图像生成。官方称此次更新覆盖编程、写作与设计场景,用户可在 monica.im 体验。
作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。
Kevin Weil 宣布今天是他在 OpenAI 的最后一天,原因是 OpenAI for Science 正被拆散并入其他研究团队。他回顾了从首席产品官到加入研究团队并创办 OpenAI for Science 的两年经历,并表示加速科学将是 AGI 推进过程中最积极的成果之一。
Codex 新版 computer use 能力被评价为「出奇地好」,Ari Weinstein 称这是他首次看到 LLM 操作 GUI 的速度与人一样快。该内容来自 Kevin Weil 转发的推文。
黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。
OpenAI 发布 GPT-Rosalind,称其为首个面向生物学、药物发现和转化医学等科学研究的前沿模型,训练覆盖化学、蛋白质工程、基因组学,并内置研究者常用数据库与工具的相关知识。该模型通过可信访问部署结构向合格客户开放,以防范生物领域的滥用风险。同时 OpenAI 面向所有人推出 Codex 的生命科学插件,可搭配主线模型及 GPT-Rosalind 使用。
OpenAI 推出 GPT-Rosalind,面向生命科学场景,现已开放访问申请,并同步发布了配套的 Life Sciences 插件(GitHub 地址见原文)。官方博客提供了视频与演示,具体参数与评测数据尚未披露。
Modal 发布教程,演示如何在 OpenAI Agents SDK 之上从零搭建自定义编码智能体框架,通过 SandboxAgent 和 ShellTool 把智能体放进带 GPU 的 Modal 沙箱中执行任务。
OpenAI 的 Kevin Weil 公开赞同 Greg Brockman 的观点:世界经济正向算力驱动转型,AI 已让软件工程在过去六个月大幅提速,并将把同样的变革带到所有用电脑完成的工作中。Brockman 认为人们不再需要把目标拆解成指令去迁就机器,能解决多大规模的问题取决于可获得的算力,小团队也可完成过去需更大团队才能做的事。
Andrej Karpathy 转述一种观点:OpenClaw 引发巨大关注,原因在于这是大批非技术用户首次体验最新的智能体模型,此前他们对 AI 的认知基本等同于 ChatGPT 这一个网站。该观点强调这次热潮的用户群体变化,而非模型能力本身。
Andrej Karpathy 指出,公众对 AI 能力的理解存在日益扩大的鸿沟:许多人仍以去年免费版 ChatGPT 的幻觉和怪癖来判断 AI 水平,而这类旧模型并不反映今年最新一代智能体模型(尤其 OpenAI Codex 和 Claude Code)的能力。
OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。
OpenAI 的 Prism 新增 Paper Review 功能,用 AI 审阅技术与科学论文,目标是提升科学严谨性、正确性与可复现性。该功能由 @hemal 在数小时内以简单 skill 形式构建,因为 Prism 由 Codex 驱动。OpenAI 正为 Prism 招聘一名首席设计师。
OpenAI 上线 prism.openai.com 并开放试用。帖子未披露该产品的具体功能、模型版本或定价信息,仅邀请用户前往体验并反馈意见。
Nothing 手机与穿戴产品负责人 Shawn 在上海发布会后受访,称 Nothing 的 AI 路线是近未来(AI + 传统产品)与远未来(AI Native)双轨探索。