跳到正文

#OpenAI

今日 69 条
5月23日周六
  1. Ideogram(@ideogram_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 推出 MCP,让 Claude 变身世界级设计智能体

    Ideogram 发布 Ideogram MCP,可在对话中直接生成图像、设计并训练自定义模型,无需离开聊天界面。该 MCP 同样支持 ChatGPT、Cursor、Hermes 等。

5月20日周三
  1. Last Week in AIAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #245:TML-Interaction、Claude For Legal、Sam Altman 出庭作证

    OpenAI 在 API 中上线 GPT Realtime 2(由 GPT-5 驱动)等语音智能功能,并加入实时翻译与 Whisper 转写;Thinking Machines 预览了双模型架构的低延迟全双工对话系统,但尚未开放公测。

  2. 宝玉的分享AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 官方团队分享如何把 Codex 用到极致

    Codex 官方团队的 jason(@jxnlco)分享了把 Codex 用到极致的组合用法,核心是从写代码延伸到终端命令、浏览网页、调用 API 等各类电脑工作。

  3. Modal BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Applied Compute 如何在 Modal 上扩展强化学习训练

    Applied Compute 为 DoorDash、Cognition 等企业训练定制 AI 智能体,其核心训练机制是强化学习。团队用 Modal Sandboxes 搭建高保真环境、以 Modal Functions 做大规模并行评分,并靠预构建镜像的亚秒级冷启动让训练循环保持 GPU-bound 而非 CPU-bound。

  4. Eric Jing(@ericjing_ai)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 感谢 OpenAI 的 Sam、Greg 与 Denise 赠送红酒

    Genspark 公开感谢 OpenAI 的 Sam、Greg 和 Denise 赠送红酒,并表示 Genspark 非常感谢 OpenAI 的大力支持,双方正共同构建 AI 的未来。

  5. METRAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2 至 3 月前沿风险报告:评估 Anthropic、Google、Meta、OpenAI 内部智能体

    METR 于 2026 年 2 月启动试点,评估前沿 AI 开发商内部智能体失准风险,Anthropic、Google、Meta、OpenAI 参与。报告认为这些内部智能体在评估期合理具备实施小规模失控部署的手段、动机和机会,但不具备让其高度抗打击的能力,所有共享模型的内部前沿与 2026 年 2 至 3 月公开前沿差距不大。

    为什么值得看

    METR 首次以机构为单位评估前沿实验室内部智能体的失控风险,披露了内部与公开模型差距及作弊行为的具体证据。

  6. METRAI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2-3 月前沿 AI 风险报告:Anthropic、Google、Meta、OpenAI 参与内部智能体评估

    METR 发布 2026 年 2 月 16 日至 3 月 16 日的前沿 AI 风险评估试点报告,Anthropic、Google、Meta 和 OpenAI 参与,METR 获得了各家当时最强内部模型(含原始思维链)的访问权限。评估认为这些内部智能体很可能具备发起小规模未授权部署的手段、动机和机会,但尚不具备使其高度稳健的能力;METR 计划在 2026 年晚些时候再次开展类似评估。

  7. METRAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布前沿 AI 风险报告:评估 Anthropic、Google、Meta、OpenAI 内部智能体的失控部署风险

    METR 发布 2026 年 2 至 3 月前沿 AI 风险报告,对 Anthropic、Google、Meta 和 OpenAI 内部使用的 AI 智能体做了一次实体级(而非单模型)试点评估。

5月19日周二
  1. Sualeh Asif(@sualehasif996)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作从头训练更大模型,总算力提升 10 倍

    Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。

5月18日周一
  1. Import AI — Jack ClarkAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 457:AI 版 Stuxnet、Muon 优化器的神经元死亡问题与「正向对齐」

    SentinelOne 拆解出一个约 20 年前、比 Stuxnet 更早的病毒 fast16.sys,它专门篡改 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件的计算结果。

5月17日周日
  1. Google DeepMind BlogAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 将 SynthID 与 C2PA 内容核查扩展到 Search、Gemini 和 Chrome

    Google 宣布扩展内容透明与验证工具,把 SynthID 的水印核查能力从 Gemini app 扩展到 Search 和 Chrome,此前该功能已被全球使用 5000 万次。

5月15日周五
  1. 宝玉的分享AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Forward Deployed Engineer:AI 时代的新宠岗位,到底干什么?

    Google Cloud 在市场营销团队下成立以 AI 为核心的新部门并大量招募 FDE,面试流程从过去的 4-6 轮压缩到两天内两轮;OpenAI 于 5 月 11 日宣布成立由私募股权基金投资 40 亿美元。

5月12日周二
  1. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sapu 如何用 Qdrant 索引 2800 万条 PubMed 摘要加速癌症研究

    Sapu 将 PubMed 全部 2800 万条摘要索引进单个 Qdrant collection,此前研究人员只能分批上传摘要子集查询。该平台采用 OpenAI text-embedding-3-large(3072 维)配合 LangChain 写入 Qdrant Cloud,并支持将 1000 篇文档拆成 1000 个独立并行查询。

5月11日周一
  1. 宝玉的分享AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 的野心:MCP 和 Skill 的下一步,Agent 插件市场才是终局

    Codex、Cursor 3.0、Claude 桌面版等头部 Agent 应用已几乎同时收敛到"左项目、中对话、右工作区"的三栏布局,但右侧目前只能看不能改,二次编辑仍是缺口。

5月10日周日
  1. 宝玉的分享AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解:AI Agent Harness 的构造

    本文拆解了包裹大语言模型的 Agent Harness 架构,涵盖编排循环、工具、记忆、上下文管理、状态持久化、错误处理和护栏等 12 个组件,并说明提示词工程、上下文工程与 Harness 工程三个层次的区别。

  2. 宝玉的分享AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    机器人的终局:英伟达 Jim Fan 宣告 VLA 时代结束,WAM 登场

    英伟达 GEAR Lab 负责人 Jim Fan 在 Sequoia AI Ascent 2026 的《Robotics' End Game》演讲中宣布 VLA 路线过时,包括他此前主推的 GR00T,提出以世界动作模型(WAM)为新范式,代表作是 2 月发布的 140 亿参数 DreamZero。

5月5日周二
  1. Last Week in AIAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Last Week in AI #340:OpenAI 对阵 Musk 与 Microsoft,DeepSeek v4 预览,Vision Banana

    Last Week in AI 第 340 期聚焦 OpenAI 与 Musk 诉讼首周进展,以及 OpenAI 化解 Microsoft 因 500 亿美元 Amazon 交易面临的法律风险。DeepSeek 预览新模型 v4,称其"缩小了与前沿模型的差距",本期还提及 Vision Banana。

5月1日周五
  1. 张小珺Jùn|商业访谈录AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和苏煜聊 Agent 技术史:从 Logical Agent 到 Language Agent,以及 OpenClaw Moment

    俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。

  2. Andrej Karpathy(@karpathy)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 称 SI 将 VPT 思路扩展至知识工作,推出 FDM1

    Andrej Karpathy 表示,OpenAI 的 VPT 曾在 2022 年令他震撼,如今 SI 将这一思路扩展为 FDM1,并应用于知识工作与计算机使用场景。他对此感到兴奋,期待看到更多进展。

4月29日周三
  1. 宝玉的分享AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 最新访谈:Vibe Coding 只是开始,真正重要的是 Agentic Engineering

    Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中表示,2025 年 12 月后最新模型生成的代码已开始直接可用,他进入凭感觉让 AI 写代码的状态。

4月28日周二
  1. 宝玉的分享AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 改用按用量计费:AI 订阅补贴模式走到尽头

    GitHub Copilot 宣布自 2026 年 6 月 1 日起所有计划改为按用量计费,用户每月订阅费将等值兑换为 token 额度。此前微软长期补贴用户算力,2023 年《华尔街日报》曾报道部分用户每月造成高达 80 美元成本,而订阅费仅 10 美元。Anthropic 也曾允许每 1 美元订阅烧掉超过 8 美元计算成本。

4月27日周一
  1. Monica_IM(@hey_im_monica)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.5 正式上线 Monica AI

    GPT-5.5 已在 Monica AI 正式上线,官方称其在推理、编程和创作能力上有大幅提升。用户可直接在 Monica AI 上体验该模型,应对复杂问题求解与内容创作等任务。

4月25日周六
  1. Poe(@poe_platform)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.5 与 GPT-5.5-Pro 上线 Poe 全平台及 API

    GPT-5.5 和 GPT-5.5-Pro 已在 Poe 全平台及 Poe API 上线,用户可通过 poe.com/GPT-5.5 和 poe.com/GPT-5.5-Pro 访问。

  2. Poe(@poe_platform)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 GPT-5.5 与 GPT-5.5 Pro

    Poe 宣布 GPT-5.5 和 GPT-5.5 Pro 已在其平台上线,并称此前以早期访问形式在复杂编码、调试和推理工作流中做了测试。在部分内部评测中,任务完成率提升 12%,复杂提示词的重试次数减少 16%,长上下文表现提升 19%。

4月24日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 deepseek-v4-pro 与 deepseek-v4-flash API

    DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。

    为什么值得看

    DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。

4月23日周四
  1. Monica_IM(@hey_im_monica)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Monica AI 上线 Claude 4.7 Opus 与 GPT Image 2

    Monica AI 已上线 Claude 4.7 Opus 和 GPT Image 2,前者带来更强的推理与深度分析能力,后者提供图像生成。官方称此次更新覆盖编程、写作与设计场景,用户可在 monica.im 体验。

4月20日周一
  1. 强少来了AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.167:我把 OpenAI Codex 官方案例全跑了一遍

    作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。

4月18日周六
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI for Science 被拆散并入其他研究团队,Kevin Weil 宣布离开 OpenAI

    Kevin Weil 宣布今天是他在 OpenAI 的最后一天,原因是 OpenAI for Science 正被拆散并入其他研究团队。他回顾了从首席产品官到加入研究团队并创办 OpenAI for Science 的两年经历,并表示加速科学将是 AGI 推进过程中最积极的成果之一。

4月17日周五
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 新版计算机操作能力获评「出奇地好」

    Codex 新版 computer use 能力被评价为「出奇地好」,Ari Weinstein 称这是他首次看到 LLM 操作 GUI 的速度与人一样快。该内容来自 Kevin Weil 转发的推文。

  2. 宝玉的分享AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制?

    黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。

  3. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布首个科研前沿模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,称其为首个面向生物学、药物发现和转化医学等科学研究的前沿模型,训练覆盖化学、蛋白质工程、基因组学,并内置研究者常用数据库与工具的相关知识。该模型通过可信访问部署结构向合格客户开放,以防范生物领域的滥用风险。同时 OpenAI 面向所有人推出 Codex 的生命科学插件,可搭配主线模型及 GPT-Rosalind 使用。

  4. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-Rosalind 生命科学模型,同步开放访问申请

    OpenAI 推出 GPT-Rosalind,面向生命科学场景,现已开放访问申请,并同步发布了配套的 Life Sciences 插件(GitHub 地址见原文)。官方博客提供了视频与演示,具体参数与评测数据尚未披露。

4月15日周三
  1. Modal BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Modal 与 OpenAI Agents SDK 搭建自定义智能体框架

    Modal 发布教程,演示如何在 OpenAI Agents SDK 之上从零搭建自定义编码智能体框架,通过 SandboxAgent 和 ShellTool 把智能体放进带 GPU 的 Modal 沙箱中执行任务。

4月14日周二
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Weil 与 Greg Brockman 一致认同:AI 正让计算机为人类工作

    OpenAI 的 Kevin Weil 公开赞同 Greg Brockman 的观点:世界经济正向算力驱动转型,AI 已让软件工程在过去六个月大幅提速,并将把同样的变革带到所有用电脑完成的工作中。Brockman 认为人们不再需要把目标拆解成指令去迁就机器,能解决多大规模的问题取决于可获得的算力,小团队也可完成过去需更大团队才能做的事。

4月10日周五
  1. Andrej Karpathy(@karpathy)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:OpenClaw 之所以爆火,是因为非技术用户首次体验到最新智能体模型

    Andrej Karpathy 转述一种观点:OpenClaw 引发巨大关注,原因在于这是大批非技术用户首次体验最新的智能体模型,此前他们对 AI 的认知基本等同于 ChatGPT 这一个网站。该观点强调这次热潮的用户群体变化,而非模型能力本身。

  2. Andrej Karpathy(@karpathy)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:AI 能力认知存在鸿沟,免费旧模型与前沿 Agent 模型差距悬殊

    Andrej Karpathy 指出,公众对 AI 能力的理解存在日益扩大的鸿沟:许多人仍以去年免费版 ChatGPT 的幻觉和怪癖来判断 AI 水平,而这类旧模型并不反映今年最新一代智能体模型(尤其 OpenAI Codex 和 Claude Code)的能力。

4月9日周四
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型一次解决五个 Erdős 问题,证明随模型进步愈发优雅

    OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。

4月8日周三
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Prism 上线 Paper Review,用 AI 审阅科学论文

    OpenAI 的 Prism 新增 Paper Review 功能,用 AI 审阅技术与科学论文,目标是提升科学严谨性、正确性与可复现性。该功能由 @hemal 在数小时内以简单 skill 形式构建,因为 Prism 由 Codex 驱动。OpenAI 正为 Prism 招聘一名首席设计师。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 prism.openai.com 开放试用

    OpenAI 上线 prism.openai.com 并开放试用。帖子未披露该产品的具体功能、模型版本或定价信息,仅邀请用户前往体验并反馈意见。

4月7日周二
  1. 皮蛋漫游记AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nothing 产品负责人 Shawn:不做 AI 加法,做 AI Native?

    Nothing 手机与穿戴产品负责人 Shawn 在上海发布会后受访,称 Nothing 的 AI 路线是近未来(AI + 传统产品)与远未来(AI Native)双轨探索。