跳到正文

#xAI

今日 23 条
7月24日周五
  1. xAI(@xai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Build 上线 Tavily 插件,为 LLM 驱动搜索提供支持

    Grok Build 现已支持 Tavily 插件,用于 LLM 驱动的搜索。该插件面向构建流程中的搜索能力,官方以「Try」邀请用户试用。

7月22日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 上手感获好评,成为重度用户第二常用模型

    Grok 4.5 使用体验获好评,Dan Shipper 称其已成为 Kieran Klaassen 第二常用的模型,并直言需要更新自己的认知。

7月21日周二
  1. Last Week in AIAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #252:GPT-5.6、Grok 4.5、Nemotron-Labs-Diffusion 与 AI 2040

    OpenAI 公开发布 GPT-5.6(含 Sol 与 Luna),并将桌面端 agentic 编程产品更名为 ChatGPT Work。SpaceX AI 推出低成本、Opus 级编程模型 Grok 4.5,Meta 发布 Muse Spark 1.1 并预览 Muse Video、上线 Muse Image。

  2. xAI(@xai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 将于 8 月 8 日在旧金山举办 SpaceXAI Grokathon

    xAI 面向湾区工程师开放 SpaceXAI Grokathon 报名,活动于 8 月 8 日(周六)在旧金山举行,申请截止时间为下周。报名入口为 x.ai/grokathon。

7月18日周六
  1. Windsurf(@windsurf_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Inkling 和 Grok 4.5 已在 Devin Desktop 和 CLI 上线

    Inkling 和 Grok 4.5 现已在 Devin Desktop 和 CLI 中可用。Cognition 同步上线 FrontierCode 排行榜,专门追踪哪些模型能写出真正可合并的代码,Grok 4.5 与 Inkling 等所有模型的分数均已公布,并附完整评测方法和示例任务。

7月16日周四
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sriram Krishnan:开源模型与配套框架正迎来高光时刻

    Sriram Krishnan 认为开源模型与配套框架正迎来高光时刻:如今可以凭借清晰的训练谱系追上接近 SOTA 的性能,如 thinkymachines 的 Inkling 今日发布。

  2. xAI(@xai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首

    Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。

  3. xAI(@xai)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 开放工程师 X 沟通渠道并提供漏洞赏金报告入口

    xAI 表示,用户可在 X 上直接联系其工程师,或通过 HackerOne 上的漏洞赏金项目提交问题,并附上 hackerone.com/x?type=team 链接。该帖未披露具体产品或版本信息。

  4. xAI(@xai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 回应隐私质疑:Grok Build 已删除留存编码数据,默认关闭数据保留

    xAI 就用户关于 Grok Build 隐私的疑问作出回应,称自发布以来一直完全遵守零数据留存(ZDR),所有用户始终可在 CLI 中禁用数据上传,禁用后该选择会被遵守。

7月14日周二
  1. Epoch AIAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 解读 AI 能耗:单次聊天机器人提问仅需约 0.6 Wh

    Epoch AI 估算,向免费聊天机器人发送 100 词提示词生成回复约耗 0.6 Wh 电,比微波炉运行 10 秒还少。AI 目前仅占美国年用电量的百分之几,低于空调(12%)和照明(8%),但数据中心电力需求大约每年翻一番。

7月9日周四
  1. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 xAI 的 Grok 4.5

    Poe 平台现已上线 Grok 4.5。据 Poe 介绍,这是 xAI 的最新旗舰模型,带来更强的推理、编码能力和改进的长上下文处理,面向复杂多步工作和智能体任务。用户可通过 poe.com/grok-4.5 试用。

  2. Sualeh Asif(@sualehasif996)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceXAI 发布 Grok 4.5,GDPval-AA v2 排名第四

    SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。

  3. Sualeh Asif(@sualehasif996)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sualeh Asif 称单智能体迭代中更偏好 Grok 4.5 而非 Opus

    Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。

  4. Sualeh Asif(@sualehasif996)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 联合训练 Grok 4.5,成为其最强大模型

    Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称其为迄今最强大的模型,也是首个不止面向软件工程打造的模型。有用户表示,在单智能体迭代场景下,Grok 4.5 是他个人首次更偏好于 Opus 的模型,速度快,能绕开看似棘手的障碍,直接且易沟通。

  5. Aman Sanger(@amanrsanger)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作训练 Grok 4.5

    Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称这是其迄今最强模型,也是首个面向软件工程以外领域打造的模型。Aman Sanger 表示该模型相比 composer 2.5 有巨大提升且完全从零训练,并期待后续模型。

6月22日周一
  1. Import AI — Jack ClarkAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛津等机构研究:AI 在说服力上超过专家人类

    牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。

6月16日周二
  1. Aman Sanger(@amanrsanger)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceX 行使选择权以全股票交易收购 Cursor

    SpaceX 宣布行使选择权,以全股票交易收购 Cursor,目标是打造全球最实用的 AI 模型。过去几个月 SpaceXAI 一直在与 Cursor 联合训练一个模型,即将在 Cursor 和 Grok Build 中发布。

6月12日周五
  1. 张小珺Jùn|商业访谈录AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    口述SpaceX开发史:前高管洪力德聊马斯克用人观、最大IPO与太空AI融合

    SpaceX前火箭首席制造工程师洪力德(Lewis Hong)讲述SpaceX开发史,并谈及马斯克的用人观与公司内部真实情况。节目还讨论了SpaceX收购整合x.AI并完成史上最大IPO,以及太空与AI加速融合的背景下,这是否成为人类文明扩张的前奏。

  2. 开始连接LinkStartAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    拆解 SpaceX IPO:荒漠创业、太空算力与马斯克的下一个万亿赌注

    极客公园播客「开始连接 LinkStart」本期拆解即将创下人类商业史上最大规模 IPO 的 SpaceX,嘉宾翟光龙认为支撑其超 1.7 万亿美元估值的核心叙事是「太空算力」。节目估算入轨成本需控制到 200 美元/公斤以内才算得过账,并指出近地轨道碎片超一亿个,天数天算可能是太空态势感知率先跑通的场景。

6月11日周四
  1. Epoch AIAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:最大 AI 数据中心算力每 7 个月翻倍

    Epoch AI 的数据显示,自 2024 年 8 月 SpaceXAI 的 Colossus 1 上线以来,按算力容量计算的最大 AI 数据中心纪录每 7 个月翻倍。

5月27日周三
  1. Last Week in AIAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Last Week in AI #341:马斯克诉 OpenAI 败诉、Google IO 更新 Gemini、OpenAI 解决 Erdős 问题

    马斯克对 OpenAI 和 Sam Altman 的 1500 亿美元诉讼败诉。Google 在 IO 2026 上更新 Gemini 应用,对标 ChatGPT 和 Claude。本期还收录 OpenAI 解决 Erdős 问题等内容。

5月26日周二
  1. Last Week in AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #246:Gemini 3.5 与 Omni、Musk 败诉、OpenAI 对阵 Erdős 问题

    Google I/O 发布 Gemini 3.5(重点推 3.5 Flash 的速度与基准成绩)、常驻智能体 Gemini Spark 和视频生成编辑模型 Gemini Omni。

5月19日周二
  1. Sualeh Asif(@sualehasif996)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作从头训练更大模型,总算力提升 10 倍

    Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。

5月6日周三
  1. 宝玉的分享AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 对话:Claude 为什么一直限速

    在 5 月 6 日的 Code with Claude 旧金山场,Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 同台对话,Dario 称公司原本按每年 10 倍准备算力,但 2026 年第一季度增速年化约 80 倍,这是 Claude 一直限速的直接原因,他直言 80 倍太疯狂、希望回落到 10 倍。

5月5日周二
  1. Last Week in AIAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Last Week in AI #340:OpenAI 对阵 Musk 与 Microsoft,DeepSeek v4 预览,Vision Banana

    Last Week in AI 第 340 期聚焦 OpenAI 与 Musk 诉讼首周进展,以及 OpenAI 化解 Microsoft 因 500 亿美元 Amazon 交易面临的法律风险。DeepSeek 预览新模型 v4,称其"缩小了与前沿模型的差距",本期还提及 Vision Banana。

5月2日周六
  1. Poe(@poe_platform)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok-4.3 已上线 Poe 平台

    Grok-4.3 已在 Poe 平台上线,用户可通过 poe.com/Grok-4.3 访问。该消息由 Poe 官方账号发布,提示用户可在各平台查看体验。

  2. Poe(@poe_platform)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.3 现已上线 Poe

    Grok 4.3 已在 Poe 上线,适合日常使用,不只是刷 benchmark 的模型,在真实场景中也能稳定发挥。Poe 表示在与 xAI 团队反馈后,新模型处理复杂任务尤其是工具调用方面有明显提升,且价格足够经济、可每天使用。

4月22日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceX 合作训练模型,Composer 3 及后续将用 10-100 倍算力

    Cursor 联合创始人 Sualeh Asif 宣布与 SpaceX 合作,在后者百万 H100 等效的 Colossus 训练超算上训练前沿模型,Composer 3 及后续模型的训练 flops 将是此前的 10-100 倍。

3月14日周六
  1. Poe(@poe_platform)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 的 Grok 4.20 Multi-Agent 上线 Poe,多智能体并行检索分析

    xAI 的 Grok 4.20 Multi-Agent 已在 Poe 上线,它不再由单一模型顺序处理任务,而是并行启动多个专用智能体进行搜索、分析和综合,几分钟内给出带引用的严谨答案。该功能已在 Poe 全平台应用和 Poe API 开放使用。

2月13日周五
  1. Nick St. Pierre(@nickfloats)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Imagine 多图编辑上线,未来 AI 将靠意图而非提示词

    Grok Imagine 新增多图编辑功能,可组合风格、角色与环境。有观点认为,未来这类工具将几乎不再需要文字提示词,AI 会直接理解用户意图并即时生成,交互以手势为主、动态为默认、玩法自发涌现。

2月6日周五
  1. Lex Fridman(@lexfridman)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 透露 Claude Opus 4.6 与 GPT Codex 5.3 今日发布,OpenClaw 播客即将上线

    Claude Opus 4.6 与 GPT Codex 5.3 于当日发布,OpenClaw 也在近期推出,Lex Fridman 预计 xAI/Grok 与 Google/Gemini 很快会跟进新版本。他透露将围绕 OpenClaw 与创作者 steipete 录制一期深度播客,并征集听众问题。他还计划下周前往旧金山湾区待一段时间,聚焦编程并参与工程团队工作。

1月30日周五
  1. METRAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前沿 AI 安全法规:加州 SB 53、纽约 RAISE Act、伊利诺伊 SB 315 与欧盟 AI Act 要点梳理

    METR 发布前沿 AI 安全法规参考文档,梳理加州 SB 53、纽约 RAISE Act、伊利诺伊 SB 315 及欧盟 AI Act 前沿 AI 部分对 OpenAI、Google、Anthropic、xAI 等开发者的安全与安保义务。

  2. METRAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布前沿 AI 安全法规指南:解读加州 SB 53、纽约 RAISE、伊利诺伊 SB 315 与欧盟 AI 法案

    METR 发布面向前沿 AI 实验室人员的合规参考,梳理加州 SB 53、纽约 RAISE 法案、伊利诺伊 SB 315 及欧盟 AI 法案中前沿 AI 部分的义务。

  3. METRAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前沿 AI 安全法规指南:加州 SB 53、欧盟《人工智能法》等对 OpenAI、Anthropic、Google、xAI 的要求

    METR 发布指南梳理前沿 AI 开发者已需遵守的安全法规,涵盖加州 SB 53、纽约 RAISE 法案、伊利诺伊州 SB 315 和欧盟《人工智能法》,适用对象为训练算力超 10^25 或 10^26 FLOPs 的模型开发者。

12月9日周二
  1. David Heinemeier HanssonAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    欧洲软弱又妄想(但并非注定如此)

    欧盟以"欺骗性设计"为由对 X 开出 1.2 亿欧元罚款,作者称这暴露了欧洲缺乏言论自由与科技竞争力。欧盟科技罚款收入在 2024 年超过其公共互联网科技公司缴纳的全部所得税,而欧盟 2025 年 GDP 为 20 万亿美元,美国以 30 万亿美元高出 50%。作者认为欧洲并非注定衰落,但需大幅降低能源成本、重启核能并改革移民政策留住人才。