跳到正文

#OpenAI

今日 69 条
2月6日周四
  1. Monica_IM(@hey_im_monica)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Monica AI 上线 o3-mini 模型,并为 DeepSeek R1 加入实时联网搜索

    Monica AI 新增 OpenAI 的 o3-mini 模型,STEM 任务速度提升 24%,同时为 DeepSeek R1 接入实时 Web 搜索并增强推理能力,用户可在 monica.im 直接体验。

1月14日周二
  1. 保持偏见AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 掌门人奥尔特曼:救世主还是打开"潘多拉"魔盒的人?

    这期播客回顾了 Sam Altman 从 Loopt 创业、29 岁出任投资公司总裁,到 2015 年参与创立 OpenAI 的历程,并讲述马斯克因"报仇"加入后又带着"蠢货"离开、微软投资 OpenAI、ChatGPT 发布以及 2023 年奥尔特曼被董事会开除、三天后回归的全过程。节目还科普了大模型原理,以及 ChatGPT 与 BERT 的路线之争。

12月30日周一
  1. OnBoard!AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! EP 66 深度解读 Coding Agent 与 OpenAI o3:中美创业者、研究员与投资人的未来判断

    OnBoard! 第 66 期邀请 Replit Agent 核心成员、OpenHands 联合创始人、阿里通义实验室科学家与真格基金投资人,围绕 Coding Agent 与 OpenAI o3 展开三个多小时讨论。

10月31日周四
  1. OpenAI NewsAI 评估 · 3/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 让 AI 为营销团队所用

    OpenAI 发布面向营销团队的 AI 应用指南,帮助营销人员把 AI 投入实际工作。内容围绕营销场景的落地用法展开,未披露具体模型版本或功能细节。

10月17日周四
  1. OpenAI NewsAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 OpenAI o1 模型解决复杂问题

    OpenAI 展示 o1 推理模型如何在编程、战略和研究等领域协助解决复杂问题。

10月11日周五
  1. OnBoard!AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! 播客:Google DeepMind 与 LLM 研究员深度解读 OpenAI o1 及 LLM+强化学习新范式

    OnBoard! 播客邀请 Google DeepMind、Google Cloud 及国内大模型一线研究员,深度解读 OpenAI o1 如何通过强化学习结合思维链(CoT)提升逻辑推理能力,并探讨 MCTS 在 LLM 推理中的作用、o1 能力来源与复现路径。

9月30日周一
  1. OpenAI NewsAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 如何用 AI 自动化并扩展财务运营

    OpenAI 发布文章,讲解如何将 AI 投入实际工作,以自动化并扩展财务运营。文章聚焦财务流程的自动化与规模化落地。

9月11日周三
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Geoffrey Hinton 等 110+ 家顶级 AI 公司员工与校友联名支持 SB 1047

    110 多名顶级 AI 公司的员工与校友联名发表公开信,支持被称为"全球最具争议 AI 法案"的 SB 1047,其中 30 多人来自反对该法案的公司。Geoffrey Hinton 表示已在这份名单上署名,并称这些签署者对 AI 未来走向的洞察胜过几乎所有人,他们的警告值得重视。

9月10日周二
  1. OpenAI NewsAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 分享数百次成功部署经验:如何让 AI 真正投入工作

    OpenAI 基于数百次成功部署经验,总结了让 AI 真正投入工作的方法。内容面向企业落地场景,但正文未披露具体模型、版本或部署数据。

8月26日周一
  1. OpenAI NewsAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-4o 微调网络研讨会

    OpenAI 发布 GPT-4o 微调网络研讨会。研讨会主题为 GPT-4o 的微调。

8月8日周四
  1. OpenAI NewsAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 分享员工如何用 ChatGPT Enterprise 做数据分析

    OpenAI 发布视频,展示了员工使用 ChatGPT Enterprise 高效分析数据、挖掘洞察的实际案例。内容聚焦企业内部的数据驱动工作方式,未披露新功能或版本信息。

4月12日周五
  1. Hamel HusainAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用对抗验证(Adversarial Validation)调试 AI 中的数据漂移

    Hamel Husain 介绍用对抗验证检测 AI 数据漂移:给两组数据集分别打 0/1 标签,训练二分类器,AUC 达到 0.60 以上即说明存在漂移,再用特征重要性定位根因。他还发布 CLI 工具 ft_drift,可检测两个多轮对话 jsonl 文件之间 prompt 模板和 token 层面的漂移。

11月22日周三
  1. Lilian Weng(@lilianweng)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 与 Sam Altman 达成原则性协议,其将回归担任 CEO

    OpenAI 宣布已与 Sam Altman 达成原则性协议,他将回归担任 CEO,并组建由 Bret Taylor(主席)、Larry Summers 和 Adam D'Angelo 组成的新初始董事会。OpenAI 表示正在协作敲定具体细节。

    为什么值得看

    OpenAI 高层动荡的关键节点,读者可据此了解 Sam Altman 回归与初期董事会构成。

7月7日周五
  1. Lilian Weng(@lilianweng)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 团队招募研究工程师,推进 AI 对齐的实践落地

    Lilian Weng 表示其团队正与 Superalignment 团队并行,从实践层面推进 AI 对齐,构建让 AI 能够安全部署的系统,并正在招募研究工程师与科学家加入。

7月6日周四
  1. Jan Leike(@janleike)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将 20% 算力投入超智能对齐研究

    OpenAI 提出新目标,要在未来 4 年内解决超智能对齐问题,并承诺把迄今为止 20% 的算力投入这一方向。Jan Leike 邀请研究者共同探讨如何最有效地使用这些算力来解决该问题。

5月10日周三
  1. Jan Leike(@janleike)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用 GPT-4 自动解释 LLM 神经元激活模式并打分

    OpenAI 提出自动化可解释性新方法:让 GPT-4 解释 LLM 中单个神经元的激活模式,并对这些解释进行评分。相关研究已发布于 OpenAI 官网。

4月16日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Raspberry-LLM:把 Raspberry Pico 变得更聪明一点

    开发者用 Raspberry Pico 加 e-ink 屏幕做了 raspberry-llm,通过调用第三方 LLM API 读取 WSJ 和 HackerNews RSS 内容并生成文本,最初用来做押韵时钟。

4月9日周日
  1. Eugene YanAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 LLM 做研究、反思与规划:LangChain + GPT 实践

    作者用 gpt-3.5-turbo 和 gpt-4 配合 LangChain、Pinecone 与 Discord 搭建了一套个人助理,实现 /summarize、/sql-agent、/search、/board 等工具,用于摘要、查询与提供建议。

3月19日周日
  1. Eugene YanAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-4、Claude 等 LLM 为我写传记:谁记得更准?

    为测试 LLM 的训练数据与表现,Eugene Yan 让 gpt-4、claude-v1.2、cohere-xlarge 等模型为自己写传记,结果 gpt3.5/4 整体表现最好,大意正确但细节多有错误。他指出不同模型在记忆与复述程度上差异明显,且这些模型无法联网,输出完全基于训练数据。

6月10日周五
  1. Lilian Weng(@lilianweng)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Lilian Weng 与 Greg Brockman 分享大规模神经网络训练技巧

    OpenAI 的 Lilian Weng 与 Greg Brockman 发布文章,介绍训练大型神经网络的技术,并称其可能比想象中更容易。两人同时表示 OpenAI 正在招聘。

6月11日周四
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton:外推 GPT-3 的表现,生命、宇宙及一切的答案约为 4.398 万亿参数

    Geoffrey Hinton 表示,将 GPT-3 的惊人表现外推到未来,生命、宇宙及一切的答案约为 4.398 万亿参数。该说法呼应《银河系漫游指南》中「42」的梗,以参数量作为终极答案的类比。

5月5日周日
  1. Lilian Weng — Lil’LogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面向 Sim2Real 迁移的域随机化(Domain Randomization)方法解析

    域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数(如质量、摩擦、阻尼、关节限位、动作延迟),让策略在多样环境中训练,从而迁移到真实世界。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI Robotics 用视觉与动力学 DR 让机械手完成连续旋转物体的 50 次连续随机目标朝向任务。文章还把 DR 的随机化参数学习视为一种双层优化问题。