跳到正文

#OpenAI

今日 69 条
4月6日周一
  1. 宝玉的分享AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 团队如何用自己的产品构建产品:整个 Spec 只有 10 个要点

    OpenAI Codex 产品负责人 Alexander Embiricos 与开发者体验负责人 Romain Huet 披露,Codex 团队几乎不写产品规格文档,即使写也只有 10 个要点左右。

4月5日周日
  1. Andrej Karpathy(@karpathy)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:Peter Steinberger 想把 PR 改叫 "prompt request"

    Andrej Karpathy 转述 Peter Steinberger 的说法:他希望把 PR 重新理解为 "prompt request",因为其智能体已能实现大多数想法。他认为没必要先把想法用免费版 ChatGPT 扩写成一团 vibe coded 的乱码再提交成 PR,而这已成为当前大多数 PR 的形态。

4月4日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编程智能体的六大组件:Claude Code、Codex CLI 等编码 harness 如何工作

    编程智能体是包裹 LLM 的应用层(agentic harness),负责仓库上下文、工具设计、prompt-cache 稳定性、记忆与长会话连续性。文章梳理出编码智能体的六大构建模块,并区分 LLM(引擎)、推理模型(增强引擎)与 agent(模型周围的控制循环)、coding harness 这几个概念。

4月2日周四
  1. Poe(@poe_platform)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi-K2.5-FW 在 Poe 上限时免费开放

    Kimi-K2.5-FW 现已在 Poe 上限时免费开放,Poe 官方强调这不是愚人节玩笑。该消息未披露免费截止时间、模型参数规模或开放地区等具体细节。

4月1日周三
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型解出三个 Erdős 问题,证明随模型改进更优雅

    Kevin Weil 引用 Mehtaab Sawhney 的推文称,一篇新论文解决了三个 Erdős 问题,每个解均由 OpenAI 内部模型找到,且证明简短优雅,论文见 arxiv.org/pdf/2603.29961。他表示不仅 AI 正在解决更多开放问题,随着模型改进其证明也变得更优雅。

  2. 宝玉的分享AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 总裁 Greg Brockman 谈砍掉 Sora、Super App、Spud 与 AGI 之路

    OpenAI 总裁 Greg Brockman 在 Big Technology Podcast 中证实下一代预训练基础模型 Spud 已完成预训练,凝聚约两年研究成果,同时将 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为统一 Super App,预计未来几个月内交付。

3月28日周六
  1. 宝玉的分享AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 联合创始人 Simon Last:我从去年夏天起就没写过一行代码了

    Notion 联合创始人 Simon Last 在 No Priors 播客访谈中称,他从 2025 年夏天起不再手写代码,工作方式转为设计端到端任务并管理编码 Agent。

3月27日周五
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul 用 ChatGPT + AlphaFold 为患癌爱犬设计个性化 mRNA 疫苗方案

    Paul 用 ChatGPT 结合 AlphaFold 为患癌的爱犬设计出一套个性化 mRNA 疫苗方案,被视为 AI 加速个性化医疗的一个缩影。Kevin Weil 借此呼吁,应让这套流程更容易被用于人类,而不只是狗。

3月26日周四
  1. Hamel HusainAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据科学家的复仇:Hamel Husain 谈 LLM 时代的五类评测陷阱

    Hamel Husain 在 PyAI Conf 的演讲《The Revenge of the Data Scientist》中提出,LLM 时代数据科学的基本功并未过时,他以五类常见评测陷阱说明缺失这些基本功的后果:直接用现成通用指标、未经验证的 LLM 评委、糟糕的实验设计、劣质数据与标注、过度自动化。

  2. 宝玉的分享AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在中国 AI 生态圈摸底两周,投资人看到了什么

    Delphi Ventures 创始合伙人 José Maria Macedo 在走访中国 AI 创始人、VC 和上市公司 CEO 两周后,表示自己更看好中国硬件、更看衰软件。

3月24日周二
  1. Junyang Lin(@JustinLin610)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    林俊旸点评 UNI-1:成绩不错,但更希望开源

    针对 William Shen 发布的 UNI-1,林俊旸表示"做得不错,如果能开源会更好"。据 William Shen 介绍,UNI-1 具备智能、可控、有文化感的特点,能力范围极广,团队正面对 Deepmind、OpenAI、Bytedance 等巨头的竞争,后续还将推出 API、技术报告和 model card。

3月21日周六
  1. Aman Sanger(@amanrsanger)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 的 Composer-2 以 Kimi k2.5 为基座并经 CPT 与 RL 训练

    Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。

3月18日周三
  1. Poe(@poe_platform)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 GPT-5.4-Nano 与 GPT-5.4-Mini 上线 Poe

    OpenAI 的 GPT-5.4-Nano 和 GPT-5.4-Mini 已在 Poe 上线。GPT-5.4-Nano 适合摘要转录、工单标注、内容改写、快速 RAG 问答和运行 @openclaw 流程等对延迟与成本敏感的高频任务;GPT-5.4-Mini 更擅长把杂乱邮件或笔记转成规范 JSON、修复函数、处理异常支持工单,以及需要规划、检查结果并推进下一步的智能体任务。

3月16日周一
  1. 宝玉的分享AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能体工程的 8 个等级

    Bassim Eledath 提出智能体工程从 Tab 补全、智能体 IDE 到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体直至自主智能体团队的 8 个等级路径。

3月10日周二
  1. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:大量通过 SWE-bench 的 PR 不会被合入主分支

    METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。

2月19日周四
  1. METRAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 复盘 AI-生物学 RCT:五项证据型 AI 政策教训

    一项招募 153 名新手、为期 8 周的 AI-生物学随机对照试验发现,LLM 虽在单个实验步骤上显示帮助,但在三项核心湿实验任务的整体成功率上没有显著提升,这一结果出乎多数专家预料。

2月18日周三
  1. Barsee 🐶(@heyBarsee)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Barsee 盘点 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等 11 项 AI 进展

    Barsee 汇总了近日 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等公司的 11 项 AI 进展,其中 SeeDance 2.0 热度持续攀升,用户可在一天内生成好莱坞级 AI 影片。

  2. Barsee 🐶(@heyBarsee)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI、Apple、Anthropic、OpenClaw、Kimi 等 AI 领域的 11 项最新进展盘点

    AI 领域近几天出现 11 项重要进展,涉及 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等。其中 SeeDance 2.0 热度持续攀升,用户能在一天内生成好莱坞级别的 AI 电影。

2月17日周二
  1. hidecloud(@hidecloud)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 澄清个人智能体模式并非基于 OpenClaw,复盘一年来的智能体信任设计

    Manus 联合创始人澄清,Manus 个人智能体模式完全基于自研架构,并非构建于 OpenClaw 之上,但仍需向 OpenClaw 项目致意,因其进一步试验并塑造了用户与智能体之间的"安全边界"。

2月13日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 对比测试:Claude Code 与 Codex 测量时间跨度不比默认脚手架更好

    METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。

2月12日周四
  1. Lex Fridman(@lexfridman)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 对话 OpenClaw 创作者 Peter Steinberger:GitHub 星标超 18 万

    Lex Fridman 与 OpenClaw 创作者 Peter Steinberger 展开对话,这款开源 AI 智能体在 GitHub 上已获得超过 18 万 stars。节目还谈及 OpenClaw 的爆红原因、自我修改式 AI 智能体、安全顾虑、GPT Codex 5.3 与 Claude Opus 4.6 的编程对比,以及 OpenAI 和 Meta 的收购意向。

2月9日周一
  1. Nick St. Pierre(@nickfloats)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nick St. Pierre 调侃 AI 怀疑论者:从「fuck AI」到被 OpenAI 机器人清洁队雇佣

    Nick St. Pierre 用一条时间线调侃 AI 怀疑论者(Doomers):2023 至 2026 年他们坚持「fuck AI」,2029 年改口称「显然已经停滞」,2030 年自称「其实我一直谨慎乐观」,2031 年则受雇于 OpenAI,负责管理机器人清洁车队。

2月6日周五
  1. Lex Fridman(@lexfridman)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 透露 Claude Opus 4.6 与 GPT Codex 5.3 今日发布,OpenClaw 播客即将上线

    Claude Opus 4.6 与 GPT Codex 5.3 于当日发布,OpenClaw 也在近期推出,Lex Fridman 预计 xAI/Grok 与 Google/Gemini 很快会跟进新版本。他透露将围绕 OpenClaw 与创作者 steipete 录制一期深度播客,并征集听众问题。他还计划下周前往旧金山湾区待一段时间,聚焦编程并参与工程团队工作。

2月5日周四
  1. David Heinemeier HanssonAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DHH 实测 OpenClaw 智能体零 MCP 配置完成注册与协作任务

    David Heinemeier Hansson 分享用 OpenClaw 给 AI 分配独立机器、长期记忆和持续执行能力的实验,他在 Proxmox 虚拟机上隔离部署智能体 Kef,未安装任何技能、MCP 或 API 接入,仅凭一条提示词就让其自行在 hey.com 注册邮箱、完成 Fizzy 注册并创建看板卡片,随后通过邮件邀请加入 Basecamp 并在聊天室打招呼。

1月30日周五
  1. METRAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前沿 AI 安全法规:加州 SB 53、纽约 RAISE Act、伊利诺伊 SB 315 与欧盟 AI Act 要点梳理

    METR 发布前沿 AI 安全法规参考文档,梳理加州 SB 53、纽约 RAISE Act、伊利诺伊 SB 315 及欧盟 AI Act 前沿 AI 部分对 OpenAI、Google、Anthropic、xAI 等开发者的安全与安保义务。

  2. METRAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布前沿 AI 安全法规指南:解读加州 SB 53、纽约 RAISE、伊利诺伊 SB 315 与欧盟 AI 法案

    METR 发布面向前沿 AI 实验室人员的合规参考,梳理加州 SB 53、纽约 RAISE 法案、伊利诺伊 SB 315 及欧盟 AI 法案中前沿 AI 部分的义务。

  3. METRAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前沿 AI 安全法规指南:加州 SB 53、欧盟《人工智能法》等对 OpenAI、Anthropic、Google、xAI 的要求

    METR 发布指南梳理前沿 AI 开发者已需遵守的安全法规,涵盖加州 SB 53、纽约 RAISE 法案、伊利诺伊州 SB 315 和欧盟《人工智能法》,适用对象为训练算力超 10^25 或 10^26 FLOPs 的模型开发者。

1月24日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 推理提升的推理时扩展方法分类:从 Chain-of-Thought 到验证器

    推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。

1月23日周五
  1. OpenAI NewsAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小团队如何用 ChatGPT 做数据分析、营销与决策

    OpenAI 发布小团队使用 ChatGPT 的实践指南,覆盖数据分析、营销素材制作、预算管理、会议组织和决策支持等场景。内容为操作方法层面的指引,未披露新模型、版本号或性能数据。

1月22日周四
  1. METRAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布监控能力评估原型 SHUSHCAST 的早期结果

    METR 公布监控能力评估原型 SHUSHCAST 的早期结果,测试监控器能否发现 AI 智能体秘密执行副任务。GPT-5 作为智能体时,获取推理轨迹使监控器捕获率提升超 50 个百分点,而 Claude Sonnet 4.5 效果小得多,部分原因可能是其推理轨迹经过摘要处理。该工作与 OpenAI 合作完成,任务集规模小、缺乏智能体与监控器诱导是主要局限。

1月21日周三
  1. Jan Leike(@janleike)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike:2025 年模型对齐程度显著提升,Anthropic、GDM 与 OpenAI 自动审计发现的不对齐行为比例均在下降

    Jan Leike 指出,2025 年模型对齐程度大幅提升,自动审计发现的不对齐行为比例不仅在 Anthropic 下降,在 GDM 和 OpenAI 也同样走低。

1月15日周四
  1. OpenAI NewsAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布构建 AI 智能体实用指南

    OpenAI 发布《构建 AI 智能体实用指南》,覆盖用例、模型选择、工具设计、护栏机制与多智能体模式,面向智能体的设计、编排与部署全流程。

  2. OpenAI NewsAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT-5 系列模型构建应用:实用指南

    OpenAI 发布面向初创企业的 GPT-5 系列模型实用指南,讲解如何迁移到 Responses API、设计 Agent、调优提示词、引导 GPT-5 模型并构建可靠的 AI 工作流。

  3. OpenAI NewsAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5 如何驱动真实企业工作流:一份面向团队的评估指南

    GPT-5 被用于营销、工程、财务、战略、法律和 IT 等真实业务工作流,OpenAI 发布了一份简明指南,说明其如何支撑这些流程,并介绍团队应如何评估它。

  4. OpenAI NewsAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 如何用 Codex 加速工程研发

    OpenAI 详解内部团队如何使用 Codex 理解代码、重构系统并提升性能与研发速度,同时优化工程工作流。文章覆盖了从代码理解到重构、性能改进和工程效率提升等多个具体场景。

1月14日周三
  1. Citrini ResearchAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research 宏观备忘录:美国经济 Running Hot,AI 生产率盖过裁员影响

    Citrini Research 宏观备忘录判断美国经济正在重新加速:2025 年最担忧的关税与就业并未拖垮整体,Q2、Q3 实际 GDP 分别年化增长 3.8% 和 4.3%,Atlanta Fed 的 GDPNow 模型预测 Q4 增速达 5.1%。

1月7日周三
  1. David Heinemeier HanssonAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DHH:AI 智能体值得"升职",但 90% 代码由 AI 写仍是吹嘘

    DHH 认为 AI 智能体已从辅助工具升级为可自主产出生产级代码的团队成员,Claude Opus 4.5、Codex 5、Gemini 3、MiniMax M2.1、GLM-4.7 等模型配合终端工具已能自主运行测试、搜索文档。

1月2日周五
  1. hidecloud(@hidecloud)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 一提示词写出 200 页书,ChatGPT 与 Gemini 均受阻

    一项对比测试显示,Manus 能一次提示词并行生成整本 200 页书籍,耗时 20 分钟;ChatGPT 虽能完美写出大纲,但只能逐章生成、需手动复制粘贴 10 次。Gemini 则在第 1 章受阻,因限制无法写出单章 5k 字内容。测试者认为这体现了消费级聊天机器人与 AI 智能体体验的差异。

12月30日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 的 2025:进展、问题与预测

    2025 年 LLM 发展由推理模型主导,DeepSeek R1 证明推理行为可通过强化学习培养,并以开放权重达到当时顶级专有模型水平。其采用的 RLVR 与 GRPO 成为年度核心训练方法,此后各主要厂商纷纷推出推理变体;DeepSeek V3 的 671B 参数训练成本估算约 500 万美元,R1 在其之上再训约 29.4 万美元。

  2. hidecloud(@hidecloud)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 8 个月做到 1 亿美元 ARR,被 Meta 收购

    Manus 在 8 个月内实现 1 亿美元 ARR,并被 Meta 收购。作者回忆 OpenAI 发布 Agent Mode 当天,Manus 在活动舞台上用实时演示对比自家智能体与 OpenAI 的发布,并称 Manus 的智能体胜出;他认为凭借更强的智能体架构和上下文工程,应用公司也能跑赢前沿实验室。