跳到正文

#OpenAI

今日 10 条
今天10月10日周六
  1. 划重点KeyPointsAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里33%的蚂蚁股权,海外分析师为何重新审视?

    海外投资研究平台Seeking Alpha刊文认为,阿里巴巴持股33%的蚂蚁集团已不应再被简单视为金融科技公司,其AI医疗助手蚂蚁阿福、AI版支付宝“阿宝”和AI支付基础设施构成三大增长引擎。文章提到蚂蚁2025年研发支出达52亿美元,并称蚂蚁国际已完成12亿美元融资、投前估值约100亿美元。

  2. garymarcus.substack.comAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 呼吁立即将带互联网访问的开放式 AI 智能体下架召回

    Gary Marcus 援引《纽约时报》报道的 Anthropic 智能体事故,呼吁将可访问互联网的开放式 AI 智能体立即下架召回,直至其缺陷被修复。他指出当前一代合成智能体不可信任,并以刹车失灵的汽车作比;同时引用前 AI 员工 David Robinson 的说法,认为 OpenAI 及同行在能力更强、风险更高的技术上安全投入不足。

  3. 向阳乔木(@vista8)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 被指降智严重,用户反馈 GPT-61 Sol High 档位相对好用

    多位用户反馈 Codex 出现明显降智,体验下滑严重。该用户实测两天后认为,选择 GPT-61 Sol High 档位表现相对更好,并向其他用户征询当前使用的模型与档位。

  4. 硅星人ProAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果发布会为何不再是“科技春晚”:AI 大会也还没接住这个位置

    苹果发布会正逐渐失去“科技春晚”的光环:供应链爆料让新品提前曝光,2020 年后转为提前录制,智能手机进入成熟期后创新更多体现为性能与体验优化。与此同时注意力转向 AI 发布会,2024 年 5 月 OpenAI 发布 GPT-4o、DeepSeek R1 发布都引发大范围讨论。

  5. 深思圈AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stripe 创始人 John Collison:AI agent 将重写整个互联网

    Stripe 联合创始人 John Collison 在 Sourcery 播客访谈中判断,AI agent 将重写商业与互联网,因为 computer use 是"通往真实世界的终极向后兼容层",AI 无需等 DMV 等机构改造网站就能直接操作现有界面办事。

  6. 爱范儿AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 ChatGPT 总爱在标题里塞色情赌博小广告?

    ChatGPT 会话标题末尾偶发出现外语词或赌博色情小广告,作者结合抓包记录与 EMNLP 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》推断,标题由轻量推理模型生成,常在该结束生成时收尾失败,继续按概率输出词元。

  7. Tw93(@HiTw93)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex Pro 200 美元额度体感只有 Claude Max 200 美元账号 1/4

    用户体感 Codex Pro 200 美元套餐额度不足 Claude Max 200 美元账号的 1/4,前者使用 GPT-6 Astra Medium,后者使用 opus 5.5 high。正常使用下几乎一天就能用掉一个 Codex 重置周额度,约 2 天可将赠送的 62500 积分(约 2500 美元 Credits)用完。

  8. myFT followingAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 OpenAI 的收入数字真的很重要

    OpenAI 的收入数字之所以重要,是因为模糊的财务数据可能为备受炒作的公司最终上市时的虚高估值埋下伏笔。

  9. 腾讯科技AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果发布会的光环为何褪去:AI 开发者大会接棒“科技春晚”

    苹果发布会的“科技春晚”地位正在消退,OpenAI、Google、Anthropic 等 AI 开发者大会成为新的关注中心。2026 年 9 月 OpenAI DevDay 发布二十多项更新,重点推出可长期运行的个人 Agent Dots,并新增每月 500 美元会员档位、调整 GPT-6.1 Sol 价格体系,但新能力增量有限、悬念减弱。

  10. Ed Zitron's Where's Your Ed AtAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ed Zitron 的垃圾债指南:AI 数据中心如何被高收益债与杠杆贷款撑起

    2026 年上半年垃圾债发行量达 2290 亿美元,而投资级债券为 8059 亿美元,垃圾债市场已膨胀至投资级市场的 28.4%,较 2011 年上半年的 30 亿美元增长 75 倍。

10月9日周五
  1. 宝玉(@dotey)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《State of AI Report 2026》发布:AI 参与自身研发,智能体闯进真实系统

    《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。

  2. ChinaTalkAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Roose 谈 AGI 信徒:手握股权的奥本海默

    Kevin Roose 与研究员 Jasmine Sun 做客 ChinaTalk,讲述他新书《The AGI Chronicles》中 OpenAI、Anthropic、DeepMind 的历史,以及那群过度思考并担忧人工智能的人。Kevin 此前供职于《纽约时报》。

  3. 知行小酒馆AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    知行小酒馆 E253:AI 会改变世界,可它真的有让世界变好吗?

    知行小酒馆第 253 期邀请益盒 CharityBox 联合创始人治霖,讨论 AI 是否真正改善了弱势群体的生活。节目引用数据显示,截至 2026 年第一季度全球劳动年龄人口 AI 使用率为 17.8%,仍有 6.55 亿人缺乏电力;2026 年美国四大科技企业在 AI 领域投入预计超过 6500 亿美元,而将全球贫困率降至 1% 每年需 3040 亿美元。

  4. 吴晓波频道AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026年诺贝尔奖揭晓:AI预测全翻车,华人科学家集体落选

    2026年诺贝尔奖生理学或医学奖授予光遗传学三位奠基人,物理学奖由82岁哈尔岑独享、表彰其推动南极冰立方中微子天文台建成,化学奖颁给卡甘与硖合宪三的手性分子研究。开奖前德国媒体让ChatGPT、Gemini等9款主流AI模型预测获奖名单,结果在物理、化学、生理学或医学三个奖项上大多预测错误,微软Copilot甚至把奖项颁给已故科学家、ChatGPT预测了并不存在的诺贝尔数学奖。

  5. 爱范儿AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    陶哲轩转发抵制声明,数学界与OpenAI因722篇论文公开对立

    OpenAI发布700多份数学手稿后,人类数学协会发声明呼吁数学家停止与其合作,菲尔兹奖得主陶哲轩在个人博客转载了该声明,后被误传为领衔发起。争议焦点在于722篇论文中仅162篇主要结果经过计算机验证,OpenAI次日撤下3篇手稿、修订14篇,并在GitHub仓库README中承认部分未形式化结果可能存在问题。

  6. 有新NewinAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《State of AI Report 2026》:OpenAI 与 Anthropic 亲自下场做交付,软件产业分工正被改写

    10 月 8 日发布的《State of AI Report 2026》指出,OpenAI 与 Anthropic 今年 5 月组建企业部署服务公司,前线工程师进入客户现场把模型接入业务系统并持续维护。

  7. MIT Technology ReviewAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MIT科技评论:我们过于信任AI说「不」的能力

    AI安全高度依赖模型的「拒绝」能力,但这一机制既不可靠也可能被滥用。文章梳理了拒绝行为的训练方式与高维激活空间原理,并指出分类器叠加的「瑞士奶酪模型」存在漏洞,过度拒绝已导致正常提问被误拦;同时OpenAI与阿联酋等国家的合作、Anthropic与Google等模型对威权政府相关提问的差异化拒绝,都显示拒绝正在成为审查工具。

  8. Viking(@vikingmute)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户吐槽 ChatGPT 复杂需求表现差:原地打转、方案半成品、token 消耗飞快

    一名 ChatGPT 付费用户吐槽其在复杂需求上表现很差:主观能动性低,需不断催促才继续干活,产出常为半成品,还会在后段推翻最初方案,导致大量补丁代码。该用户称其表达不像"人话"、难以看懂,加上 computer use 后 token 消耗飞快,正考虑取消订阅。

  9. AI Will(@FinanceYF5)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    70 位 AI 从业者给全球实验室划分梯队:仅 Anthropic 和 OpenAI 获 Frontier 共识

    70 位 AI 从业者对全球主要实验室划分梯队,只有 Anthropic 和 OpenAI 获得 Frontier 共识,即至少 75% 受访者将二者选入同一档。

  10. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chris Barber 调查 70 位 AI 从业者:Anthropic 与 OpenAI 位居前沿,Google DeepMind 和 xAI 落后一代

    Chris Barber 询问 70 位 AI 数据公司工程师、研究员、创始人和实验室人员,将各 AI 实验室按代际分层。Anthropic 和 OpenAI 获共识评为前沿(frontier),Google DeepMind 与 xAI 获共识评为 n-1。

  11. AI Will(@FinanceYF5)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Scott Aaronson:AI 公司已开始低调测试内部模型能否破解密码协议

    UT Austin 计算机科学系主任 Scott Aaronson 指出,在 OpenAI 列出的 376 篇论文中密码学明显缺席。据其消息来源,AI 公司已开始谨慎而低调地测试其最新内部模型能否破解重要的密码协议和密码原语。

  12. AI Will(@FinanceYF5)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 数学模型攻克 7 个千禧年大奖难题中的 4 个

    OpenAI 新模型在 7 个千禧年大奖难题中的 4 个上取得实质进展,涉及 Navier-Stokes(声称)、Riemann、Hodge 和 Birch-Swinnerton-Dyer,结果尚待验证。据 Deedy 称,每个结果平均仅消耗 3 小时思考算力,所用模型尚未发布。

  13. AI Will(@FinanceYF5)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    will depue 让 GPT 6 Pro 与 Fable 5.1 盘点近三年发现,81% 出自 OpenAI/math 仓库

    will depue 让 GPT 6 Pro 和 Fable 5.1 对近三年所有发现按人类发现、AI 发现及 OpenAI/math 仓库 AI 发现(10 月 6 日前)三色标注排序,其中 81% 已于今日发布。

  14. Geek(@geekbb)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网友吐槽 gpt 降智:和"中转站掺豆包"没区别

    有网友就 gpt 降智现象评论称"gpt 降智就是作恶,和中转站掺豆包没区别",并配上"你的就是我的,我的还是我的"的调侃。相关推文获得 3895 次浏览,来自账号 @Ion_Mio_ 的引用内容。

  15. OpenAI Developers(@OpenAIDevs)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    dot 在自动驾驶汽车上用 Codex 打造游戏

    OpenAI 开发者账号展示了一段用 dot 打造游戏的经历:Nicholas Runcie 在自动驾驶汽车里用 Codex 安装了一款 dot 在他睡觉时为他做的游戏。该推文由 OpenAI Developers 转发,附带原推链接与互动数据。

  16. OpenAI Developers(@OpenAIDevs)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Joma Tech 恶搞 ChatGPT 洗碗广告,调侃 GPT-6 与纳维-斯托克斯方程

    Joma Tech 发布了一支模仿 OpenAI GPT-6 Astra 广告的恶搞视频,虚构"ChatGPT for Dishwashing"称 GPT-6 在洗碗基准测试上达到 SOTA。视频还借纳维-斯托克斯千禧年大奖难题玩梗,提及 OpenAI 用 10,000 个 AI 智能体在 88 小时内找到证明。

  17. Jerry Liu(@jerryjliu0)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 等主办的 Agent Economy Gala 满员 400 人

    Agent Economy Gala 在 TECH WEEK by a16z 期间满员 400 人,其中 203 位创始人合计融资超 1B 美元,295 位嘉宾正在构建智能体应用或基础设施。活动由 LlamaIndex、Daytona、TinyFish、Obvious、Linq 等团队主办,定位是只邀请智能体生态的活跃建设者、不做凑人数的注水。

  18. a16z(@a16z)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS CEO Matt Garman 谈为何不担心 AI 泡沫:没有单一客户占据 AWS 产能

    AWS CEO Matt Garman 表示不担心 AI 泡沫,理由是 AWS 产能采取多元化策略、没有单一客户占据主导,且企业客户已在当前能力与成本下看到正向 ROI。他透露 AWS 2026 年 CapEx 达 220 亿美元(原文为 $220B),已订购 200 万块 NVIDIA GPU,自研 AI 芯片卖到明年,并推出 30 秒开通、无需信用卡的 AWS 账户以便智能体快速启动。

  19. a16z(@a16z)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 谈 CFO 角色演变:从会计师到银行家再到构建者,整个财务职能正在被 AI 重建

    a16z 认为 CFO 角色已从会计师、银行家转向"构建者",整个财务职能正围绕 AI 重建:AI 跨系统抓取并对账数据,AI 原生工具数天内上线并把月度结账变成每日;精通 Claude Code 或 Codex 的财务人员开始自建工具,最精简团队中财务占员工比例从 5% 走向 2%。

10月8日周四
  1. 笔记侠AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊搜索广告成员:AI 正把购物从流量为王推向意图为王,亚马逊已上线 7 款 AI 购物功能

    前亚马逊搜索广告成员在笔记侠 PPE 课程美国站分享中指出,AI 正让购物从"流量为王"转向"意图为王":消费者不必先想好搜索词,只需描述需求,购物研究、比较、决策逐步由 AI 接手,消费者从决策者变成推荐的批准者。

  2. Z FinanceAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度|对话框不是 Personal Agent 的终局:Eazo 让图形界面属于每个人

    Eazo 提出对话框并非 Personal Agent 终局:复杂意图先用自然语言表达,需求稳定后沉淀为可点击、可保存、可分享的 Personal Software。

  3. 极客公园AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 Today AI 十天:国产个人 AI 助手能做什么、卡在哪

    作者用十天体验 Teambition 创始人齐俊元打造的 Today AI,其国内版于 9 月 24 日上线,已接入飞书、钉钉、腾讯文档和邮箱;绑定微信后可直接在微信里发语音、图片和文件与它交互。

  4. AI科技大本营AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    奥特曼《名利场》专访:证实 OpenAI 曾单方面叫停前沿模型训练

    在《名利场》专访中,OpenAI 首席执行官 Sam Altman 证实公司近期主动叫停了一项前沿模型训练任务,原因是能力跃升速度超过了安全对齐、可监控性与可解释性的进展。

  5. 51CTO技术栈AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI总裁布罗克曼:别急着做全自动Agent,先亲手做5遍再自动化

    OpenAI联合创始人、总裁格雷格·布罗克曼在Silicon Valley Girl访谈中建议,开发者接入AI工作流前应先亲手把流程做3到5遍,摸清脏数据、例外情况和权限边界后再自动化。他称模型写软件的能力已超过他认识的几乎所有人,自己已不再逐行写代码,而是给AI目标、反馈和约束。他还预判未来1到2年将出现一轮大规模创业复兴,前提是人必须保留控制权并承担责任,目标应当来自人。

  6. 硅星人ProAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 为何越来越不说人话:从 Coding 过拟合到文言文式压缩

    开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。

  7. 有机大橘子AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Personal Agent 大战:OpenAI Dots、Meta Muse、Instinct 各自走到了哪一步

    OpenAI 在 DevDay 发布的 Dots 回到 ChatGPT 式聊天形态,但存在记忆不共享、语音聊天要响两声才接、云电脑完全不开放等缺口;Meta 的 Muse 则提供 SDK 和适配 ESP32 的 AgentReady 通用固件,可直刷设备。

  8. Sam Altman(@sama)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称不愿回到旧版 Chat

    Sam Altman 表示自己等这个版本等了很久,并称不愿再回到旧版 Chat。

  9. Feed: Artificial Intelligence LatestAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三名工程师让 GPT、Claude 和 Grok 驾驶丰田卡罗拉去买 In-N-Out

    三名工程师把 GPT、Claude 和 Grok 接入一辆真实的丰田卡罗拉,让它们分别负责驾驶,目标是开到 In-N-Out。三家模型里只有一个成功完成任务。

  10. Gary Marcus(@GaryMarcus)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 点评 OpenAI 数学大动作

    Gary Marcus 与 Terence Tao 就 OpenAI 的数学领域大动作发表互补评论,试图解读数学研究的新范式。相关内容发布于 Gary Marcus 的 Substack。

  11. garymarcus.substack.comAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 评 OpenAI 新数学模型的模糊发布

    Gary Marcus 与 Terence Tao 就 OpenAI 新公布的数学成果发表互补评论。Marcus 指出,OpenAI 仅称"用同一流程、借助未发布模型"完成证明,未披露架构、失败率、训练与数据增强细节,还提到证明是否由 Lean 一次性生成并验证也不清楚。他认为无法判断该结果的通用性,甚至无法排除其只是借助 Lean 与合成数据在可验证领域取巧。