跳到正文

#OpenAI

今日 69 条
10月9日周五
  1. TechcrunchAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三名被解雇的OpenAI安全研究员反驳指控,警告寒蝉效应

    三名被解雇的OpenAI安全研究员公开反驳有关其不当处理敏感信息的指控。他们在公开信中指出,这些解雇事件正在对公司的AI安全文化产生寒蝉效应。

  2. OpenRouter(@OpenRouterAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 上线 GPT-6.1 Sol Ultrafast

    OpenRouter 宣布 Sol Ultrafast 已在其平台上线。引用 OpenAI Developers 的信息,Ultrafast 今日起在 API、Codex 和 ChatGPT Work 中面向 GPT-6.1 Sol 推出,速度最高可达 Sol Standard 的 8 倍。

  3. The Rundown AI(@TheRundownAI)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三名被 OpenAI 解雇的安全研究员致信安全委员会:OpenAI 无法独自保障 AI 安全

    三名上周被 OpenAI 解雇的安全研究员向公司安全委员会发出一封题为“OpenAI cannot make AI safe on its own”的公开信。OpenAI 称他们不当处理了机密信息,其中 Mikita Balesni 表示他们被解雇是因为把安全置于公司短期利益之上,信中称此次解雇让前同事不敢发声。

  4. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam 谈决策模型在 harness 中的定位,以及如何在 LangChain 中使用 Jev

    LangChain 的 Sam Crowder 在 First Pass 对话中讨论了决策模型在 harness 中的定位,以及如何在 LangChain 中使用 Jev。Jev 由 typesafeai 推出后引发广泛关注,随后 OpenAI 和 Databricks 分别发布了 Decisions API 和 ai_decide 函数。

  5. OpenAI Developers(@OpenAIDevs)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 Codex 与 ChatGPT Work 开放 GPT-6.1 Sol 超高速模式

    OpenAI 在 Codex 和 ChatGPT Work 中开放 GPT-6.1 Sol 的 Ultrafast 模式,覆盖 Pro 500、符合条件的按用量计费 Enterprise 和基于积分的 Edu 套餐,Enterprise 管理员需手动开启。

  6. OpenAI Developers(@OpenAIDevs)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公布 GPT-6.1 Sol Ultrafast 模式 API 定价

    OpenAI Developers 公布 GPT-6.1 Sol 在 Ultrafast 模式下的 API 定价:每百万输入 token 12 美元,每百万输出 token 60 美元。该模式面向对速度和智能都有要求的场景,包括排查线上故障、智能体操作应用以及分秒必争的实时体验。

  7. OpenAI Developers(@OpenAIDevs)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式

    OpenAI Developers 宣布 Ultrafast 今天起在 API、Codex 和 ChatGPT Work 中面向 GPT-6.1 Sol 上线。官方称其具备接近 Astra 级别的智能水平,速度最高可达 Sol Standard 的 8 倍。

  8. 投资融资AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 榜单平台 Arena 完成 2 亿美元 B 轮,估值 10 个月内接近翻倍至 31 亿美元

    AI 模型众包评测平台 Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等参投。

  9. TechcrunchAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    报道称 OpenAI 营收比此前预期少 200 亿美元

    据新报道,OpenAI 的年化营收比此前预期少 200 亿美元。此前有报道称该 AI 实验室的年化营收约为 700 亿美元。

  10. a16z(@a16z)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS CEO Matt Garman 谈为何不担心 AI 泡沫:没有单一客户占据 AWS 产能

    AWS CEO Matt Garman 表示不担心 AI 泡沫,理由是 AWS 产能采取多元化策略、没有单一客户占据主导,且企业客户已在当前能力与成本下看到正向 ROI。他透露 AWS 2026 年 CapEx 达 220 亿美元(原文为 $220B),已订购 200 万块 NVIDIA GPU,自研 AI 芯片卖到明年,并推出 30 秒开通、无需信用卡的 AWS 账户以便智能体快速启动。

  11. TechcrunchAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的数学证明未达该领域标准

    OpenAI 生成的大量数学证明偏离了其咨询的数学研究者小组制定的规范。这些研究者曾受邀为该前沿实验室提供指导。

  12. 国际大厂AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 高管亲述:计算机操作进展与 Decisions API 诞生过程

    OpenAI 计算机操作产品工程负责人 Ari Weinstein 与 API 产品负责人 Nikunj Handa 在播客中回顾开发者日发布,Ari 称过去一年最关键的进步是智能体能排查错误、重试并组合截图、无障碍信息、页面结构与 Playwright、自行编写代码来操作软件。

  13. LangChain BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 用 Stripe Link 与 Managed Deep Agents 构建可付款的 Restock 智能体

    LangChain 发布样例项目 Restock,一个运行在 Slack、基于 Managed Deep Agents 的办公用品智能体,可搜索商品、组建购物车并通过 Stripe 的消费者钱包 Link 付款。

  14. Aravind Srinivas(@AravSrinivas)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Computer 为 OpenAI 数学手稿的 722 篇预印本生成讲解视频

    Perplexity Computer 为 OpenAI 数学手稿发布中的全部 722 篇预印本生成了讲解视频,总时长 93 小时,并整理成 YouTube 播放列表(722.video)。用户可在 722.video 观看这些视频,官方还说明了 Computer 完成该任务的方式。

  15. 国际大厂AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    错过 AI 早期红利后,Lightspeed 重塑自身,如今有望靠 Anthropic 收获回报

    Lightspeed Venture Partners 曾错过 OpenAI、ElevenLabs 和 Hugging Face 等 AI 公司,2023 年 4 月联合负责人 Ravi Mhatre 与 Bejul Somaia 要求全球合伙人清空日程,开了一场长达七小时的会议反思如何应对 AI 浪潮。如今该机构有望凭借对 Anthropic 的投资获得回报。

  16. 国际大厂AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok Bot 接入 Claude Opus 5.5

    10月7日马斯克在X上宣布,Grok Bot 将根据具体任务选用最合适的后端模型,并点名 Claude Opus 5.5、Midjourney 和 Suno,标准是哪个最可能带来最好结果就用哪个。

  17. myFT followingAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 年化收入较此前披露低 200 亿美元

    OpenAI 近期向投资者表示,9 月年化收入接近 500 亿美元,远低于此前广泛报道的 700 亿美元,两者相差约 200 亿美元。

  18. Fireworks AI(@FireworksAI_HQ)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Zeta Global 发布 Athena Inference Model(AIM),基于 Fireworks 与 NVIDIA Nemotron 构建

    Zeta Global 发布 Athena Inference Model(AIM),与 Fireworks AI 合作、使用 NVIDIA Nemotron 开发。同期推出企业智能操作系统 AthenaOS 和 Athena MCP,首日即集成 ChatGPT、Claude、Palantir 和 Gemini,并宣布与合作伙伴以轻资本方式推进专用芯片的早期工作。

  19. 技术前沿AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Goodfire 推出“由内而外”的 AI 智能体监控器,成本仅为传统方案零头

    Goodfire 发布了一种“由内而外”的监控方案,直接读取 AI 模型工作时的内部激活信号,而非让第二个模型逐字审阅输出。在 Kimi K3 上测试约 1500 个会话,成本约 51 美元,而廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获了 94% 的恶意黑客会话,并将 8.7% 的无害会话送二审,同时运行四个探针给模型响应启动时间增加不到 2%。

  20. 歸藏(guizang.ai)(@op7418)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 读取 Memory 后用 Blender 模型生成 3D 海报

    GPT-6 Astra 读取用户的 Memory 后,按个人喜好用 Blender 建模的几个模型做出一张海报,模型的细节、材质、光影都处理得很好。该演示展示了它在 3D 方向的表现。

  21. OpenAI NewsAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Oracle 如何用 ChatGPT 与 Codex 将数天工作压缩到几分钟

    Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本数天的工作压缩到几分钟。

  22. DeepLearning.AI(@DeepLearningAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本周 AI 快讯:Gemini 4 Argon 追平 GPT-6 Astra,Mistral Large 4 将开源

    Google Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上以 53 分追平 GPT-6 Astra,单任务成本约为后者 60%。

  23. 大模型智能AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向所有 ChatGPT 用户开放 GPT-6,并推出 Intelligent UI

    OpenAI 宣布面向全球所有 ChatGPT 用户(含免费和付费用户)推出 GPT-6,取代 ChatGPT 中的 GPT-5.6 Sol 和 GPT-5.6 Luna,但通过 Codex 和 ChatGPT Work 访问这两款模型的用户仍使用之前发布的版本。

    为什么值得看

    OpenAI 将 GPT-6 开放给免费用户并引入可自主生成交互界面的 Intelligent UI,读者可据此了解这一交互形态的变化。

10月8日周四
  1. The Rundown AI(@TheRundownAI)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    人类数学协会就 OpenAI 722 篇论文发布声明,呼吁数学家停止与其合作

    人类数学协会就 OpenAI 发布的 722 篇论文发表声明,称数学家并未要求开展这项工作,并呼吁数学家停止与 OpenAI 合作。菲尔兹奖得主 Terence Tao 以客座文章形式在其博客转发该声明,X 上随后将其当作 Tao 本人的表态传播。OpenAI 已撤回其中 3 篇论文,另有 14 篇在发布后被修订;其发布说明中曾表示部分未形式化的结果可能存在问题,会尽快修复。

  2. Lovable(@lovable_dev)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 提示词:构建一个可对话的日历应用,用 GPT-6 Astra 调用工具管理 Google Calendar

    Lovable 分享了一段可直接使用的提示词,用于构建一个可对话的日历应用:左侧聊天面板、右侧 Google Calendar 周视图,通过 Google OAuth 连接并读写事件。聊天由 GPT-6 Astra 驱动,通过 tool calling 列出、创建、更新、删除事件并查找空闲时间,删除前需确认。设计保持简洁,配色继承 Google Calendar。

  3. Philipp Schmid(@_philschmid)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SynthID Detector 公开上线,支持 Nano Banana 2.1 与 OpenAI、NVIDIA、Kakao 内容核验

    SynthID Detector(synthid.com)现已公开上线,可核验图片、视频或音频是否由 AI 生成。用户上传或粘贴文件后,网站会扫描来自 Google 及其合作伙伴的水印,文件在扫描后立即删除。该工具支持 Nano Banana 2.1、OpenAI、NVIDIA、Kakao,Apple 也将很快加入。

  4. 笔记侠AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊搜索广告成员:AI 正把购物从流量为王推向意图为王,亚马逊已上线 7 款 AI 购物功能

    前亚马逊搜索广告成员在笔记侠 PPE 课程美国站分享中指出,AI 正让购物从"流量为王"转向"意图为王":消费者不必先想好搜索词,只需描述需求,购物研究、比较、决策逐步由 AI 接手,消费者从决策者变成推荐的批准者。

  5. 投资融资AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cal AI 创始人 Zach Yadegari 为其 AI 智能体新公司 Persona 融资 1000 万美元

    Cal AI 联合创始人 Zach Yadegari 创立 AI 智能体公司 Persona,已完成由 Vine Ventures 领投的 1000 万美元融资。

  6. OpenAI NewsAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pollo AI 借助 OpenAI 将创意转化为广告大片

    Pollo AI 结合 GPT-5.6、GPT-6 Astra 与 GPT-Image-2.5,帮助创作者把创意转化为细节丰富的图像和电影级视频广告。

  7. OpenAI NewsAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LegalOn 将 Codex 成本减半并保持开发速度

    LegalOn 将每日 Codex 预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。

  8. LangChain BlogAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Deep Agents 重构 Skills 支持:工具绑定、技能固定与热重载

    LangChain 为 Deep Agents 重构 Skills 支持,新增三项能力:绑定到技能的工具只在 agent 读取该技能后加载;用户显式请求(如输入 /meeting-prep)时可将技能固定,在下一次模型调用前载入指令;长会话线程无需重启即可拾取新增或变更的技能。

  9. 多知AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为青少年版 ChatGPT 推出大学申请规划工具

    OpenAI 宣布在青少年版 ChatGPT 中加入大学申请规划工具,并推出记忆卡片、测验等学习功能。学生输入目标大学后,ChatGPT 会把申请要求、截止日期、待办任务和助学金申请步骤整理成一份计划,该功能第一阶段面向美国 10 至 12 年级计划申请四年制大学的高中生。OpenAI 还将在未来三年支持波士顿儿童医院数字健康实验室及其学生顾问委员会,让青少年参与 AI 产品测试与设计。

  10. Z FinanceAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度|对话框不是 Personal Agent 的终局:Eazo 让图形界面属于每个人

    Eazo 提出对话框并非 Personal Agent 终局:复杂意图先用自然语言表达,需求稳定后沉淀为可点击、可保存、可分享的 Personal Software。

  11. 极客公园AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 Today AI 十天:国产个人 AI 助手能做什么、卡在哪

    作者用十天体验 Teambition 创始人齐俊元打造的 Today AI,其国内版于 9 月 24 日上线,已接入飞书、钉钉、腾讯文档和邮箱;绑定微信后可直接在微信里发语音、图片和文件与它交互。

  12. 十字路口CrossingAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谢扬团队的 Eazo:用图形界面 App 驱动的 Personal Agent,押注另一种形态

    谢扬团队的 Eazo 将 Personal Agent 做成"图形界面 App 驱动"形态:用户描述需求,它直接生成带界面和数据的完整 App,背后由 Qoni 提供 Agent 身份、行动和长期记忆。Eazo 已在国内手机端和 PC 端可用且数据互通,内置多款 SOTA 模型可按任务切换,官方称测试中约 30 分钟即可生成一个较完整的 App。

  13. AI科技大本营AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    奥特曼《名利场》专访:证实 OpenAI 曾单方面叫停前沿模型训练

    在《名利场》专访中,OpenAI 首席执行官 Sam Altman 证实公司近期主动叫停了一项前沿模型训练任务,原因是能力跃升速度超过了安全对齐、可监控性与可解释性的进展。

  14. 51CTO技术栈AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI总裁布罗克曼:别急着做全自动Agent,先亲手做5遍再自动化

    OpenAI联合创始人、总裁格雷格·布罗克曼在Silicon Valley Girl访谈中建议,开发者接入AI工作流前应先亲手把流程做3到5遍,摸清脏数据、例外情况和权限边界后再自动化。他称模型写软件的能力已超过他认识的几乎所有人,自己已不再逐行写代码,而是给AI目标、反馈和约束。他还预判未来1到2年将出现一轮大规模创业复兴,前提是人必须保留控制权并承担责任,目标应当来自人。

  15. Latent Space [Youtube]AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日 Sonnet 5.5 缓存读取价格减半并推出订阅 API 额度。

    为什么值得看

    汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗代价,读者可据此判断小型模型在智能体工作流中的实际位置。

  16. 掘金本周最热AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    程序员 Codex 提问急救卡:7 个常用模板与组合写法

    作者整理了一套面向 Codex 的提问模板卡,覆盖修 Bug、加改功能、优化代码、改已有功能、还原设计稿、修启动构建问题和对接接口 7 个场景。每个模板给出可直接复制替换的提示词,明确任务边界、处理要求与完成即停止等约束,并说明同一需求涉及多项工作时可使用通用组合模板。

  17. 硅星人ProAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 为何越来越不说人话:从 Coding 过拟合到文言文式压缩

    开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。