跳到正文

#编码

今日 31 条
8月7日周四
  1. OpenAI NewsAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-5 办公场景演示

    OpenAI 发布一段 GPT-5 工作场景演示,展示该模型分析用户反馈、制定产品计划并制作原型,以及总结后续步骤。演示面向办公与业务流程,具体能力细节以官方视频内容为准。

    为什么值得看

    OpenAI 官方展示 GPT-5 在真实工作流中的多步任务处理,可据此判断其在业务流程中的落地位置。

7月27日周日
  1. 牛油果烤面包AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛油果烤面包 #140:主播圆桌聊大模型如何改变生活与工作

    牛油果烤面包播客几位主播圆桌闲聊各自用 AI 工具的感受,覆盖文本润色、心理咨询、知识学习、图像生成、育儿辅助、编程辅助、播客与音视频制作、工作流自动化、AI Agent、多层次搜索与内容整合、AI 导游、旅行规划、写段子与小说创作等场景,也谈到 AI 的另一面。

7月14日周一
  1. METRAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:AI 时间跨度如何因任务领域而异?

    METR 分析 9 个现有 benchmark 发现,软件与推理类任务(GPQA、MATH、Mock AIME、METR-HRS、LiveCodeBench)的 50% 时间跨度在 50-200+ 分钟,每 2-6 个月翻倍;视觉电脑操作(OSWorld、WebArena)时间跨度短 40-100 倍但增速相近,特斯拉 FSD 自驾驶约每年翻倍 0.6 次。

7月10日周四
  1. METRAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 随机对照实验:AI 让资深开源开发者慢 19%

    METR 招募 16 名来自大型开源仓库的资深开发者,对 246 个真实 issue 随机分配是否允许使用 AI,结果允许用 AI 时完成任务耗时反而增加 19%,而开发者预期 AI 提速 24%,实际经历放慢后仍自认为提速 20%。

4月13日周日
  1. OpenAI NewsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 如何用 canvas 从 PRD 快速做出 HTML/React 原型

    OpenAI 展示如何用 ChatGPT 的 canvas 从产品需求文档(PRD)直接生成可运行的 HTML/React 原型。演示覆盖从需求文档到可交互原型的完整流程,帮助用户快速验证产品想法。

4月8日周二
  1. OpenAI NewsAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 如何把生成的代码送入 IDE

    ChatGPT 现在可以把生成的代码直接送入 IDE,以加速开发流程。官方展示了这一能力如何衔接生成与本地开发环节。

  2. OpenAI NewsAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 ChatGPT 中用 canvas 写作

    ChatGPT 的 canvas 功能可将笔记、转录文本和草稿打磨成完整文稿。OpenAI 展示了这一写作场景的实际用法。

3月25日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3-0324 发布:推理能力提升,改用 MIT 许可开源

    DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。

    为什么值得看

    官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。

1月23日周四
  1. Monica_IM(@hey_im_monica)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek R1 上线 Monica AI,Codeforces 得分 96.3%、支持 128K 上下文

    DeepSeek R1 已在 Monica AI 上线,官方称其在数学与编程任务上表现出色,Codeforces 得分 96.3%,支持 128K 上下文窗口,并展现出涌现推理能力。该模型被描述为可与 OpenAI 最新模型匹敌,现已通过 Monica AI 开放使用。

12月30日周一
  1. OnBoard!AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! EP 66 深度解读 Coding Agent 与 OpenAI o3:中美创业者、研究员与投资人的未来判断

    OnBoard! 第 66 期邀请 Replit Agent 核心成员、OpenHands 联合创始人、阿里通义实验室科学家与真格基金投资人,围绕 Coding Agent 与 OpenAI o3 展开三个多小时讨论。

7月11日周四
  1. OnBoard!AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! X 十字路口:哪些华人创办的 AI 产品正在"闷声赚大钱"?

    OnBoard! 与播客「十字路口」串台,盘点华人创办、分布在国内、硅谷、新加坡、日本等地的 AI 产品,包括 PictureThis、Speak、UMU、HeyGen、Opus Clip、Monica.im、Devin 等。

6月19日周三
  1. Arthur Mensch(@arthurmensch)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地 Codestral 实时生成 scikit-learn 与 Keras 医学影像预测代码

    本地运行的 Codestral 能实时生成 scikit-learn 和 Keras 代码,用于医学影像预测。该演示借助 Open Interpreter 新版本实现,这一工具让 LLM 在本地运行 Python、JavaScript、Shell 等代码,安装后执行 `interpreter --local` 即可在终端通过类 ChatGPT 界面调用本地 LLM。

2月29日周四
  1. Aman Sanger(@amanrsanger)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Copilot++ 发布:首个也是唯一能对代码给出编辑建议的 copilot

    Copilot++ 发布,号称是首个也是唯一能对你的代码给出编辑建议的 copilot。原文未披露模型参数、benchmark 分数或开放方式等细节,仅附有演示视频。 (说明:原文信息极简,除“首个也是唯一能给出代码编辑建议的 copilot”这一核心宣称外无其他可核验事实,故摘要按防幻觉规则保持简短,未补写任何原文未提及的功能、数字或可用性信息。)

6月11日周日
  1. Eugene YanAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Obsidian-Copilot:一款辅助写作与反思的助手

    Eugene Yan 构建了 Obsidian-Copilot 原型,可根据章节标题借助检索增强生成(RAG)起草段落,并帮助用户回顾过去一周日记、规划下周。其检索结合 OpenSearch 的 BM25 与语义检索,嵌入模型选用 e5-small-v2(384 维、最大序列长度 512),以 TypeScript 插件形式集成到 Obsidian,代码已开源。