跳到正文

#编码

今日 29 条
9月7日周一
  1. The IntelliJ IDEA BlogAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Java Annotated Monthly 2026 年 9 月刊:JDK 27 发布与 AI 专题

    JDK 27 正式发布,包含九个 JEP,默认启用的紧凑对象头(JEP 534)将对象头从 96 位压缩到 64 位,堆占用降低 10%–20%、吞吐量提升 5%–10%,G1 也成为所有环境下的默认垃圾回收器(JEP 523)。

  2. Genspark(@genspark_ai)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Muse Spark 1.3,覆盖 AI Chat、Code Agent 与 Claw

    Genspark 宣布 Muse Spark 1.3 已在其平台上线,覆盖 AI Chat、Code Agent 和 Claw。该模型被描述为 Meta 面向智能体时代的最强模型,在内部对比中比 Muse Spark 1.2 减少约 20% 工具调用和约 25% token 消耗。

  3. 浮之静AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    围绕 AI 反馈闭环的技术栈选型:pnpm v12、TypeScript v7 与 Agent Skills 组合

    作者 lencx 介绍了自己新项目采用的围绕 AI 反馈闭环的技术栈,包括 pnpm v12、TypeScript v7、Vite v8、Oxlint、Oxfmt、React 与基于 StyleX 的 Astryx,目标是缩短 AI agent 从修改代码到获得有效反馈的周期。

  4. 卫诗婕|商业漫谈Jane's talkAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    脉脉 CEO 林凡聊全球 AI 人才动向与大模型季报:明年科技公司只招 AI 人才?

    脉脉创始人兼 CEO 林凡走访 OpenAI、Anthropic、Google、Meta 后判断,AI 岗位需求已连续两年同比 10 倍增长,非 AI 岗位普遍缩招。他提出 AI 人才分基座技术、应用开发、业务效能三类,核心门槛是让 agent 自主运行超过 1 小时。企业内部 AI 落地需开放文档库、代码库等数据,OpenAI 用 9 个月完成全员 AI 覆盖。

  5. Suhail(@Suhail)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail 分享 cleanbranch Skill:从改动中提取最小功能分支

    Suhail 分享了一个名为 cleanbranch 的 Skill,用于创建只包含必要功能改动的分支,可通过 /cleanbranch、$cleanbranch 或相关请求触发。

9月6日周日
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:别让编码智能体自主跑数小时,人类判断与频繁验证才是关键

    吴恩达指出,让编码智能体长时间自主运行既昂贵又往往低效。他总结顶尖 AI 从业者的真实工作流:依靠娴熟的人类判断、高度迭代的规划和频繁的输出验证,开发者应学会引导智能体工作流、校准其自主程度并建立稳健的测试机制,把时间花在架构与规格撰写而非逐行写代码上。

  2. 42章经AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型

    Mind Lab 研究员逯雨鑫以个人开发者身份,用约两周时间、一张 5090 显卡和数百美元成本(含 200 美元的 Claude Max Plan)后训练出两个登顶 Hugging Face Model Trending 榜的模型,把 agentic 场景的 benchmark 从底座模型的 15 分提升到 55-60 分。

9月5日周六
  1. 向阳乔木推荐看AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 X 跳槽 OpenAI 的赵迪:马斯克是"最大的混蛋"但依然敬佩

    在 X 工作近 7 年的 ML Infra 工程师赵迪已加入 OpenAI,他称马斯克是"the biggest asshole"但仍然敬佩,认为马斯克裁员、按第一性原理做事能让人做到不可能的事。他自研的 Rust 推理引擎 Navi 曾将 X 推理性能提升一个数量级,为平台省下几百万美元。他还表示 OpenAI 内部 Codex 使用量年初至今增长 8 到 10 倍,亚太地区涨幅达 12 倍。

  2. Augment Code(@augmentcode)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 上线 Cosmos,长程编码与多步智能体能力大幅提升

    OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。

  3. Windsurf(@windsurf_ai)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 现已登陆 Devin Desktop 与 Devin CLI

    GPT-6 Astra 已在 Devin Desktop 和 Devin CLI 上线。在 FrontierCode 1.1 上,Astra 的成绩与 Fable 5 相差 0.4 分以内,成本却低 64%,并在内部测试基准上刷新 SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Batch 本周亮点:编程智能体技能、OpenAI 与 Anthropic 企业数据留存政策、GLM-5.3-Flash 等开放权重模型

    DeepLearning.AI 的 The Batch 本周汇总多条动态:OpenAI 与 Anthropic 公布新的企业数据留存政策,Zai 发布高性价比开放权重多模态系统 GLM-5.3-Flash,Thomson Reuters 推出 397B 参数、专为法律金融新闻工作训练的模型。Andrew Ng 则解释使用编程智能体需要一套自己的基础技能。

  5. Satya Nadella(@satyanadella)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 分享 GitHub AI 相关新内容

    Satya Nadella 在推文中分享了一个 GitHub 官方博客链接,指向 github.blog 的 AI and ML 板块内容,并附上"Try it out"邀请读者试用。推文未透露具体产品、模型或功能名称。

  6. Satya Nadella(@satyanadella)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 推出 HydraFusion:从模型选择走向模型编排

    GitHub Copilot 引入 HydraFusion,通过多模型协同完成规划、构建、批评与补全等编码任务,最高可降低 67% 成本。Satya Nadella 称其体现了异构模型生态的价值,标志着行业从模型选择转向模型编排,并推动成本与成果边界的持续优化。

9月4日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 发布 AI Engineering Skills Map,梳理高效使用 AI 编程智能体的关键技能

    Andrew Ng 发布 AI Engineering Skills Map,用于指导如何高效使用 AI 编程智能体。该技能图谱聚焦使用编程智能体所需的最重要技能,完整内容以 X 文章形式发布。

  2. 向阳乔木推荐看AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 七个项目实测:网页、游戏与 PPT 表现如何

    作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。

  3. 阮一峰的网络日志AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    科技爱好者周刊(第 411 期):OpenClaw 2.0 是一个缩影

    OpenClaw 发布 2.0 版,共有 933 位贡献者、合并 16000 个 PR,作者据此判断这些 PR 几乎都未经代码审查、由 AI 直接合并,并再次建议不要在办公电脑上运行它。文章还提到 SolidJS 创始人 Ryan Carniato 感叹 AI 推动技术栈向 React、Rust 等主流方案迁移,担忧软件生态走向单一化。

  4. andrew chen(@andrewchen)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 一周内在 Unreal Engine 构建曼哈顿世界

    GPT-6 Astra 用一周时间在 Unreal Engine 中构建出一座曼哈顿城市场景,并能逐条街道精细打磨每个细节。这条演示由 Matt Shumer 发布,被评论者称为「GTA7 is gonna be sick」。

9月3日周四
  1. 快手技术AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harness Engineering:快手电商用 AI 流水线重塑研发范式

    快手电商商家与运营赋能中心构建了覆盖需求、Spec、Dev、Test、Oncall 全生命周期的自动化交付流水线(Harness Engineering),目标需求吞吐率提升 30%、平均交付时长下降 40%。

  2. DeeplearningAIAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro-0813 正式发布,同步开源 agent harness

    DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。

  3. Genspark(@genspark_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini-3.8-Flash 上线 Genspark,覆盖 AI Chat、Code Agent 与 Claw

    Gemini-3.8-Flash 已在 Genspark 上线,接入 AI Chat、Code Agent 和 Claw。Google 同步推出 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个变体,称其为迄今最强的推理与编码模型,并借助长时运行的智能体循环,在 3.7 Flash 发布三周后继续迭代。

  4. Varun Mohan(@_mohansolo)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Varun Mohan 回应 Theo:关于 harness 与订阅开放的争论

    Varun Mohan 公开回应 Theo 的评论,称其部分说法不实,要求对方了解实际情况并修改帖子澄清。他提到团队正在讨论把 harness 和订阅开放到其他界面,但需谨慎,因为这会带来新的滥用途径。

  5. 歸藏的AI工具箱AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    歸藏开源 Yingzao·营造 Skill,把旅行废片做成建筑海报

    歸藏开源了 Skill「Yingzao·营造」(github.com/op7418/guizang-yingzao-skill),可将旅行照片重排为带字体设计和文化信息的海报。

  6. bolt.new(@boltdotnew)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    bolt.new 教你用一句提示词为应用生成 Open Graph 图和 favicon

    bolt.new 官方演示:只需对 bolt.new 说“为这个网站生成 Open Graph 图像和 favicon 并加入项目”,即可让分享链接在短信、私信和帖子中显示自定义图片,之后重新发布(Republish)即可生效。

  7. Paul Couvert(@itsPaulAi)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 推出免费模式:自动选择最优模型,无需为 token 成本纠结

    Replit 上线免费模式(Free Mode),用户可在不担心 token 成本的情况下持续迭代并原地构建。构建过程中 Replit 会自动为任务挑选最合适的模型,避免为简单任务多付费用。作者认为 token 成本下降、模型变强、人人都能自动化构建,成本效益型模型比前沿模型更值得看好。

  8. Suhail(@Suhail)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Proximal 发布 FrontierSWE v2 超长程编程基准,Claude Fable 5.1 大幅领先

    Proximal 发布超长程编程基准 FrontierSWE v2,新版本扩展了任务集并改进评测方法。各前沿模型在该基准上存在明显性能差距,Claude Fable 5.1 以较大优势领先。

  9. Cursor(@cursor_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 公布 CursorBench 完整评测结果

    Cursor 发布 CursorBench 完整评测结果,详情见 cursor.com/cursorbench。官方未在推文中披露具体模型版本、分数或价格等信息。

  10. Poe(@poe_platform)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 上线 Poe,1M token 上下文支持编程与智能体

    Google 的 Gemini 3.8 Flash 已在 Poe 上线,主打快速、低成本,面向编程和智能体场景,可在 Flash 速度下提供较强推理能力。该模型支持 1M token 上下文窗口、网页搜索和可调节的思考等级。

  11. Google DeepMind(@GoogleDeepMind)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 模型在 CyberGym 等基准测试中自主发现漏洞并给出 2.6 倍有效修复

    Google DeepMind 的模型在 CyberGym 等基准测试中领先,能自主发现软件弱点,同时保持快速高效。在 Google Chrome 代码库的真实测试中,它产出的有效修复数量是此前的 2.6 倍,帮助更快保护软件。

  12. Demis Hassabis(@demishassabis)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 发布,新增 3.8 Flash Cyber 推进网络安全前沿

    Gemini 3.8 Flash 发布,这是 Gemini 在不到一个月内的又一次升级,也是 6 周内第 3 个更新的 Flash 模型,智能体与编程能力再度提升。同时推出的 Gemini 3.8 Flash Cyber 面向网络安全防御前沿。更多模型与网络安全工作细节见官方博客。

  13. Google DeepMind BlogAI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,称前者在软件工程、智能体任务和多步推理上有明显提升,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    为什么值得看

    官方披露了两款新模型的基准表现、定价与访问渠道,可用于对比 Flash 系列在编码与网络安全能力上的迭代节奏。

  14. AI SDK(@aisdk)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 支持使用 Gemini 3.8 Flash

    AI SDK 宣布支持使用 Gemini 3.8 Flash。Google 发布 Gemini 3.8,称其为目前推理与编码能力最强的模型,并基于 3.7 Flash 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个新变体,依托长时间运行的智能体循环构建。

  15. Firecrawl(@firecrawl_dev)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 开发者索引以 63.1% 平均分领跑仓库检索评测,Docs 赛道无人突破 50%

    Firecrawl 的 Developer Index 在仓库检索评测中以 63.1% 平均分位居整体第一,拿下 issues/PRs 和 docs 两个赛道。原生网页搜索在查找仓库上表现良好,达 80.7%,但 docs 是最难的赛道,没有系统超过 50%,Developer Index 以 47.2% 领先该赛道。

  16. Sundar Pichai(@sundarpichai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 3.8 Flash 模型,六周内第三次 Flash 更新

    Google 发布新 3.8 Flash 模型,这是六周内的第三次 Flash 发布。官方称其在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,在 DeepSWE v1.1 上能以更低成本自主端到端解决复杂工程问题,表现超过多数更大的前沿模型。

9月2日周三
  1. Paul Couvert(@itsPaulAi)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber

    Google 发布 Gemini 3.8,称其为目前最强的推理与编码模型,并推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,依托长时运行的智能体循环。

  2. Patrick Loeber(@patloeber)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash,智能体与编码能力较 3.7 Flash 提升

    Google 发布 Gemini 3.8 Flash,在智能体与编码能力上较 3.7 Flash 有显著提升,且价格与 3.7 Flash 保持一致。

  3. Google Gemini App(@GeminiApp)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 上线,面向 Pro 和 Ultra 用户开放

    Google 最新 Gemini 3.8 Flash 模型今日起面向 Pro 和 Ultra 用户开放。该模型主打更可靠、更全面的回答,可处理日常话题的实用建议,以及文本分析、复杂编程等深度任务。

  4. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash,称智能体与编码能力再进一步

    Google 发布 Gemini 3.8 Flash,官方称其在智能体与编码能力上又有提升。这是 Gemini 在六周内第三次更新 Flash 模型。

  5. Google DeepMind(@GoogleDeepMind)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款模型

    Google DeepMind 发布两款新 Gemini 模型。Gemini 3.8 Flash 官方称为目前最智能的模型,在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升;Gemini 3.8 Flash Cyber 面向网络安全,具备前沿水平的漏洞检测与自动修复能力。

  6. Martin Fowler(@martinfowler)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Rachel's Ramblings:也许我们不该审查这么多代码

    Martin Fowler 分享 Rachel 的文章提出,问题或许不在于 AI 破坏了代码审查,而在于我们一直用代码审查去解决错误的问题。

  7. 得物技术AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    得物小摊 AI Native 演进实录:用 Harness 构建可控 AI 交付

    得物小摊从 0 到 1 孵化中由一人同时负责 H5、运营后台、Node 网关和 Go 服务,AI 并行参与多模块后,作者把重点从写 Prompt 转向 Delivery Harness,用 Version Contract、Execution Boundary、Evidence Gate、Repair Loop 四个组件接管交付状态。