跳到正文

#编码

今日 29 条
9月24日周四
  1. Amjad Masad(@amasad)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Muse 现可在 Replit 上构建应用

    Muse 现在可以在 Replit 上构建应用。该消息由 Amjad Masad 发布,未披露模型版本、参数规模或可用范围等细节。

  2. Viking(@vikingmute)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者吐槽 6 sol 写新功能引入大量 regression,改用 5.6 sol

    有开发者吐槽 6 sol 表现差:让它写一个新 feature,结果引入一堆 regression,e2e 测试大量失败,改半天速度还慢,现在直接改用 5.6 sol,感觉比它好多了。

  3. Eric Jing(@ericjing_ai)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线编码智能体 GenCode,称能力对标 Claude Code 和 Codex 且成本低至 1/10

    Genspark 在 Super App 内上线编码智能体 GenCode,支持 Claude、GPT、DeepSeek 或开源权重模型,同一个账号即可使用且无需配置 API key。作者称其能力与 Claude Code、Codex 相当,开源权重方案的成本为后者的 1/10 到 1/20,并强调模型由用户按任务自行选择,而不是由智能体代为指定。

  4. Guillermo Rauch(@rauchg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ShellPerfBench:Opus 5.5 找到了其他模型漏掉的 shell 启动优化

    Guillermo Rauch 发布 ShellPerfBench,用于衡量新 shell 会话的启动时间。他表示 Opus 5.5 找到了许多其他模型漏掉的优化点,并建议用户让智能体去优化 .zshrc 等配置文件。

  5. 山行AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究:Claude Code 中真正拉开差距的是领域专长

    Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。

  6. Tw93(@HiTw93)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 上手体验:从 fabel 5.1 切换过来,能力接近但更便宜更快

    Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。

  7. GitHub(@github)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 深潜:如何让百万行、数百条评论的 pull request 像普通评审一样轻松

    GitHub 发布工程实践深潜,探讨如何让百万行规模、附带数百条评论的 pull request 变得像普通代码评审一样易于处理。该内容以 github.blog 工程博客形式发布,聚焦超大型 PR 的评审体验问题。

  8. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 应用如何让 2200 文件、100 万行改动的 PR 依然流畅可审

    GitHub Copilot 应用重建了 pull request 视图,让包含 2200 个文件、超 100 万行改动和 400 多条行内评论的超大 PR 也能快速流畅地审查。GitHub 称这一极端 diff 场景在该视图下不再卡顿。

  9. Replit ⠕(@Replit)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 发起 Hacking the 7:35 位创作者在纽约 7 号线地铁上从想法到上线应用

    Replit 在纽约 7 号线上发起 "Hacking the 7" 活动,邀请 35 位创作者挑战在列车抵达终点站前,用 Replit 完成从想法到应用上线。活动全程横跨整条 7 号线,创作灵感来自沿途流动的城市景观,完整视频已发布在 YouTube。

  10. Genspark(@genspark_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GenCode 支持一键迁移现有配置,免去重头搭建

    Genspark 推出 GenCode,可读取你现有的配置,一键把 instructions、rules 和 memory 迁移过来,并提供多种模型可选,无需重新教一遍。官方称"配置税"就此消失。

  11. bolt.new(@boltdotnew)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt Forge 一周数据:GLM 5.3 Flash 与 DeepSeek V4.1 Flash 两款模型承接 80% 提示词

    Bolt Forge 开放模型上线一周,两款 Flash 模型承接了 80% 的提示词,其中 GLM 5.3 Flash 占 63%,DeepSeek V4.1 Flash 占 17%。尽管选择器中可直接选用更大的模型,构建者仍持续选择快速模型。Bolt 同步提供 $9/月 的 lite 订阅(bolt.new/lite)。

  12. AI Breakfast(@AiBreakfast)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 一夜一次性生成完整冒险游戏 Epicurious

    Opus 5.5 被用户称为用过最有趣的模型,它一夜之间一次性生成了一款名为 Epicurious 的完整冒险游戏,体量庞大,通关预计需要 20 小时。该游戏为完整的电脑游戏形态。

  13. Genspark(@genspark_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 GenCode 编程智能体:Claude、GPT、DeepSeek 与开源权重任选

    Genspark Super App 内上线编程智能体 GenCode,同一账号可选 Claude、GPT、DeepSeek 或开源权重模型,无需配置 API key,按任务自行选择模型,开源权重成本仅为 1/10 至 1/20。

9月23日周三
  1. Cursor(@cursor_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 通过提示词收紧与缓存优化将 token 成本降低 7%,智能体质量不降

    Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更紧凑的提示词、选择性工具加载、更好的缓存以及压缩文件读取。

  2. Anton Osika – eu/acc(@antonosika)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika:采访途中任何人用 AI 都能随手做出应用

    Anton Osika 称任何人都能在任何地方构建应用,@siliconvalleymm 就在采访进行到一半时和他一起做出了一个应用。该内容由 xgo.ing 提供支持,原帖获 89 个点赞、16 条回复、8 次转发,浏览量 26950。

  3. 卡尔的AI沃茨AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo V2.6:Pro、Flash、Pro-UltraSpeed 三个版本发布

    小米发布 MiMo V2.6 系列,包含 Pro、Flash 和 Pro-UltraSpeed 三个版本,其中 UltraSpeed 输出速度最高可达 Pro 的 20 倍。

  4. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  5. 阿里技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布《AI Native 研发范式实践手册》,提出企业级 Agent 基础设施三大缺口

    阿里巴巴在云栖大会发布《AI Native 研发范式实践手册》,从 AIDC 数字投手、千问用增 Agent、万有无界三个业务案例提炼出环境与验证驱动、平台能力升级、提效度量、数字员工、组织配套五个共性挑战。

  6. Genspark(@genspark_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 上线 Genspark,覆盖 AI Chat、Code Agent 与 Claw

    SpaceXAI 的 Grok 4.7 已在 Genspark 上线,可用于 AI Chat、Code Agent 和 Claw,价格与速度与 Grok 4.6 保持一致。官方称其在困难任务上能工作更久、更仔细地检查结果,并配备迄今最强的安全防护。

  7. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Podcast 回应三大热门争议:AI 生成代码该不该审查、RAG 是否过时、Skills 是否让 MCP 淘汰

    GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。

  8. cat(@_catwu)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人用 Opus 5.5 结合 Lean 形式化验证 Claude Agent SDK

    Boris Cherny 表示自己用 Opus 5.5 对 Claude Agent SDK 做形式化验证,仅用几个简短提示词就产生 16 个 PR,修复多个 bug 和竞态条件。

  9. 数字生命卡兹克AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5、GPT-6 Sol 与 Luna 同日发布

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。

    为什么值得看

    同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。

  10. Guillermo Rauch(@rauchg)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 评测:Opus 5.5、GPT 6 Sol、Fable 5.1 并列 97%,Grok 4.7 得分 94% 但便宜 2-7 倍

    最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。

  11. Greg Brockman(@gdb)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,定位更快、更实惠,覆盖专业工作、事实性、编码、电脑操作和对齐等能力。OpenAI 同时优化了缓存和推理效率,并将节省直接传递给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 Sol 和 Luna 两款更快更便宜的模型,API 价格比 GPT-5.6 促销价低 50%,可据此判断成本结构变化。

  12. Sam Altman(@sama)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:GPT-6 Sol 与 Luna 在智能、对齐、代码等能力上大幅超越 5.6 系列,价格减半

    Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。

  13. Lovable(@lovable_dev)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 如何用 GPT-6 Sol 等模型构建:模型路由与选型思路

    Lovable 披露其模型选型流程:每周测试新模型并调优,再决定路由方式,以保证构建效果最佳。文中提到 Lovable 现已支持 Fable 5.1,并附上官方博客对其模型理念的完整说明。

  14. Lovable(@lovable_dev)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 现已接入 GPT-6 Sol,0-to-1 构建基准全面超越 GPT-5.6 Sol

    Lovable 现已支持使用 GPT-6 Sol 构建应用。在其 0-to-1 构建基准上,GPT-6 Sol 在每个 effort level 下得分比 GPT-5.6 Sol 高 6% 至 12%,其中意图对齐(理解需求)提升 10% 至 15%,设计基础能力提升 8% 至 10%。

  15. Windsurf(@windsurf_ai)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 现已登陆 Devin Desktop 和 Devin CLI

    Claude Opus 5.5 现可在 Devin Desktop 和 Devin CLI 中使用。在 FrontierCode 1.1 上,Opus 5.5 以远低于 Fable 5 的成本拿下第一。

  16. Cognition(@cognition_labs)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 在 FrontierCode 1.1 以 65.3% 登顶 Extended 榜

    Opus 5.5 在 Cognition 的 FrontierCode 1.1 基准上取得 Extended 65.3% 的成绩,超越 Fable 5 登顶,且成本仅为后者的一小部分。该基准针对真实工程任务,评估代码的可合并性与质量。

  17. Cognition(@cognition_labs)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 上线 Devin,在 FrontierCode 1.1 登顶

    Claude Opus 5.5 现已在 Devin 中可用。在 FrontierCode 1.1 上,Opus 5.5 从 Fable 5 手中拿下第一,且成本仅为其一小部分。

  18. GitHub(@github)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 在 GitHub Copilot 正式可用

    Anthropic 的 Claude Opus 5.5 已在 GitHub Copilot 中正式可用。GitHub 称早期测试显示它在效率上表现突出,任务解决能力与 Claude Opus 5 相当,但所用步骤和 token 明显更少,在多步任务中还能快速从错误中恢复。

  19. Cursor(@cursor_ai)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 上线 Cursor,CursorBench 达 57.8%(Max)

    Cursor 宣布 Claude Opus 5.5 已在其平台上线,该模型以 57.8%(Max)成为 CursorBench 上的新榜首。Cursor 同时表示,其每任务成本比 Opus 5 低 40%。

  20. Mike Krieger(@mikeyk)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,主打编码与知识工作

    Anthropic 发布 Claude 5.5 系列的首个模型 Claude Opus 5.5,官方称其在编码和知识工作上领先,写作能力也较强。该模型在多数任务上表现与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。

    为什么值得看

    Anthropic 新模型系列的定价与能力对照信息,可看出成本与性能的取舍方向。

  21. Lovable(@lovable_dev)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 改用 Opus 5.5 构建,步骤最多减少 48%

    Lovable 宣布即日起其构建流程改用 Opus 5.5,质量与 Opus 5 持平。官方称在 0 到 1 构建与迭代修码上质量不变,在已有代码库上步骤最多减少 48%;自检测试得分高出 4-6%,达成同样结果所需步骤最多减少 57%。

  22. cat(@_catwu)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 成为 Claude Code 与 Claude 应用默认模型

    Claude Opus 5.5 现已成为 Claude Code 和 Claude 应用的默认模型,覆盖 Cowork,面向 Pro、Max 和 Team 套餐。

9月22日周二
  1. AI科技大本营AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    “当年在 OpenAI 像在疯人院”:Jev 作者 Diogo Almeida 访谈谈反叛 RLHF 与可编程 AI

    前 OpenAI 核心研究员、TypeSafe AI 创始人 Diogo Almeida 在播客 Latent Space 完整访谈中,解释其新模型 Jev 为何完全不做文本生成,只向程序输出带概率和置信度的决策,并以代码作为唯一消费者。

  2. 机器之心SOTA模型AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源 MiMo-V2.6 Pro/Flash,xAI 发布 Grok 4.7,APUS 开源决策模型 OpenJev-v1

    小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。

  3. Hunyuan(@TXhunyuan)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元推出 WebCraftBench:用真机探索评测 AI 生成网站

    腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。

  4. AK(@_akhaliq)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CodeMidas:从代码本身扩展智能体编程 RL 环境

    论文提出 CodeMidas,一种从代码本身扩展智能体编程强化学习(RL)环境的方法,论文已发布在 HuggingFace Papers 上。

  5. Fireworks AI(@FireworksAI_HQ)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 在 DeepSWE 上测 18 个模型:理想路由达 97.6% 解决率

    Fireworks 在 DeepSWE 上让 18 个模型跑 113 个真实编码任务,再假设每个任务都交给处理最好的模型,得到 97.6% 解决率、每任务 1.88 美元,而最佳单模型为 74.1%、每任务 6.52 美元。其结论是下一步方向在于路由器。完整分析见 fireworks.ai/blog/the-front…