Tw93 将 Mac 软件兼容测试集从 300 个扩至 549 个,覆盖 App Store 版本与浏览器扩展插件
独立开发者 Tw93 把已验证的 Mac 软件兼容测试集从 300 个增加到 549 个,补充了 App Store 版本和扩展插件。他借助大模型和 computer use 能力,通过脚本定位 App 的无障碍元素实现自动化操作,并将其归因于 Mac 上 computer use 体验优于 Windows。
独立开发者 Tw93 把已验证的 Mac 软件兼容测试集从 300 个增加到 549 个,补充了 App Store 版本和扩展插件。他借助大模型和 computer use 能力,通过脚本定位 App 的无障碍元素实现自动化操作,并将其归因于 Mac 上 computer use 体验优于 Windows。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已上线 Vercel AI Gateway。
TypeSafe CEO 解释为何 AI 能解决极难问题却仍无法自动化基础工作,Jev 因此不做 chat 而专注软件内的可靠决策,并在 API 层拒绝公开 benchmark 与拒绝回答。他认为数据与正确任务比堆算力更重要,System One Model 可能重塑 coding agent 与软件,即便有 10 亿美元他也不会从零预训练模型。
Grok 4.7 已在 Devin Desktop 和 Devin CLI 上线,Cognition 同步确认该模型接入 Devin。在 FrontierCode 1.1 的 Extended 测试中,Grok 4.7 得分 59.4%,官方评估称其在高难度后端工程任务上表现优异。
Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。
Grok 4.7 现已在 Devin 中可用,在 FrontierCode 1.1 的 Extended 测试中得分 59.4%。Cognition 的评测显示,该模型在困难的后端工程任务上表现优异。
Anton Osika 表示其团队的 harness 已针对构建 Web 应用做微调,会依据用户请求内容在 OAI 与 Anthropic 之间路由,并自动拉取全部调试数据。他邀请开发者试用该工具。
Lovable 本周推出活动,用它构建 AI 智能体或 web 应用即可免费获得 Jev API。同时上线的还有 Jev completions API 和 Jev Playground(jevplayground.lovable.app),并已接入其 AI gateway。
Google 用 Gemini 3.8 Live Extended Thinking 构建了一个编程辅导工具,能识别用户屏幕上的 bug 并通过 function calling 引用 p5.js 库,然后讲解其中的逻辑。该演示展示了模型实时看屏加函数调用的组合用法。
GitHub 表示,仅由一名工程师和一个智能体团队,就把 GitHub Copilot agent runtime 移植到 Rust,交付 80 万行生产代码并保持了代码质量。官方在推文中附上 github.blog 的说明链接,介绍其具体做法。
Guillermo Rauch 用一道涉及逆向工程运行中二进制的难题测试 Grok 4.7,结果被顺利解决,且速度非常快。
xAI 发布对比演示,让 Grok 4.7 与 Grok 4.6 分别构建同一款开放世界城市游戏,4.7 排在前面、4.6 排在后面。原帖只给出两段视频,未披露 benchmark 分数、参数规模或具体能力差异数据。
xAI 宣布 Grok 4.7 现已在 Cursor、Grok Build 以及 Grok API 中可用,并给出 x.ai/news/grok-4-7 的了解更多链接。
一人公司能赚钱的通常是六类:做中介、搞自媒体、做 SEO、与现有流量渠道合作、卖课做社群、向他人提供专业服务。不赚钱的一人公司则多是「我有想法,vibe coding 做产品」。
阶跃星辰新模型 Step 5 Preview 实测显示前端 UI 复刻能力已追上第一梯队,排名较上个版本提升 13 名,与 K3 和 Grok 打平,价格仅为 K3 的三分之一。用一句话提示词即可复刻 Apple 官网首页,接入 Claude 框架后能从 72 页 PDF 中逐条提取数字、审计含 14 张工作表 1800 多条公式的 Excel 模型并揪出 22 个单元格错误。
Kimi Code Desktop 正式发布,macOS 和 Windows 版同步上线,可通过 kimi.com/code 安装使用。它把 Kimi Code 的 AI Agent 能力搬进桌面应用,支持对话读写代码、运行命令和自动化任务,并提供内置终端、内置浏览器、Git 状态查看与按文件审阅改动。
有用户向 @thsottiaux 发问"最近 codex 怎么了?",该帖获得 8 条回复、4 个点赞和 6932 次浏览,正文未给出 Codex 具体发生了什么变化。
作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。
Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。
GitHub Podcast 最新一期讨论软件开发中涌现的一批 AI 新词汇,聚焦开发者当下正在学习的 AI 术语。节目可在 github.blog 的 AI 与机器学习板块收听。
GitHub 高级公司法律顾问总监 Dan 用 GitHub Copilot CLI 构建了一个自定义技能 Eyeball,把源文件截图内联嵌入 AI 分析结果,帮助法务团队核验复杂条款。目前 GitHub 的每位律师都在用终端处理日常工作流。
飞书 CLI 已支持搜索公开文档,有用户在即刻看到相关提醒后实测确认可用。该用户随后让 Codex 批量关闭了自己大部分个人飞书云文档的公开阅读权限,并建议其他人也尽快检查自己的飞书云文档是否有需要关闭的公开部分。
作者参与阶跃新一代旗舰模型 Step 5 Preview 内测,将其接入 Claude Code 完成五个项目:three.js 昆明 3D 网站跑了近 3 小时、把自研 Mac 截图工具 Ta 移植成 Windows 版、手机端 MD+HTML 阅读器墨读、广告小游戏复刻,以及网页虚拟机械臂接入 GLM-5.3-Flash 画画。
Founder Park 编译 YC 播客《The Lightcone》内容,YC CEO Garry Tan 与合伙人 Diana Hu、Jared Friedman、Harj Taggar 复盘过去 12 到 18 个月的批次数据。
腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。
作者分享用 GPT-6 Astra、Meshy 和 Blender 把个人 IP 夕小瑶做成 3D 手势交互网页的完整流程,网页已上线可体验。
Remix 团队成员 Brooks Lybrand 撰文质疑"Just let AI use React"的说法,认为 AI agent 不用框架会自行拼凑"土法炮制"的框架,因此需要具备更优抽象与约束的新一代框架。
作者分享从 X 上看到的 QBS 方法,让 GPT-6 针对卡住的问题找一本相关书籍、读完相关章节,再把方法提炼成可直接使用的规则 skill,并用新任务试跑验证,流程为 Question 问题到 Book 书籍再到 Skill。
Anthropic 正在开发 Claude Code mods 系统,作为自定义 Claude Code harness 的方式,AGENTS.md 支持即基于该系统构建,目前是内置 mod,用户后续也能自行构建自定义的项目指令版本。
一篇关于编码智能体 Harness 设计的实证研究论文发布在 Hugging Face,论文链接已公开。原文未披露具体模型、benchmark 分数或实验结果。
Atlassian 在 Loom 中使用 Transcribe 2.0 后发现,它在捕捉用户指令方面更准确。用户可用 Loom 口述变更需求,再直接导出到 Cursor 编码实现。
奇舞周刊第597期汇编多篇 Agent 工程实践:淘宝百亿补贴数据分析助手 Agent 在自然语言与 SQL 间加入业务语义层,结合多 Agent 编排、知识检索与执行校验,案例查询耗时从 30—120 秒降至 3—10 秒。
豆包2.1 Pro 0915版进入火山方舟模型列表,支持百万 Token 上下文与多模态编程,并强化长程 Agent 协作与异步子任务验收。Anthropic 开源含 36 套工具的生物模型推理优化工具集,报告平均提速约 4 倍,其中 FlashPairformer 专用内核加速结构预测,仓库为研究参考发布、不计划持续维护。
刘小排提出,创业成功不是公司上市、被收购或达到某个收入数字,而是"找到一个值得长期待下去的赛道 + 找到一个会自己变强的模式",即哪怕创始人不再越来越牛,公司仍能越来越牛。
有人尝试用 ChatGPT 的 live 模式打电话改文章,方案是先在 Codex 里打电话并提前把 md 文件路径给它,写作则指定 Codex 调用 gemini 3.8 flash(可通过 agy cli 接入),再用任意 md 阅读器打开文件随时聊着改内容。
Shopify 宣布放弃 React Native,改用 Swift 和 Kotlin 开发移动客户端,回到原生语言路线;六年前它曾高调从原生转向 React Native。周刊还提到联合国投票决定废除墨卡托投影,建议改用 Equal Earth Projection 绘制世界地图;成都市计划推出"词元券",对企事业单位消耗的 Token 补贴不超过 30% 的消费金额。
Z.ai 的多模态编码模型 GLM 5.3 FlashX 现已上线 AI Gateway,提供约 200 tokens/s 的高速推理服务,适合编码智能体、工具循环和交互式应用。模型 ID 为 zai/glm-5.3-flashx,可在各 API 格式和编码智能体中调用。AI Gateway 按供应商价格原价计费,不收取推理平台费,BYOK 请求同样适用。
Hacktron 在 2026 年 8 月报告 Next.js 图像优化疑似存在远程代码执行(RCE)漏洞,Vercel 与 Hacktron 复现后确认问题代码不在 Next.js 本身,而在上游被 Next.js、ImageMagick、WordPress、sharp 等广泛使用的 AVIF 解码器 libheif。
Notion 被类比为知识工作领域的 GitHub:正如 Cursor 让开发者在 Git 仓库上编码,Notion agents 让用户在公司知识文本上工作。该观点来自一条引用帖,认为任何智能体提供商都可接入这一"公司大脑"。
Bolt 上 1100 多万开发者已可用上开放模型,用量最高可提升 50 倍;其中最快最便宜、提示词窗口达 2 倍的 GLM 5.3 Flash 以 54% 占比排第一,DeepSeek V4 Pro 以 17% 居次,GLM 5.3 为 15%,Kimi K3 占 1%。