Karpathy 把 simonw 的"骑自行车鹈鹕"测试源码上传,可在浏览器中试玩
Andrej Karpathy 将 Simon Willison "骑自行车鹈鹕"测试的源码上传到 karpathy.ai/lotr-movie/,该测试如今可在浏览器中直接运行并支持 fork。他还调侃说 GTA Hobbiton 会在 GTA VI 之前推出。
Andrej Karpathy 将 Simon Willison "骑自行车鹈鹕"测试的源码上传到 karpathy.ai/lotr-movie/,该测试如今可在浏览器中直接运行并支持 fork。他还调侃说 GTA Hobbiton 会在 GTA VI 之前推出。
过去两年 AI 的进展很大程度上由编码智能体推动。Binyuan Hui 就此发问:是否还有哪个新方向让人感到同样兴奋。该帖获得 29 条回复、125 次点赞、约 4.25 万次浏览。
播客「屠龙之术」主播庄明浩质疑外界流传的 WorkBuddy 2000 万月活说法,认为这是对数据源的过度演绎。节目从 Chat 进入真 Agent 时代切入,梳理 CodeX 的千万活跃用户、Harness 崛起与开源 Agent Infra 生态,并指出评估空前重要、work agent 共识在国内形成很快。他还讨论了用户量与 token 量是否仍重要、是否只能回到 ARR 衡量。
乱翻书播客这期请来飞书前产品 Eric、AI 观察者庄明浩和雅楠,讨论大厂押注 AI 办公后飞书、钉钉反而沦为配角。节目认为狭义企业 IM 的历史使命已基本完成,豆包与飞书之间是豆包吃掉飞书,个人生产力与企业办公的边界正在模糊。嘉宾还提到 Codex 定义了这轮 Work Agent 的产品形态,并追问豆包 2 亿日活究竟是资产还是负债。
idoubi 开源了为 DeepSeek 深度优化的 Coding Agent DSCode,主打快、省、稳、开放、安全。
奇舞周刊第593期聚焦 AI 编程时代瓶颈从"生产代码"转向"理解代码",作者提出技术债、认知债、意图债的"三元债模型",认为 AI 在降低技术债的同时正加速累积后两者,开发者不能外包"理解"。
DeepSeek 梁文锋一场闭门讲话被解读出理想主义背后的成本账:硬件约 10 个月回本、API 按成本 6 倍定价,融资的钱继续买卡,“反正开了你也做不了”被视为真正的成本壁垒。讲话还涉及用 TileLang 重构底层算子绕开英伟达生态,以及 Claude 加一两个工程师就完成 AMD 硬件适配原型。开源被形容为试吃,护城河藏在工程化与上下文里。
Cognition 更新 FrontierCode 1.1,以反映 GPT-5.6 Terra 和 GPT-5.6 Luna 的新折扣,GPT-5.6 系列由此落在性价比效率的帕累托曲线上。Scott Wu 表示所有 Devin 用户都会自动看到成本下降。
Giles Edwards-Alexander 做了一项实验,验证把大函数拆解为小函数是否能降低 token 成本,结果表明如今或许已经可以衡量重构带来的经济收益。该文发表于 martinfowler.com。
演语科技 Evoken 创始人陈冕在《晚点聊》中回应外界对公司的争议,包括原创度质疑、投流与补贴误解,以及收购传闻。Evoken 旗下有 Liblib、Lovart、LibTV 三个产品,ARR 超过 3 亿美元,并以 20 亿美元估值一笔融了 3 亿美元。陈冕称公司不是负毛利,LibTV 3.9 折会员仍在探索高 Token 消耗的生产力产品商业模式。
微软 CEO Satya Nadella 披露其用即将登陆新 superapp 的 Copilot code,以单条提示词加 /drill-me 技能生成计划,再用 autopilot 生成含历史、查询、场景与 what-if 分析的完整应用,并以 /rubber-duck 完成测试。
作者以 Codex Subagents 为例,讲如何用大白话把任务拆给多个子智能体:只需说清叫谁、干啥、并行还是排队、结果给谁,文中给出了代码排查和 reviewer、security-auditor、qa-expert 并行审核两类可照抄范例。
作者在使用 Coding Agent 时从 TL 转向 EM 角色,转折点在 Fable 5 前后——发现 AI 写的代码质量已相当可以,只需稍加验证。他现在只与 Agent 一起定技术方案,再用 /goal 加上方案让 Agent 执行写代码和自动化测试,最后验收功能。
Cursor 面向印度开发者推出 Cursor Start 订阅,价格为 ₹649/月,包含对 Grok 4.5 和 Composer 的慷慨额度,可用于日常规划、构建、测试和交付。Aman Sanger 表示,Cursor 在印度的用户基数过去一年增长到原来的三倍,人均 agent 请求量高于其他任何国家,并称这两款模型能力强且 token 使用高效、成本低。
Poe 宣布可在其平台试用 Anthropic 最新模型 Claude Opus 5,并称这是迄今能力最强的 Opus 模型,以一半价格接近 Claude Fable 5 级别的智能。该模型在智能体编码、知识工作、视觉理解和长时任务上有明显提升,试用入口为 poe.com/Claude-Opus-5。
Windsurf 发布推文推广 Devin Desktop,并附上 devin.ai/download 下载链接。该推文互动量为 2 条回复、4 个点赞、2808 次浏览。
Kimi K3 现已在 Devin Desktop 和 Devin CLI 中可用。在 FrontierCode 1.1 上,Kimi K3 是 Cognition 测试过的首个接近前沿水平的开源模型。
有意思小周刊 vol.170 提出面向 React Native 项目的 AI 需求开发闭环实践:把 PRD、接口文档、Figma 输入转化为可审阅的「需求规格」,并设人工门禁做需求审阅与架构确认,再依次执行代码生成、编译验证和视觉审计,形成从需求到可验证代码的人机协作流水线。
v0 现已上线 Claude Opus 5,用户可在 v0.app/?opus5 直接试用。该消息由 v0 官方账号发布,未披露价格、上下文长度等具体参数。
Anthropic 发布 Opus 5,团队称在提升智能水平的同时大幅优化了该模型在各领域的 token 效率。Alex Albert 表示其使用体验非常顺滑,在许多编码任务上他更偏好 Opus 5 而非 Fable 5。
Opus 5 帮 Mike Krieger 实现了 6 岁时的想法——在 Transport Tycoon 世界中自由漫步。Opus 用一整夜时间构建了渲染器、存档解析器以及船、飞机、卡车和巴士模拟器。
开源项目 opencodex 发布,作为通用 LLM 代理中间件,让 Codex(CLI、App、SDK)和 Claude Code 用户自由使用 Anthropic Claude、Google Gemini、xAI Grok、DeepSeek、Ollama 等任意大语言模型。
Slack 设计团队没有采用自上而下的 AI 培训,而是搭建了一个允许困惑、鼓励探索的学习社群。团队开设周五活动「会 Vibe 的设计师 & AI」,并在 2026 年推出为期三天的 Builder Days,让设计师、工程师和产品经理放下路线图,用 AI 一起动手造东西。其经验是:不要从工具赋能开始,而是先给设计师一个可以安心当新手的地方。
腾讯混元 Hy3 在 Agent Arena 开源权重模型中排名第 5(总榜第 25),在前端代码赛道(Frontend Code Arena)位列开源模型第 2(总榜第 16)。
播客「牛油果烤面包」第 153 期邀请 laike9m 和 Rice,聊 AI 编程的历史与技术核心,从「古法编程」、编译系统、测试与代码审核讲到 AI 编程工具的演进,重点剖析 Claude Code 与 Agentic Coding。
Google 的 Gemini 3.6 Flash 现已全面可用,并正在 GitHub Copilot 中逐步推送。该模型面向网页与应用开发、编码及智能体任务;在测试中,它在编码和智能体工作流上的任务完成率高于 Gemini 3.5 Flash,token 效率也更好。用户可在 GitHub Copilot 应用或 @code 中试用。
Google 推出 Gemini 3.5 Flash Cyber,基于 3.5 Flash 构建,在 CyberGym 等基准上达到前沿竞争力,面向规模化发现与修复网络安全漏洞场景优化,成本更低。该模型将在 AI 代码安全智能体 CodeMender 中独家提供给政府和可信伙伴,作为限时访问试点项目的一部分。鉴于技术的双用途性质,Google 对部署采取了审慎方式。
Anthropic 在与美国政府沟通后重新上线 Claude Mythos 和 Fable 模型,并发布 Claude Sonnet 5,主打更低价格运行智能体、提升 agentic coding 与基准表现。Google 推出 NotebookLM 竖屏短视频摘要与更快的图像生成器 Nano Banana 2 Lite,中国开源 LongCat-2.0 MoE 模型同期发布。
Anthropic 在美国政府指令下切断了 Fable 5 和 Mythos 5 的访问,理由是涉嫌越狱。SpaceX 以约 1.75 万亿美元估值完成 IPO,随后以 600 亿美元收购 AI 编程公司 Cursor。
TierZero 团队加入 Cognition,继续推进"让软件自动驾驶"的目标,即让智能体编写代码并保持其运行。Anhang Zhu 表示两年前开始这一方向,Cognition 的 Scott Wu 称期待自动驾驶软件的下一步进展。
2018年,28岁的 Sarah Guo 成为 Greylock 60年历史上最年轻的普通合伙人,四年后离职创办全押 AI 的 Conviction。她早期投资了 Baseten 和 Harvey(各估值超 110 亿美元),首年又投中 Sierra、Cognition 和 Mistral(三家合计估值 540 亿美元)。
Inkling 和 Grok 4.5 现已在 Devin Desktop 和 CLI 中可用。Cognition 同步上线 FrontierCode 排行榜,专门追踪哪些模型能写出真正可合并的代码,Grok 4.5 与 Inkling 等所有模型的分数均已公布,并附完整评测方法和示例任务。
播客「屠龙之术」在约50分钟节目中梳理2026年上半年AI行业变化,从资本与硬件、模型竞争、Agent元年、世界模型与治理四条线索重估产业方向。节目提出2026年可能成为Agent从聊天走向任务执行的关键年份,Coding Agent、办公智能体与Agent基础设施将重构软件生态,并讨论OpenAI、Anthropic、Google及中国模型厂商的格局变化与中美开源闭源路线分野。
Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。
Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。
Sriram Krishnan 认为开源模型与配套框架正迎来高光时刻:如今可以凭借清晰的训练谱系追上接近 SOTA 的性能,如 thinkymachines 的 Inkling 今日发布。
Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。
xAI 就用户关于 Grok Build 隐私的疑问作出回应,称自发布以来一直完全遵守零数据留存(ZDR),所有用户始终可在 CLI 中禁用数据上传,禁用后该选择会被遵守。
腾讯混元 Hy3 被开发者 Jen Zhu 实测称为"小但强"的模型,仅用 3 条提示词就通过 Hermes X Hy3 智能体生成了一个交互应用。该模型是 OpenRouter 上使用量最高的模型,累计消耗 6 trn tokens。
Cognition 收购 Windsurf 满一年,期间推出自研模型(上周发布 SWE1.7)、Devin Review、Devin CLI,并将产品统一为 Devin Desktop 品牌。团队一年写下超 2000 万行代码,营收运行率从 7300 万美元增至超 5 亿美元。
Unmesh Joshi 在 Martin Fowler 站点分享经验:LLM 生成代码速度极快,但要确保产出符合预期,需要清晰的边界,他用抽象和领域特定语言(DSL)构建了强约束。文章已在 martinfowler.com 发布。