详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。
晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建出一款由AI模型驱动的原型计算机蠕虫,可利用被感染机器的GPU运行开放权重LLM进行推理,并自主发现漏洞、发动针对性攻击与自我复制。
Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash 等多款新模型,Black Forest Labs 发布可生成图像与 20 秒带音频视频的 FLUX 3。
名为 spam hunter 的项目把繁琐的 Google Business Profile 垃圾信息追踪做成 Claude Skill,可自动调查可疑商家列表并把证据整理成可直接提交给 Google 的报告。该工具由 Mike Blumenthal 贡献。
一位用户用 Claude 构建的工作流替代了每月 38 美元的 QuickBooks 订阅,该工作流可解析银行对账单、为每笔支出分类,并接入一个消费看板。该案例由 Michael Saif 分享。
一位保险谈判者让 Claude Cowork 从各大保险商处抓取 20+ 份房屋保险报价,逐条阅读保单细则中的隐藏条款(gotchas),并挑选出最划算的方案。该案例由 Linden Jensen-Page 分享。
Andrej Karpathy 用《魔戒》第一段文字和 1M token 预算(约 10 美元)让 Opus 5 做 Three.js 渲染,模型运行约 2 小时后写出 5500 行代码,以程序化方式呈现这段故事。
播客「屠龙之术」主播庄明浩质疑外界流传的 WorkBuddy 2000 万月活说法,认为这是对数据源的过度演绎。节目从 Chat 进入真 Agent 时代切入,梳理 CodeX 的千万活跃用户、Harness 崛起与开源 Agent Infra 生态,并指出评估空前重要、work agent 共识在国内形成很快。他还讨论了用户量与 token 量是否仍重要、是否只能回到 ARR 衡量。
硅谷101播客邀请前Hugging Face亚太开源生态负责人王铁震与TinyFish联合创始人Keith Zhai,讨论中国开放模型逼近前沿引发的蒸馏争论。7月27日月之暗面发布Kimi K3完整模型权重,自7月16日API上线以来K3在多项测试中接近前沿模型能力。
Claude 的部分决策规则属于绝对硬约束,与大多数决策所遵循的细致成本收益分析不同,这些约束不可协商,任何操作者或用户都无法解锁。正因其绝对性,硬约束在文档讨论的各类优先级中运作方式也不同。
作者 Daniela Baron 分享了一套降低 Claude Code token 消耗的工具与习惯组合,用于解决企业版月度额度月中耗尽的问题。方案包括用 rtk 压缩 CLI 命令输出、用 Caveman 精简模型回复、用 CodeGraph 以图数据库回答代码结构问题,以及默认使用 Sonnet 并把 advisor 设为 Opus。
Epoch AI 统计显示,自 2026 年 4 月 Anthropic 宣布其内部模型 Claude Mythos Preview 具备自主发现和利用网络安全漏洞的能力后,CVE 披露数量持续攀升。
清华大学人工智能学院助理教授刘子鸣在访谈中用“太疯狂了”形容当下中美 neo labs 的融资热度,他本人是 KAN 网络一作,今年 3 月回国任教并参与创建公司元环智能。他指出当前资本涌入最活跃的两个方向是世界模型和 AutoResearch(AI for AI),并梳理了今年中美做 AI for AI 的创业团队与路线。
LangChain 与 Qdrant 集成实现检索增强生成问答流水线,需两个模型配合:FastEmbed 默认使用 BAAI/bge-small-en-v1.5 将事实向量化存入 Qdrant,再检索相关文档拼入提示词交给 Claude 或 GPT 生成答案。教程用 Natural Questions 数据集演示,仅需几行代码,Qdrant Cloud 提供 URL 和 API key 接入。
马斯克在《经济学人》访谈中预测,AI 可能在 5 年内超过人类智能总和,10 年内进入超级智能时代,届时人形机器人驱动的"准无限经济"将使金钱在 2036 年不再重要,工作变成类似"园艺"的可选项。他仍估计 AI 消灭人类的概率在 10% 到 20%,建议领先公司互相提供一到两周的前沿模型早期访问测试。
Agent 正成为企业里的"数字同事",但现有身份系统难以描述它:agent 同时包含人的委托和工作负载两类主体,却常用长期 API key 直接继承用户的全部权限。
Anthropic 新研究显示,Claude Mythos Preview 已帮助研究人员发现密码算法的弱点。密码算法是用于保护数据隐私的数学方法。
METR 提出一套第三方独立调查 AI 未对齐事件的框架,主张由独立研究人员调查智能体违背用户与开发者意图行为背后的深层动机。该框架覆盖未对齐事件的规模与性质、重点事件分析、反事实采样实验、根本原因与纠正措施,以及各类分析的局限性,并要求调查人员能运行涉事模型、获取完整轨迹记录、访谈员工并动用推理预算和 AI 工具。
黄仁勋在专访中称 AI 是一场长达十年的范式转移,未来十年半导体产业规模需扩大到目前的 5 到 10 倍,并强调开源模型是科学进步与网络安全的基石。他表示英伟达中国销售额约为零,已告知投资者不要期待任何来自中国市场的收入,同时认为 DeepSeek、Kimi 引发的市场震荡是对开源模型影响力的误读。
播客对谈百度智能云 AI 计算首席科学家王雁鹏,讨论从模型时代到 Agent 时代的底层技术演变。他认为这一代 AI Infra 与上一代不同,是以 GPU 为核心构建,需要以 CPU 消耗窥见 Agent 诞生的真实价值,并梳理 Anthropic、OpenAI、Google 的路线差异以及国内多芯适配与开源生态的两大差异。
针对"通用 Agent 会吃掉垂直 Agent"等三个判断,作者补充了自己的六点看法:通用 Agent 赛道也会少数赢家通吃,小通用 Agent 同样没有生存空间。
Poe 宣布可在其平台试用 Anthropic 最新模型 Claude Opus 5,并称这是迄今能力最强的 Opus 模型,以一半价格接近 Claude Fable 5 级别的智能。该模型在智能体编码、知识工作、视觉理解和长时任务上有明显提升,试用入口为 poe.com/Claude-Opus-5。
DHH 让 Claude 把一篇博客文章翻译成意大利语,Claude 以该文对罗姆人的描述"非人化"为由拒绝执行,称不愿产出打磨过的译文。DHH 随后用 Kimi K2.7 测试同类问题,该模型直接回答了 1989 年事件的经过,他据此质疑 Anthropic 以"安全"和"对齐"为名的价值观审查,并称更需要强开源权重模型来抵御这种软性意识形态控制。
Epoch 与 METR 发布 MirrorCode 基准,用于评估 AI 完成长时程编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一项 METR 和 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中有 8 个始终未达 100% 通过阈值。
Anthropic 发布 Claude Opus 5,称其是一款善于思考且主动的模型,能力接近 Fable 5,价格只有后者一半。转发的评论者注意到此次还下调了 prompt cache 的最低额度,认为这是基础设施层面的推进。
Alex Albert 称,6 个多月后 Opus 5 生成的电子表格和幻灯片已接近超人类水平,可媲美咨询顾问的产出。他还引述金融业人士反馈,称 Claude for Excel 令人惊艳,并判断智能体编程式的爆发将在 2026 年扩展到其他领域。
Anthropic 发布 Claude Opus 5,称其是一款主动且考虑周全的模型,具备接近 Fable 5 的前沿智能水平,价格为其一半。作者表示该模型擅长长时间自主运行的任务,邀请用户试用并反馈。
v0 现已上线 Claude Opus 5,用户可在 v0.app/?opus5 直接试用。该消息由 v0 官方账号发布,未披露价格、上下文长度等具体参数。
Anthropic 发布 Opus 5,团队称在提升智能水平的同时大幅优化了该模型在各领域的 token 效率。Alex Albert 表示其使用体验非常顺滑,在许多编码任务上他更偏好 Opus 5 而非 Fable 5。
Anthropic 发布 Claude Opus 5,官方称其思考更主动,接近 Fable 5 的前沿智能水平,价格仅为其一半。Mike Krieger 表示 Opus 5 迅速成为他工作和周末的日常主力模型,能连续数小时处理复杂任务,并称其能持续深挖棘手问题;他还用它构建了一些游戏。
Opus 5 帮 Mike Krieger 实现了 6 岁时的想法——在 Transport Tycoon 世界中自由漫步。Opus 用一整夜时间构建了渲染器、存档解析器以及船、飞机、卡车和巴士模拟器。
Anthropic 发布 Claude Opus 5,称其为兼顾思考与主动性的模型,智能水平接近 Fable 5,价格只有后者一半。转述者 Alex Albert 以欢迎语转发该消息,未在推文中给出更多技术细节。
Claude Opus 5 发布,被 Anthropic 描述为一款深思熟虑且主动的模型,智能水平接近 Fable 5,但价格只有后者的一半。AI SDK 已支持接入该模型。
开源项目 opencodex 发布,作为通用 LLM 代理中间件,让 Codex(CLI、App、SDK)和 Claude Code 用户自由使用 Anthropic Claude、Google Gemini、xAI Grok、DeepSeek、Ollama 等任意大语言模型。
播客「牛油果烤面包」第 153 期邀请 laike9m 和 Rice,聊 AI 编程的历史与技术核心,从「古法编程」、编译系统、测试与代码审核讲到 AI 编程工具的演进,重点剖析 Claude Code 与 Agentic Coding。
Christopher Manning 教授参与的 PNAS《生成式 AI 时代的法律》专题上线,涵盖 AI 安全与版权、AI 治理、法律解释等议题。该专题由 Manning 提出创意,Dan Ho、Julian Nyarko、Vanessa Parli 与 PNAS 共同完成。
OpenAI 公开发布 GPT-5.6(含 Sol 与 Luna),并将桌面端 agentic 编程产品更名为 ChatGPT Work。SpaceX AI 推出低成本、Opus 级编程模型 Grok 4.5,Meta 发布 Muse Spark 1.1 并预览 Muse Video、上线 Muse Image。
Anthropic 在与美国政府沟通后重新上线 Claude Mythos 和 Fable 模型,并发布 Claude Sonnet 5,主打更低价格运行智能体、提升 agentic coding 与基准表现。Google 推出 NotebookLM 竖屏短视频摘要与更快的图像生成器 Nano Banana 2 Lite,中国开源 LongCat-2.0 MoE 模型同期发布。
Last Week in AI 播客第 248 期讨论上周 AI 大新闻,涵盖 Anthropic 发布 Claude Fable 5、Apple 在 WWDC 宣布 Siri AI、OpenAI 秘密提交 IPO 申请,以及 Google 向 SpaceX 每月支付约 9.2 亿美元购买 GPU。
Anthropic 发布 Claude Opus 4.8,基准分数提升,并推出面向长时间多智能体任务的 Dynamic Workflows;微软发布基于 OpenClaw 的常驻助手 Microsoft Scout 及 MAI Thinking 1 等自研 MAI 模型。