Binyuan Hui 转发 Karpathy:用做游戏测试 LLM,社区仍缺标准化基准
Binyuan Hui 转发 Andrej Karpathy 的观点并指出,做游戏能同时考察 LLM 的推理、规划、编码、工具库使用和多模态理解,但社区似乎仍缺少针对做游戏的标准化基准。
Binyuan Hui 转发 Andrej Karpathy 的观点并指出,做游戏能同时考察 LLM 的推理、规划、编码、工具库使用和多模态理解,但社区似乎仍缺少针对做游戏的标准化基准。
企业Agent的有效性被拆解为大模型能力、企业上下文、工具能力与治理评测四者相乘,其中企业上下文被视为最难被复制、也最可能拉开差距的差异。企业上下文分为规则、事实、经验、任务、组织与用户五类,需按任务动态装配最小充分上下文,而非把文件一股脑塞给模型。作者认为,企业Agent的竞争最终是知识管理、流程与组织治理能力的竞争。
有人做了一个名为 The boss clone 的工具,把每次与老板的一对一谈话转成可搜索的知识库,现在可以就任何问题询问 AI"老板会怎么回答"。该帖来自 Jonathan Sharp,发布在 app.therundown.ai 社区。
一个被称为"AI 用例版 Reddit"的新社区正式上线,供开发者交流彼此如何在生活、工作和商业中使用 AI。该社区由 xgo.ing 提供支持,官方称目前收到的投稿"非常出色",并展示了其中几个案例的互动数据。
李继刚在文中提出,分类是理性认知的关键环节,它把连续具体的经验编译成可比较、可迁移的认知单位,让过去的后果能指导现在的行动。但分类也是一项赌注,被忽略的差异一旦改变结论,清晰就会变成无知整理出的秩序。可靠的分类必须允许追问"我为什么这样分、忽略了什么、什么差异出现时必须重新分",重新分类才使知识不至于固化成偏见。
BAI Capital 高级合伙人汪天凡在「十字路口」公路播客中提出,当基础模型趋同、智能开始通胀时,AI 应用的新机会藏在 Context 和交互里,而 AI 硬件真正稀缺的是产品定义与「注入人性的光辉」。他认为 2026 年泡沫中更该下注想清楚为何出发的创业者,并称 AI 是压缩进 30 年的 3000 年文明变革,门槛可能只有 1% 的人能跨过。
Thinking Machines 发布首个模型 Inkling,975B-A41B 多模态 MoE,可输入文本、图像和音频,并同步推出 276B-A12B 小版本。
Andrej Karpathy 用《魔戒》第一段文字和 1M token 预算(约 10 美元)让 Opus 5 做 Three.js 渲染,模型运行约 2 小时后写出 5500 行代码,以程序化方式呈现这段故事。
过去两年 AI 的进展很大程度上由编码智能体推动。Binyuan Hui 就此发问:是否还有哪个新方向让人感到同样兴奋。该帖获得 29 条回复、125 次点赞、约 4.25 万次浏览。
播客「屠龙之术」主播庄明浩质疑外界流传的 WorkBuddy 2000 万月活说法,认为这是对数据源的过度演绎。节目从 Chat 进入真 Agent 时代切入,梳理 CodeX 的千万活跃用户、Harness 崛起与开源 Agent Infra 生态,并指出评估空前重要、work agent 共识在国内形成很快。他还讨论了用户量与 token 量是否仍重要、是否只能回到 ARR 衡量。
桥水基金创始人 Ray Dalio 在最新专访中判断,当前正处于典型的 AI 投资泡沫中,同时身处一轮约 80 年的大周期终局,债务积累、贫富差距扩大与世界秩序权力转移正在同步发生。
乱翻书播客这期请来飞书前产品 Eric、AI 观察者庄明浩和雅楠,讨论大厂押注 AI 办公后飞书、钉钉反而沦为配角。节目认为狭义企业 IM 的历史使命已基本完成,豆包与飞书之间是豆包吃掉飞书,个人生产力与企业办公的边界正在模糊。嘉宾还提到 Codex 定义了这轮 Work Agent 的产品形态,并追问豆包 2 亿日活究竟是资产还是负债。
硅谷101播客邀请前Hugging Face亚太开源生态负责人王铁震与TinyFish联合创始人Keith Zhai,讨论中国开放模型逼近前沿引发的蒸馏争论。7月27日月之暗面发布Kimi K3完整模型权重,自7月16日API上线以来K3在多项测试中接近前沿模型能力。
《晚点聊》主播曼祺与《晚点 LatePost》主笔高洪浩对谈姚顺雨加入腾讯300天给混元带来的改变,相关报道为《当一个年轻人空降改造腾讯混元的300天》。节目提到,姚顺雨到任后先更换关键岗位再重建组织,多模态并入使其管理范围持续扩大,刘炽平在钱、人、算力和时间上给予支持,混元3的第一炮目标不是登顶而是重振士气。
Thinking Machines 提出开放权重模型的安全发布路径:在模型侧做稳健安全测试并研究危险能力能否与通用智能解耦,在生态侧通过分阶段发布、支持防御方和与安全研究者合作来提升韧性,每一步只选证据支持的最开放方案。
清华大学人工智能学院助理教授刘子鸣在访谈中用“太疯狂了”形容当下中美 neo labs 的融资热度,他本人是 KAN 网络一作,今年 3 月回国任教并参与创建公司元环智能。他指出当前资本涌入最活跃的两个方向是世界模型和 AutoResearch(AI for AI),并梳理了今年中美做 AI for AI 的创业团队与路线。
DeepSeek 梁文锋一场闭门讲话被解读出理想主义背后的成本账:硬件约 10 个月回本、API 按成本 6 倍定价,融资的钱继续买卡,“反正开了你也做不了”被视为真正的成本壁垒。讲话还涉及用 TileLang 重构底层算子绕开英伟达生态,以及 Claude 加一两个工程师就完成 AMD 硬件适配原型。开源被形容为试吃,护城河藏在工程化与上下文里。
Richard Socher 在 AI Engineer 大会首次 Autoresearch 专场发表主题演讲,介绍 Recursive_SI 正在构建用于递归自我改进的 Eureka Machine,目标是为人类实现科学发现自动化,并将其称为超级智能最有意义的应用。他同时指出距离这一目标仍有很长的路要走。
Sahil Lavingia 发布推文"Skills issue",附带 13 条回复、2 次转发、81 个点赞、18303 次浏览和 18 次收藏,由 xgo.ing 提供数据支持。
以谁为中心被提出为一个产品定义问题,作者抛出"哪条路能胜出"的提问,未给出具体产品、模型或数据结论。
演语科技 Evoken 创始人陈冕在《晚点聊》中回应外界对公司的争议,包括原创度质疑、投流与补贴误解,以及收购传闻。Evoken 旗下有 Liblib、Lovart、LibTV 三个产品,ARR 超过 3 亿美元,并以 20 亿美元估值一笔融了 3 亿美元。陈冕称公司不是负毛利,LibTV 3.9 折会员仍在探索高 Token 消耗的生产力产品商业模式。
AI 让设计师从"应该修这个"转向"我修好了并已上线",不再依赖产品经理点头或工程师排期,但自主权也暴露了只会指出问题、无法给出可行替代方案的设计师的短板。Smashing Magazine 文章认为,最优秀的设计师将更像混合型产品负责人,而设计团队总人数可能下降,留下的人对产品有更直接的影响力。
播客「半拿铁」第212期回顾豆瓣、知乎、百度贴吧、虎扑四个中文社区的发展史,从杨勃初创豆瓣、知乎商业化困境到贴吧与虎扑的亚文化与商业化探索,追问这些最具「精神家园」气质的社区为何往往最难赚钱。
Agent 正成为企业里的"数字同事",但现有身份系统难以描述它:agent 同时包含人的委托和工作负载两类主体,却常用长期 API key 直接继承用户的全部权限。
Scott Wu 发帖调侃称,传闻在累计合并第 10,000 个 Devin PR 后会获得一件纪念品。该帖由 xgo.ing 统计,获得 443 次点赞、29 条回复、13 次转发和 31,429 次浏览。
Cognition CEO Scott Wu 在巴黎与 Molly O'Shea 对话时透露,Devin 现已编写 Cognition 约 95% 的代码,高于 5 月 D 轮时的 89%。
Satya Nadella 转发并赞同 Mark Zuckerberg 的一篇文章,称构建一个赋能各地个人与组织的前沿生态是大家需要共同建设的目标。Zuckerberg 表示他撰文解释了为何相信未来属于所有人,并称很快会给出关于超级智能世界的积极愿景。
李飞飞指出,Sim-to-real 对齐的仿真让评估变得可扩展:同一失败行为与结果会同时出现在虚拟和物理世界中。该仿真不只还原任务设置或最终成功标签,而是复现推动策略走向成功或失败的条件,从而带来更快迭代、更广覆盖和显著更低的成本。
导演易小星与粉墨团队导演李晨在播客中讨论 AI 拍电影,其合作作品《女娲之死》获 B 站创作大赛奖项。两人坚持用粘土风对抗 AI 塑料感,提出"人定美学,AI 执行"的工作流,认为技术平权后好故事成为唯一稀缺品,AI 写不出基于预期违背的喜剧段子。他们预测未来或有超 50% 画面由 AI 参与制作,但真人实拍与 AI 创作将长期并存。
MacPaw 推出主动式 AI 助手 Eney,放弃 Claude、ChatGPT 式的对话框形态,改用带表情与手势的圆形角色形象与用户交互。Eney 刻意减少屏幕动作,以眼睛作为主要情感连接点,并选用粉色而非 AI 产品常见的蓝色以形成区分。MacPaw 强调其设计全程由人类设计师决策,AI 只是加快流程的工具。
Dify 的 GitHub Stars 突破 150K。官方指出,点亮一颗 Star 只需一次点击,而完成一次代码合并需要两个名字——一个确认创造,一个代表信任,一次贡献由此成为整个项目共同向前的一步。Dify 表示将向下一个 150K 星乃至更远目标进发。
METR 提出一套第三方独立调查 AI 未对齐事件的框架,主张由独立研究人员调查智能体违背用户与开发者意图行为背后的深层动机。该框架覆盖未对齐事件的规模与性质、重点事件分析、反事实采样实验、根本原因与纠正措施,以及各类分析的局限性,并要求调查人员能运行涉事模型、获取完整轨迹记录、访谈员工并动用推理预算和 AI 工具。
METR 提出一套第三方调查框架,用于在 AI 智能体发生错位事件后由独立研究者追问其行为"动机"及训练与部署成因。调查需覆盖事件频率与分布、最严重事件的行为序列与模型推理、日志完整性和 CoT 可信度等局限,并要求公司开放证据访问、同步处理敏感信息脱敏。METR 表示愿与 AI 公司合作开展此类调查,并正将其纳入 Frontier Risk Report 的后续版本。
一条推文提出,AI 已具备运营公司的能力,真正的障碍在于创始人是否愿意放权退居幕后。该帖获得 325 个点赞、64 条回复和 3.3 万次浏览。
播客对谈百度智能云 AI 计算首席科学家王雁鹏,讨论从模型时代到 Agent 时代的底层技术演变。他认为这一代 AI Infra 与上一代不同,是以 GPU 为核心构建,需要以 CPU 消耗窥见 Agent 诞生的真实价值,并梳理 Anthropic、OpenAI、Google 的路线差异以及国内多芯适配与开源生态的两大差异。
vLLM社区维护者游凯超以Inferact联合创始人兼首席科学家身份受访,讲述这个伯克利校园开源项目用近3年从一篇算法论文变成开源社区、再变成公司。Inferact今年初完成1.5亿美元种子轮融资。访谈还讨论了开源项目商业化后的抉择,以及AI Infra与模型结构、Harness Engineering的联合设计。
针对"通用 Agent 会吃掉垂直 Agent"等三个判断,作者补充了自己的六点看法:通用 Agent 赛道也会少数赢家通吃,小通用 Agent 同样没有生存空间。
DHH 让 Claude 把一篇博客文章翻译成意大利语,Claude 以该文对罗姆人的描述"非人化"为由拒绝执行,称不愿产出打磨过的译文。DHH 随后用 Kimi K2.7 测试同类问题,该模型直接回答了 1989 年事件的经过,他据此质疑 Anthropic 以"安全"和"对齐"为名的价值观审查,并称更需要强开源权重模型来抵御这种软性意识形态控制。
Naval 认为无人机与拦截弹并非对等较量,更像枪对防弹衣:攻击方握有突袭、重力与兵力集中优势,干扰和 EMP 也无法拦下加固的自主弹药,等于把 MAD 逻辑搬到个体层面——看得见就能杀。
WAIC 2026 现场超节点成展商标配,继华为 CloudMatrix 384 后今年超 10 家厂商跟进,券商称 2026 年为「国产超节点元年」。节目对比 NVL72 与 CloudMatrix 384:后者单卡算力仅 B200 约 30%,总算力却是 NVL72 的 1.7 倍,系统参数已超但 CUDA 生态未破,产能与软件生态分化或致洗牌快于自动驾驶。