Jerry Liu:用 eval 驱动开发,把任务压缩成目标与评测指令
Jerry Liu 提出“eval driven development”:定义好 eval 后针对其爬山优化,就能解决几乎任何任务,而不必直接定义确定性的或智能体的工作流。
Jerry Liu 提出“eval driven development”:定义好 eval 后针对其爬山优化,就能解决几乎任何任务,而不必直接定义确定性的或智能体的工作流。
Harrison Chase 认同 Goodhart's Law——当度量变成目标,它就不再是好的度量,并指出 eval 驱动开发对范围狭窄的任务有效,但对更自主的 AI 智能体不适用。他引用 Hunter Gerlach 的说法:需要不断创建高价值 eval,同时对抗 Goodhart's Law,如此循环。
一个用纯 Rust 从零重写的图像编辑项目,复刻了 Photoshop 的图层、蒙版、调整图层和矢量功能,能直接打开、编辑并保存真实的 PSD 文件。项目可通过 CLI 或 MCP 交给脚本和 AI agent 驱动,代码托管在 github.com/openhausfun/ph。
有用户反映,当前用 Opus 做视频的瓶颈在 CPU 而非模型本身,该条动态附带 0 条评论、0 次转发、1 次点赞与 766 次浏览。
SI Maximalist 发布一段以"Uptown Funk"为配乐的混剪视频,把马斯克、黄仁勋、扎克伯格和 Altman 等 CEO 放进街头场景。LovartAI 转发了这条内容并配文"I'm in!🤣",帖子获得 29 个点赞、2859 次浏览。
一名用户吐槽 ChatGPT 在复杂需求上表现很差:会原地打转、缺乏主观能动性,需要不断要求它继续才干活,产出常是半成品,还会推翻自己最早的方案、留下大量补丁代码。用户称它给出的方案不说人话、需要反复解释才懂,加上 computer use 后 token 消耗飞快,正考虑取消订阅。
Gary Marcus 称自己 25 年间写了约 2000 条推文和文章,包括《Deep Learning is Hitting A Wall》,主张用神经符号 AI 补充深度学习/LLM;他指出科技圈只转发他唯一一次忘记明确提及此观点的内容,完全忽略其余工作。
OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。
生数科技开放新一代视频生成旗舰模型 Vidu Q4 预览版,最高支持 4K 直出,单次最多可用 15 张参考图和 3 段参考音频,单条最长 16 秒。实测 720P 生成 GTA 6 风格《邪恶老奶》一分钟仅 5.4 元,6 条共 110 秒视频花费不到 10 元。MaaS 端 720P 约 0.6 元/秒、1080P 约 0.75 元/秒,SaaS 端预览版阶段有两个月限时优惠。
Google Cloud发布署名Thomas Kurian的长文,推出通用办公Agent Gemini Agent,支持跨应用调用工具、定时与事件触发任务、多子Agent协作,并能依据任务在效果、速度与成本间动态选择Gemini系列或Anthropic Claude系列模型,未来计划支持更多闭源和开源模型。
对比Meta与OpenAI的办公Agent路线,能帮读者看清谷歌这次把Agent嵌入企业组织体系的具体做法。
MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。
由华为2012实验室、华为云等团队联合高校与开发者构建的开源 AI Agent 平台 openJiuwen,发布并开源企业级 AgentOS,将多智能体协同、自演进、算力亲和与企业级安全可靠能力融入统一底座,并通过插件化架构连接上层应用与底层模型、算力资源。
OpenAI 公布调查报告,披露并封禁了一个俄罗斯和一个伊朗影响力行动所使用的 ChatGPT 账号,两者都利用虚假身份把内容植入正规媒体,而非只在社交媒体上运作。
澳大利亚云计算公司 Firmus Grid 的 IPO 已被取消,该公司由英伟达投资,尽管仅有 2 座在运营的数据中心,却寻求 300 亿美元估值。这一案例被视为 AI 热潮存在边界的信号。
WSJ 报道,澳大利亚云计算公司 Firmus Grid 的 IPO 计划被取消,该公司此前在仅有两座运营数据中心的情况下寻求 300 亿美元估值。Firmus Grid 获得英伟达投资,此次 IPO 折戟被视为 AI 热潮存在边界的信号。
9 月最后一周,DeepSeek 在 OpenRouter 上处理的 Token 数量超过 OpenAI、Google、Anthropic 和 xAI 四家之和。
9 月最后一周,DeepSeek 模型在 OpenRouter 上处理的 token 量超过了 OpenAI、Google、Anthropic 和 xAI 四家模型的总和。该数据由 Social Capital 披露。
一条讨论 AI 电影是否算得上艺术的推文引发关注,获得 151 次点赞、14 次转发和 8.4 万余次浏览,并附带一段视频。原文未给出具体结论或涉及的 AI 视频模型名称。
Charles Curran 在 X 上发布一段 AI 生成影片,并反问"如果你认为 AI 电影不能成为艺术,那就解释一下这个"。该帖附带视频,获 1 次点赞、469 次浏览,未展示具体使用的模型或工具。
Deedy 称有三人分别确信"最快达成 10 亿美元年化收入"的是三家不同公司,很可能不止一家数据公司近期触及该门槛,其中不少在 Pavlov's List 上。他还预计未来 6 个月内会有更多公司达到这一水平,数据总支出已超 150 亿美元。
三位不同的人分别告诉 Deedy,他们 100% 确定"最快达到 10 亿美元年化收入"的纪录属于三家不同的 AI 数据公司,很可能已有多家近期突破这一门槛,其中不少出现在 Pavlov's List 上。Deedy 预计未来 6 个月还会有更多公司加入,该市场总支出已超过 150 亿美元。
Similarweb 数据显示,Muse 上线不到一个月,全球 DAU 持续攀升,并于 10 月 5 日达到 218.2 万的新高。
LangChain 的 Jev 在 LangSmith 评测中把轨迹标注拆成多个问题,难度与正确性各自给出带类型答案,且一次推理完成、覆盖每条 trace。Harrison Chase 认为轨迹标注并非单一通过/失败判断,Vaibhav Tulsyan 则指出规模化轨迹标注需在难度、正确性、设计选择多样性、思考方向等维度逐条评估,并大幅压低 token 成本。
一套自写的投资辅助系统接入日常流程 85 天,账户浮盈最高到过 3,733 元(2026-08-27),对应约 +10.5%,83 个日度快照浮盈无一为负,最新统计为 1,590 元。系统每月生成定投建议、每日做风险扫描并推送飞书消息,但只给建议,不接券商、不自动下单、不动资金。10 月 7 日风险扫描以执行冻结、现金低于 10,000 元底线等四条理由,把当月定投建议算成 0 元。
苹果宣布将于 10 月 13 日在纽约举办「Apple Experience」家庭产品活动,最受关注的硬件是代号 J490 的带屏设备 HomePad,配备约 6 英寸方形触控屏和金属支臂,搭载内部代号 Charismatic、可能名为 homeOS 的系统,可通过人脸与声音识别家庭成员。
余一(Ameliayu)已从鹅厂离职并加入 Manus,她表示离开是因为"一些很有意思的事情正在发生"。她还将作为分享嘉宾参加 11 月的深圳 GEO 大会,其 X 账号 @ameliax111 预计会开始活跃更新。
李飞飞在 X 发帖提出"在机器时代,谁来定义美?",称她认识的每一位数学家都能从数字、形状和自然现象中看到美。该帖获 1394 次点赞、222 条回复与 101 次转发,浏览量达 117675。
深圳鲲为科技完成 4 亿元新一轮融资,新增股东 XVC、红杉中国,老股东夏尔巴、腾讯加仓。鲲为通过将深度神经网络引入低频超声回波信号处理,实现穿透颅骨后毫秒级实时捕捉脑组织结构与血流动态。公司已实现数千万订单,并推出基础软件平台 kOS,目标客户为脑机接口 Lab 与 NeuroAI 模型公司。
白宫上周签署《开启超级智能时代》行政令,要求联邦政府非法定文件、网站与报告一律用超级智能(SI)取代人工智能(AI)。马斯克表态将把SpaceXAI更名为SpaceXSI,OpenAI则公开拒绝改名,奥特曼称公司名与全球认知都长在AI上。行政令还要求白宫科学顾问在60天内起草新的联邦定义,并成立超级智能工作组。
纪源资本「创业内幕」对话兔咚咚于红,围绕"我们到底希望孩子成为一个怎样的大人"展开。原文正文未提供更多可核验的产品、模型或数据信息。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6 系列。
字节Seed团队发现,DeepSeek-V4系列在长上下文检索中的表现会随信息位置按固定周期波动,波动周期与模型采用的KV Cache压缩步长一致。
Black Forest Labs 的 FLUX 3 Image 已在 Vercel AI Gateway 上线,同一个模型即可文生图或编辑图片,只需一个 API key,无需 Black Forest Labs 账号。
JetBrains 发布 Kotlin Toolchain 0.13,并开始推荐其为大多数新 Kotlin Multiplatform 项目的统一入口。
Replit 按用户支出排名位列消费级 AI 应用前 10,但按流量排名却排在倒数 5 名。这说明流量与收入讲的是两个完全不同的故事:很多普通用户不会频繁使用的产品,AI 重度用户却愿意持续付费。
a16z 指出,Replit 按用户支出位列消费者 AI 应用前十,但按流量排在倒数前五,流量与收入呈现出两套不同的故事。AI 重度用户的付费集中在轻度用户不活跃的地方。a16z 同时发布了由 @omooretweets 在 Cosign 整理的 Top 50 Consumer AI Apps by Revenue 完整榜单。
Blind 发布 2026 年软件工程师公司梯队榜,S 级包括 Jane Street、Citadel、Anthropic、OpenAI、NVIDIA、Netflix 和 Palantir。
Blind 公布 2026 年 SWE tier list,S tier 包括 Jane Street、Citadel、Anthropic、OpenAI、Nvidia。
Paraform 的 Talent Density Index 最新版 Top 50 已发布,该指数根据企业吸引、培养并留住高价值人才的能力对创业公司进行排名。文章称,每家创业公司都自认拥有最强团队,而这份数据给出了另一份答案。
一份人才密度榜单显示,前 15 名依次为 SSI、Anthropic、OpenAI、Thinking Machines、Applied Intuition、Modal、Decagon、Pika、Fireworks AI、Cohere、Glean、LangChain、Ramp、Together AI、Cognition。完整榜单由 paraform.com 发布。