和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。
上戏毕业的山音与广告公司职员 KK 用两年时间成为 AI 导演,作品登上国内外电影节。他们最常使用的 AI 视频产品是 CapCut Video Studio,同一部片子会混用 Seedance、MiniMax 等多个模型。两人在播客中讨论了 AI 视频产品在底层模型趋同后的壁垒,以及"AI 无限,人生有限"的创作者困境。
在 InfoQ《极客有约》X QCon 直播中,快手鲜嘉麒与爱奇艺路香菊、阿里巴巴邹娟、生数科技郑重讨论 AIGC 内容生产为何难落地:竞争单位已从一个 clip 变成完整生产链路,用户追问人物一致性、商品变形、按时交付与成本可控。真实成本是生成、重试、审核、人工编辑等之和除以合格成片数。
医疗 AI 的万亿价值可能落在三类资产上:Pro Medicus 的影像工作流软件、Tempus AI 的诊断与患者数据、德适科技的医疗影像大模型。三家公司 2026 年 10 月 6 日市值分别约为人民币 780 亿元、875 亿元和 220 亿元。
Eazo 提出对话框并非 Personal Agent 终局:复杂意图先用自然语言表达,需求稳定后沉淀为可点击、可保存、可分享的 Personal Software。
LlamaIndex 开源负责人 Logan Markewich 发文提出"agentic OCR",把文档解析改成循环流程:布局感知阅读顺序、将难处理元素智能路由到合适模型、多轮校验与自我纠正、对图表和复杂表格做多模态解析。传统 OCR 只做一次处理就直接返回文本,表格被压平、图表丢失、多栏布局错乱且无人校验。该方案认为前沿模型在处理成本与延迟上过度设计,却仍在长尾复杂边缘案例上吃力。
Simon Willison 让 Opus 5.5「写一些电脑游戏音乐」,结果远超预期,他因此发问模型是从什么时候开始能创作出像样的音乐。这条帖子获得 133 条回复、310 个点赞和 38064 次浏览。
开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。
Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。
Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才积累的判断力,如今初级员工一出道就得硬扛。
Fable 5.5 整理并生成了人类 40000 年艺术史动画,原作者感叹难以理解抽象的向量矩阵如何输出这些精美动画。其称即便最厉害的动画团队,也不是一两个月能完成的。
Google DeepMind 在播客中探讨内容溯源问题:当 AI 生成内容逼真到难以分辨,如何验证内容由人类、机器还是自然产生。节目介绍了不可感知水印技术,重点讲解 SynthID 用于图像和视频,以及面向生物设计的 SynthID Bio。
有人用 Opus 5.5、Gemini 2.5 Flash、SAM 3.1 和 Ideogram 4.5 组成一套技术栈,分别负责界面、照片分类、图像分割和编辑,全部通过一个 fal API key 跑通,并称过去这需要一整支工程团队才能完成。
在2026网易未来大会上,灵初智能陈源培、OriginFlow秦深涛、万格智元王冠博三位00后创业者对话,谈具身智能落地瓶颈从算法转向算法工程化,创业公司真正的"死亡谷"在50到150人之间,端侧AI可用4G内存推理35B模型、10G内存推理80B模型。
2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。
Perplexity 的 Aravind Srinivas 演示了 Computer(Standard Mode 搭配 Opus 5.5)端到端设计并构建一款浏览器端开放世界游戏,过程中自行租用 GPU、运行 headless Blender、做程序化设计、联网下载素材并设计音频,成本约 2000 美元额度。
Anthropic 的 Opus 5.5 靠纯代码生成品牌宣传片、像素动画,还能操控电脑画图,与 GPT-6 的 Sol 和 Luna 同周发布后,热度持续一周不退。
LlamaIndex 指出,最新前沿 VLM 在表单解析上仍会失误,因为表单不是页面上的文本,而是由分组字段构成的层级结构。其最新博客分析了 VLM 在真实 W-2、1040、W-9 和扫描版 W-4 上的失败点,并给出用 LlamaParse 以更低成本处理这些表单的定制 cookbook。
有用户演示了 Claude Code Opus5.5 可一次性完成租赁图纸到 CAD(JWW、DXF)、再到 Blender 高画质渲染的透视图,并直接生成 Web 共享页面。该帖作者称其能做的事太多,反而让工作推进不下去,并引发结合家具软装生成选品的设想。
Simon Willison 在昨天的演讲中提及今年破纪录的 Kākāpō 繁殖季,并用 Claude Opus 5.5 生成了一段像素风动画作为收尾幻灯片。他称 Claude Opus 5.5 在像素艺术动画上表现出意料之外的强能力。
用 Opus 5.5 做解说视频,只要把参考视频和新主题交给它,就能复刻一条或模仿参考视频的风格。DreW 用 Claude Opus 5.5 做出了这样一条视频,作者直呼「太逆天了,视频模型瑟瑟发抖」。
花叔正在独立进行模型后训练,目标是训出一个具备多模态能力、且在基本文本分类能力上超越 Jev 的开源模型,算是对小米 Mimo-V2.6 公开训练过程的模仿。他预计次日完成全部训练和开源,届时会在 Hugging Face 和 GitHub 上开源模型,并称无论成败都是有趣的尝试。
有人推荐多模态理解直接用 Gemini 3.8 Flash,未给出具体参数、基准分数或价格信息。该内容来自一条社交平台帖子,获得 204 个点赞和约 2 万次浏览。
前沿模型所学习的网页抓取数据中,印度语言内容占比远低于 1%;Sarvam 的文档模型在见到第一张图像前已读取 13 万亿 token 文本,上线四个月即数字化 3500 万页。Perceptron AI 用模型自主决定读取哪些 token,以应对一小时视频约百万视觉 token 中仅约 2% 有真值标注的问题。Meta 则在其三智能体审核流程中过滤大部分视频,压缩相似帧并对热门视频缓存判定结果。
OpenAI 称要让 OpenAI API 在每个价位点都提供最佳模型,并在文本、代码、图像、视频等每种模态上做到最好,希望用户基于此提出好想法并构建产品。该表述未给出具体的模型名称、版本号或发布时间。
阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。
Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才练出的判断力,如今初级员工一出道就得硬抗。
Yann LeCun 重申"自回归 LLM 本身不会通向人类级 AI"依然成立,理由包括当前推理依赖非自回归搜索、自我改进仅在数学和代码等可自动评分的领域有效、多模态助手多用独立训练的编码器。
交互模型正成为一个尚未收敛的热门赛道,Loopit、Reverie AI、SigmaZ AI 等团队各以「交互世界模型」「交互模型」「下一代 AI Interface」等不同称呼切入,Runway 也推出实时角色 Characters、可交互世界 GWM Worlds 和生成交互界面的 Solaris。
Yann LeCun 表示,基于 LLM 的 AI 工具虽然非常有用、人人都在用,但它们本身并不是通向人类级 AI 的路径。他指出,能够理解真实世界的架构并非 LLM,让当前 LLM 系统得以解读图像、视频等真实世界信号的架构组件也不属于 LLM。他同时提到有一场 1 小时的演讲,用结果和证据支撑上述结论。
Yann LeCun 在 X 上回应 @ericxing 时表示,活在 bits 与 tokens 离散世界里的 AI 从业者,并不总能理解真实世界有多混乱。该帖获得 893 次点赞、82 次转发,浏览量 36227 次。
「有点Yi思」第14期邀请「屠龙之术」主理人庄明浩与蚂蚁战投「AGI及支付宝」负责人王盟,复盘2026年AI圈每两月一轮的座次洗牌:Coding、多模态、Agent、价格四张新桌分桌而立。讨论提到美国头部Coding ARR已破10亿美金、Seedance 2.0后情绪面翻转,以及有效成本等于token成本加试错成本与人工纠正。
GPT-6 Astra 用一周时间在 Unreal Engine 中构建出一座曼哈顿城市场景,并能逐条街道精细打磨每个细节。这条演示由 Matt Shumer 发布,被评论者称为「GTA7 is gonna be sick」。
数美万物创始人任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍公司最新发布的 Hi3D 3.0 2048³ 模型。他将数美万物的目标从 Maker OS 推向「制造业 OS」,认为基础模型不会吞噬一切——进入实体制造后仍需能产出「生产级」3D 资产的模型,以及拆件、加连接结构、适配材料设备等后续环节。
李飞飞回应 Jim Fan 关于 World Labs 的讨论时表示,带空间上下文的相机条件世界模型(camera conditioned world model)有大量横向用途,包括用于机器人领域的 real2sim。
Sundar Pichai 受访预测,三年后任何内容都能从任意模态转换为任意模态,回看今天的技术会像看翻盖手机一样原始——YouTube 片段可变博客,newsletter 无需录制即成播客,消费者选择格式,创作者只提供想法、品牌与个性。他认为这会终结"堆量"策略,胜出的创作者将聚焦质量;YouTube 新政策针对的是低质内容而非 AI,内容够好就没人关心它怎么做的。
BBC World Service 推出新纪录片《The Rise of Deepfakes: How AI Changed Porn, Politics, and Reality》,探讨 AI 深度伪造技术对色情、政治与现实认知的影响。该片已在 YouTube 上线,由 Ian Goodfellow 分享。
SpaceXAI 发布 Grok 4.6,直接挑战 OpenAI 和 Anthropic 的顶级模型。Anthropic 正为所有新 Claude 模型添加不可见水印,阿里则发布 2.4 万亿参数的开源权重模型 Qwen3.8 Max。研究者还构建了 Agentic ASR,像人类编辑一样修正语音转文字错误。
Naval 预测,最终所有 UI 都会变成"聊天和手势输入、聊天和视频输出"。该帖获 6975 次点赞、320 次转发和 55.18 万次浏览。