和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
Min Choi 仅用一条提示词加上 OpenAI 一篇 722 页 AI 数学论文的 URL,就让 Opus 5.5 生成了一段 92 秒的动态图形讲解视频。该演示展示了模型在长文档理解与视频生成上的能力。
作者仅提供一个提示词和论文页面 URL,就让 Opus 5.5 把 OpenAI 的 722 篇 AI 数学论文浓缩成一段 92 秒的动态图形解说视频。它展示的是单一提示词加链接输入下,模型对大规模论文集合做压缩并生成动态解说内容的效果。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
Liquid AI 的决策模型 d1 已在 AI Gateway 上线,可针对分类、路由和评分任务对共享状态与类型化问题做评估,直接返回带概率的结构化答案而不生成文本 token,并具备图像视觉支持。该模型可通过 AI SDK 决策 API、OpenAI 兼容 Decisions API 或 TypeSafe 兼容 API 调用,模型标识为 liquid/d1,决策调用会出现在日志中并计入预算。
本·阿弗莱克创办的电影 AI 公司 InterPositive 专为电影拍摄和后期开发 AI 工具,Netflix 于 2026 年 3 月宣布收购,SEC 10-Q 文件显示这笔现金收购约 5.87 亿美元,团队加入 Netflix,阿弗莱克继续担任高级顾问。
Milvus 3.0 发布演示,针对图表、箭头、空间关系密集的 PDF,改用查询 token 嵌入与页面视觉 patch 嵌入的 late interaction 检索,打分公式为 score(Q, P) = Σᵢ maxⱼ cosine(qᵢ, pⱼ),为每个查询 token 匹配页面最相关区域后再合成页面级得分,保留细粒度视觉信号到比较时刻。
Nano Banana 2.1 在 Image Arena 三个模式均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
Google 本周集中公布多项更新:SynthID.com 检测门户面向全球开放英文版,可验证图像、视频或音频是否由 Google 及行业伙伴的 AI 生成。
西湖大学特聘研究员李昊阳在《AI4S 实战派》第十五期直播中讲解如何用 AI 从 H&E 病理切片预测空间转录组分子信息,梳理了判别式建模、扩散模型与流匹配等生成式方法,以及 UNI、GigaPath、CONCH、OmniCLIP 等病理基础模型和对齐工作。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
洪恩2026年第二季度营收1.734亿元(2560万美元),同比下降约17.8%,净亏损1750万元,由盈转亏,当季平均MAU为2072万。国内端通过原创英语学习IP“俩喵”强化英语素养生态,其小红书官方账号粉丝已超30万,并在iHuman英语App中新增俩喵英语模块;国际端以Aha World为核心引入《盖比的娃娃屋》专属模块。财报已纳入5月底以9400万元收购的全知识与万词王业务。
Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。
UNICUS创始人徐豪透露,团队基于过去真实订单沉淀的100多万条结构化3D数据,自研出3D制造模型U1,可生成带内部结构和制造约束的拼插玩具,而非Meshy、混元那类只有表面外壳的3D模型。
Min Choi 给 Opus 5.5 一条提示词加一段音乐,12 小时后醒来看到它生成的结果。他随后在 X 上发布了这段视频。
生数科技推出视频模型 Vidu Q4 Preview,作为 Vidu Q4 面向创作者的首个预览版本,首发价格 0.09 元/秒起,并支持最多 15 张参考图、参考音色输入和 2K、4K 画质输出。
模力工场联合极客邦科技旗下 InfoQ、极客时间、AI 原住民、OPC 举办的 1024 AI 社区日将于 2026 年 10 月 24 日在杭州云谷中心举行,首批报名已开启。
Utopai Studios 基于 MiniMax H3 后训练出定制视频模型 Utopai X,在 Artificial Analysis“带音频文生视频”榜单以 1150 Elo 排名全球第二,音画同步与物理表现位列第一。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
Anthropic 的 Claude Science 首次完成全天紫外波段成像。它协调多个 AI 智能体下载并校准多个太空任务的数据、完成合并,并用 inpainting 补全缺失区域,测试中预测与实测平均偏差约 10%。此前因臭氧层阻挡紫外线、只能从太空观测,NASA 的 GALEX 任务仅覆盖约三分之二天空且跳过了明亮恒星形成区。
苹果将于美国东部时间10月13日在纽约举行"Welcome Home"特别活动,智能家居中枢设备有望成为主角;10月27日前后预计还将推出首款触控屏MacBook Pro及新Mac、iPad。新任CEO约翰·特努斯上任一个月,已推动设计与工程团队直通CEO、并购团队划归财务部门,并弱化春秋两季固定发布周期、借助AI提升研发效率。
生数科技开放新一代视频生成旗舰模型 Vidu Q4 预览版,最高支持 4K 直出,单次最多可用 15 张参考图和 3 段参考音频,单条最长 16 秒。实测 720P 生成 GTA 6 风格《邪恶老奶》一分钟仅 5.4 元,6 条共 110 秒视频花费不到 10 元。MaaS 端 720P 约 0.6 元/秒、1080P 约 0.75 元/秒,SaaS 端预览版阶段有两个月限时优惠。
MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。
AI 音频公司 Sonilo 完成 1100 万美元融资,由 B Capital 领投、Redpoint 参投。在最新公布的基准测试中,Sonilo 在与其他 AI 音频模型的 40 项一对一对比中胜出 34 项。本轮资金将用于提升音频质量、扩充授权音乐并加强与日常创作工具的集成。
Google 宣布 SynthID Detector 即日起面向全球英文用户开放,任何人都可以检查图像、视频或音频文件是否由 AI 生成。该工具可识别来自 Google 及其合作伙伴(包括 OpenAI、NVIDIA、Kakao,Apple 即将加入)的 AI 内容。
Cloudflare 的 Clef(27B)和 Clef Flash(9B)两款开源决策模型已可在 OpenRouter 上使用。用户可输入文本、JSON 或图像,模型返回带概率的类型化答案而非生成文本。定价为 Clef 每百万输入 token $0.24、Clef Flash $0.09,输出免费。
Perplexity Decider v1.1 现已上线 OpenRouter,这是 Perplexity 的开源权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。
阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。
Haiku 5.5 在绘制骑自行车的鹈鹕上明显优于近一年前发布、成本贵 10 倍的 Claude Haiku 4.5。作者同时贴出了 Haiku 4.5 的生成结果作对比。
Francois Laberge 用 OpenAI 的 Decisions API 做手势识别,借助其视觉理解能力,准确率明显超过此前基于 Jev 的演示,速度也更快。他称这是 Decisions API 的一个很好的应用案例。
NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。
OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。
Perplexity 开源 pplx-embed-v2-late,这是面向文本与图像的多向量嵌入模型,提供 9B 和 0.6B 两个版本并共享同一嵌入空间。其中 9B 可用于索引多模态数据,0.6B 可用于端侧查询,还支持无需 OCR 直接搜索 PDF 页面。官方称其在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%,权重已在 Hugging Face 发布。
OpenAI 宣布为 GPT-6 推出 Intelligent UI,模型可根据用户问题自行决定如何组合文本、视觉内容和交互元素。回复中可包含用于解释概念的图形与图表,也能加入按钮、表单等可直接在对话中操作的交互体验。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团正式发布全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 超长上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。
Jerry Liu 发布 OpenDocRouter,一个面向文档解析的统一 API,可在同一接口与计费体系下比较并使用各家 OCR 模型。它覆盖从 MinerU 等轻量开源模型到前沿 VLM(如 Opus 5.5),按成本提供模型并只收取小额交易费用,同时处理各家模型的速率限制,还提供边界框和版面分析服务。新 OCR 模型发布后会在 ParseBench 上评测并加入,自动路由等功能正在开发中。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
全球最大独立 AI 原生影视公司 Utopai Studios 正以自研视频模型 Utopai X 与制片平台 PAI 推进多部院线长片,定制视频模型 Utopai X 曾在 Artificial Analysis 文生视频盲评榜排到全球第二、全美第一。