FlowiseAI 获多位贡献者提交 PR:新增图像上传、结构化 JSON 输出与 OCR 图像加载
FlowiseAI 近期收到贡献者 @aibysid 提交的一系列 PR,为其 AI 智能体可视化构建器加入多项功能。更新包括 ChatOpenRouter 节点支持图像上传、Agent 节点可输出结构化 JSON、新增支持多提供商 OCR 的图像加载器,并改进 Hugging Face 推理 API 集成及删除 AgentFlow 后列表自动刷新等体验。
FlowiseAI 近期收到贡献者 @aibysid 提交的一系列 PR,为其 AI 智能体可视化构建器加入多项功能。更新包括 ChatOpenRouter 节点支持图像上传、Agent 节点可输出结构化 JSON、新增支持多提供商 OCR 的图像加载器,并改进 Hugging Face 推理 API 集成及删除 AgentFlow 后列表自动刷新等体验。
Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。
Gemini 3 Pro 相比 Gemini 2.5 Pro 实现输出保真度跃升,得益于更强的多模态理解与 3D 推理能力。该对比通过两款模型的最佳输出示例直观呈现了这一差距。
Gemini 3 的一项多模态推理测试显示,仅用一张图片作为输入,即可让模型编写出 threejs 体素艺术场景的单页代码,提示词为“我提供了一张图片,请据此创作一个漂亮的体素艺术场景”。该测试由 Ian Goodfellow 分享,用于展示 Gemini 3 的图像理解与代码生成能力。
Monica 现已支持 Sora 2 视频模型,用户可直接在 Monica 内生成 4s / 8s / 12s 视频。官方称实测生成了一段 12 秒、7 个场景的动漫短片,提示词放在评论区。
BAIR 研究者 Trevor Darrell 实验室的论文「Hidden in plain sight: VLMs overlook their visual representations」在加拿大蒙特利尔举行的 COLM 2025 上获得杰出论文奖,作者包括 @xkungfu、@tylerraye、@databoydg。该研究指出视觉语言模型(VLM)会忽略自身的视觉表征。
Lilian Weng 转发 Mira Murati 声明,Thinking Machines Lab 已获 a16z 领投的 20 亿美元融资,NVIDIA、Accel、ServiceNow、CISCO、AMD、Jane Street 等参投。
Barsee 总结了最近 AI 领域最密集的一周,Google 推出 Veo 3,Anthropic 发布 Claude 4,OpenAI 与 Jony 联合推出 IO。此外还有 Apple Glasses 与 Google Glasses、Tesla Optimus 的进展,以及 Anthropic CEO 对 2026 年 AI 的预测。
ChatGPT 支持视觉与语音多模态输入,帮助团队处理图像信息并以更自然的方式沟通。OpenAI 介绍了这两项能力在团队协作场景中的使用方式。
自编码器与扩散模型在学习范式和架构上颇为相似:两者都从输入重建输出、都能学习数据的低维流形,且都用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 作为条件输入,使单套参数即可处理不同噪声水平,并支持以文本提示词生成图像。
Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。