Midjourney 办公时间直播房间链接
Midjourney 在 X 上分享了一个办公时间(office hours)直播房间链接 midjourneyofficehours.onrender.com。该条内容互动数据为 3 个点赞、3350 次浏览。
Midjourney 在 X 上分享了一个办公时间(office hours)直播房间链接 midjourneyofficehours.onrender.com。该条内容互动数据为 3 个点赞、3350 次浏览。
字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。
Anthropic 发布 Claude Design,由 Claude Opus 4.7 驱动,在 claude.ai/design 提供左侧聊天、右侧画布界面,产出物为可交互的 React 代码和样式表,并可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。
作者以三轮交互实测 Claude Design,给出从模糊需求到可运行 React 原型的完整过程与边界,可作为判断设计类 AI 工具协作方式的参考。
Opus 4.7 在 Yoruba、Igbo 和 Chichewa 等训练数据较少的语言上显示出提升。Poe 表示,对这些语言及其他语言的使用者来说,该模型将有明显改善。
Anthropic 发布 Claude Opus 4.7,称为目前能力最强的 Opus 模型,能更严谨地处理长时间运行任务、更精确地遵循指令,并在汇报前自行核验输出结果。Alex Albert 补充了他喜欢的几点:擅长异步工作和遵循指令、努力等级(effort levels)让 token 控制更可预测并新增 xhigh 等级、不再对高分辨率图像做降采样、在 UI、幻灯片和文档上的品味明显提升。
在 Brain/DeepMind 工作近 12 年后,Andrew M. Dai 宣布与前 LLM 预训练、数据和多模态负责人共同创立 ElorianAI,定位为首个由这些方向前负责人创立并领导的多模态推理实验室。Ian Goodfellow 称其为自己的前 Brain 同事。
World Labs 为 Marble 推出两项模型更新:Marble 1.1 改善光照与对比度,大幅减少视觉伪影;Marble 1.1-Plus 是面向规模的新模型,可生成更大、更复杂的环境。
Wan 2.7 已在 Poe 全平台应用和 Poe API 上线,单模型集成 Text-to-Video、Image-to-Video、Video Edit、Reference-to-Video 四种视频生成模式,支持多镜头生成、音频驱动输出、首尾帧控制与视频无缝续写。
Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。
阿里巴巴 Wan 2.7-Image 已在 Poe 上线,可从单条提示词生成角色、风格与上下文一致的系列图像,并支持 bounding box 编辑,只重绘指定区域而无需重新生成整张图。用户可在全平台的 Poe app 及 Poe API(poe.com/Wan2.7-Image)中试用。
Veo 3.1 Lite 已在 Poe 上线,是 Veo 3.1 家族中成本更低的视频生成模型,支持原生音频,包括同步对白、音效与环境音。该模型同时支持文生视频和图生视频,延续 Veo 3.1 的提示词遵循与场景理解能力,适用于社交短片、产品演示、分镜、短片及快速创意迭代,可在 Poe 全平台应用及 Poe API(poe.com/Veo-3.1-Lite)试用。
Qwen3.5-Omni Plus 和 Qwen3.5-Omni Flash 已在 Poe 上线,两款模型均可理解文本、图像、音频和视频。Plus 单次会话支持最长 3 小时音频和 1 小时视频,音频输入覆盖 90 多种语言,语音输出覆盖 30 多种语言、共 55 种音色;Flash 提供同样的跨模态理解能力但成本更低,面向高并发处理和多语言语音工作流。
Paul 用 ChatGPT 结合 AlphaFold 为患癌的爱犬设计出一套个性化 mRNA 疫苗方案,被视为 AI 加速个性化医疗的一个缩影。Kevin Weil 借此呼吁,应让这套流程更容易被用于人类,而不只是狗。
World Labs 展示了一个完全由单人创作者构建的赛博朋克世界,使用 1 亿个 Gaussian splats,其中几乎所有表面和结构都由 Marble 生成。李飞飞称这标志着个人能够构建完整世界的时代正在到来。
Google DeepMind 的 Lyria 3 已在 Poe 上线,可依据文本或图片提示词生成最长三分钟的高保真音乐,并能控制人声、流派、情绪和配器。该功能可用于为视频配乐、歌曲创意原型,或把情绪板变成完整成品曲;Poe 全平台应用及 Poe API(poe.com/Lyria-3)均可试用。
央美与"43 Talks"于3月21日联合举办沙龙《不服从的像素:一项关于碳基身份的声像测定》,展出央美学子三天内创作的AIGC作品,并邀请孔德飞、韦万里、卢齐炜三位创作者展播与剖析各自AIGC作品。圆桌环节由杨樾、孔德飞、张凯寓、何梁、韦万里围绕技术与人文、算法与创意、教育与实践展开讨论,何梁以"回到生活之中"总结AI时代美育内核。
小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。
斯坦福李飞飞团队发布 Dream2Flow,用 3D 物体流(3D object flow)打通视频生成与机器人控制,实现开放世界机器人操作。该方法以物体为中心的空间信息作为表征,旨在提升泛化能力,相关工作将亮相 ICRA 2026,项目主页为 dream2flow.github.io。
Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。
Qdrant 发布一套边缘到云端视频异常检测架构,把异常检测重构为向量最近邻搜索,无需针对具体异常类型标注或重训。
World Labs 的 Marble 可将一张图像转化为由数百万 splats 组成的庞大世界,生成从古代遗迹到飞船内部的可大规模探索环境。李飞飞表示,既然想象力没有边界,我们创造的世界也不该有边界。
Google 发布 Gemini Embedding 2 公开预览版,这是 Gemini 家族首个全多模态嵌入模型,可将文本、图像、视频、音频与 PDF 映射到统一向量空间,Qdrant 在发布首日即提供支持。
Lex Fridman 与 Peter Steinberger 的对话现已由 ElevenLabs 完成翻译并配音成德语,可在 YouTube 上通过齿轮图标 > Audio Tracks 切换德语音轨收听。Fridman 称对 AI 打破语言障碍的这一应用充满期待,并称赞 ElevenLabs 在这方面做得最好。
李飞飞转发 World Labs 团队文章并评价称,正如代码一样,3D 正在成为机器与人类的通用接口。World Labs 在文中提出,文本曾是软件的通用接口,而 3D 正成为空间的通用接口,让人和 AI 能够共同生成、编辑、模拟和分享世界。
Lex Fridman 发布与音乐人、制作人 Rick Beato 的对谈,话题涵盖吉他独奏、Django Reinhardt、Miles Davis、贝多芬与巴赫,并在 1:45:27 处讨论 AI 在音乐中的应用,此外还谈及 YouTube 版权投诉与 Spotify。
Sebastian Raschka 按时间顺序盘点了 2026 年 1-2 月发布的 10 个开源权重模型架构,包括 Arcee AI Trinity Large(400B MoE。
AI 领域近几天出现 11 项重要进展,涉及 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等。其中 SeeDance 2.0 热度持续攀升,用户能在一天内生成好莱坞级别的 AI 电影。
Qwen3.5 系列的首个开源权重模型 Qwen3.5-397B-A17B 正式发布,采用混合线性注意力与稀疏 MoE,并进行了大规模 RL 环境扩展训练,官方称解码吞吐量相比 Qwen3-Max 提升 8.6 倍至 19.0 倍。
World Labs 的 Marble 现已向所有用户开放 Advance 模型,支持全景图到可编辑 3D 世界的创建流程。用户可添加窗外场景、改变整个房间的氛围、添加任意植物,或为同一场景生成多个变体。
NVIDIA 推出 14B 世界动作模型 DreamZero,在同一扩散前向过程中联合预测视频与动作,实现对未见任务的零样本泛化和对新机器人的少样本适配。该模型由 NVIDIA 团队完成,作者 Joel Jang 发布了详细介绍。
Jim Fan 团队训练出名为 DreamZero 的机器人基础模型,以世界模型为骨干,具备对新动词、名词和环境的零样本开放世界提示能力,被称为首个 World Action Model(WAM)。
Jina AI 提出在压缩前将嵌入向量转换为球坐标,可把嵌入存储从 240 GB 降到 160 GB,比最佳无损基线还好 25%。重建近似无损,误差低于 float32 机器 epsilon,检索质量不受影响,适用于文本、图像和多向量嵌入,且无需训练、无需码本。
World Labs 发布 World API,让用户能在自己的产品和工作流中直接调用 Marble。此前已有不少人提出这一需求,官方在博客中公布了详情。
MongoDB 在 MongoDB.local San Francisco 2026 上发布 Voyage 4 系列嵌入模型,全部正式可用,共享同一嵌入空间以兼容跨模型调用。
MongoDB Blog 发布 Vision RAG 指南,用多模态嵌入让包含图表和表格的复杂文档变得可搜索,从而省去复杂且昂贵的文本提取。文中指出传统 RAG 主要面向纯文本,企业知识多存于 PDF、幻灯片和图形等多模态格式,用 OCR 或解析工具处理存在工程量大、精度不稳定、规模化成本高的问题;指南介绍 Voyage AI 最新模型如何支撑这一能力,并提供分步实现说明。
Jina AI 发布 VLM 视觉编码器综述,调研 70+ 模型后发现训练方法比规模更关键——训练得当的 400M 编码器性能可超过 6B 模型。原生分辨率对文档类任务尤为重要,多编码器融合也被证实有效。综述还包含分类体系与实践指南,指出编码器侧研究明显不足,业界多沿用 2021 年的 400M CLIP。
Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。
Jina-VLM 在开源 2B 级视觉语言模型中达到 SOTA,八项通用 VQA 基准平均分 72.3 位列第一,在图表、图形和场景文字任务上表现突出。其多语言能力最为亮眼,在 MMMB(78.8)和 Multilingual MMBench(74.3)上均取得同类最佳成绩。
Jina AI 发布 jina-VLM,一款 2B 规模的视觉语言模型,在开源 2B 级 VLM 中的多语言视觉问答和文档理解任务上达到 SOTA。
FlowiseAI 近期收到贡献者 @aibysid 提交的一系列 PR,为其 AI 智能体可视化构建器加入多项功能。更新包括 ChatOpenRouter 节点支持图像上传、Agent 节点可输出结构化 JSON、新增支持多提供商 OCR 的图像加载器,并改进 Hugging Face 推理 API 集成及删除 AgentFlow 后列表自动刷新等体验。