跳到正文

#图像生成

今日 8 条
12月25日周三
  1. OnBoard!AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Comfy 核心中国力量:多模态生成全球狂奔之年,开源与商业化发生了什么

    Comfy 中国社区创始团队发起的 Comfy Community Summit 第二站在东京举办,主理人 AJ、前 Stability AI 工程师 Yizhou、HuggingFace 工程师 Tiezhen 与 TheSEA AI 创始人 Yanjin 共同回顾多模态生成与 ComfyUI 开源社区的兴起。

12月19日周四
  1. Monica_IM(@hey_im_monica)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Monica 推出生成营销图片提示词的 bot

    Monica 上线了一个 bot,可为带文字的营销图片生成提示词,用户可通过 monica.im/share/bot 的分享链接直接试用。该 bot 由 Monica_IM 发布,面向需要为模型撰写营销图片提示词的场景。

7月11日周四
  1. OnBoard!AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! X 十字路口:哪些华人创办的 AI 产品正在"闷声赚大钱"?

    OnBoard! 与播客「十字路口」串台,盘点华人创办、分布在国内、硅谷、新加坡、日本等地的 AI 产品,包括 PictureThis、Speak、UMU、HeyGen、Opus Clip、Monica.im、Devin 等。

12月11日周日
  1. Eugene YanAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Autoencoders 与 Diffusers:简要对比

    自编码器与扩散模型在学习范式和架构上颇为相似:两者都从输入重建输出、都能学习数据的低维流形,且都用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 作为条件输入,使单套参数即可处理不同噪声水平,并支持以文本提示词生成图像。

11月27日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 DALL·E 到 Stable Diffusion:扩散模型、文本条件、引导与潜空间的原理梳理

    扩散模型通过前向加噪、反向去噪生成图像,DALL·E、DALL·E 2、Imagen 到 Stable Diffusion 都基于这一思路。DDPM(2020)将反向过程建模为高斯分布,让神经网络从纯噪声中逐步去噪还原图像,训练时学习预测所加噪声,采样时每个时间步只减去一小部分噪声再补回少量噪声。

6月10日周五
  1. Lilian Weng — Lil’LogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    广义视觉语言模型:四类视觉与语言融合方法综述

    Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。

7月11日周日
  1. Lilian Weng — Lil’LogAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    什么是扩散模型(Diffusion Models)?

    扩散模型受非平衡热力学启发,通过马尔可夫链在 T 步中向数据逐步加入高斯噪声,再学习逆向过程从噪声重建样本,与 VAE、Flow 模型不同,其隐变量维度与原始数据相同。该框架涵盖 diffusion probabilistic models(2015)、NCSN(2019)与 DDPM(2020)。

12月31日周日
  1. Lilian Weng — Lil’LogAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面向初学者的目标检测(第三部分):详解 R-CNN 系列

    R-CNN 系列包含 R-CNN、Fast R-CNN、Faster R-CNN(目标识别)与 Mask R-CNN(图像分割)四个模型。R-CNN 先用 selective search 提出约 2k 个候选区域,再逐区域提取 CNN 特征分类并用回归模型校正边界框,召回率以 IoU 0.3 为界、bbox 回归以 0.6 IoU 为界。该系列还常用非极大值抑制与难负样本挖掘等技巧。

10月29日周日
  1. Lilian Weng — Lil’LogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    图解目标检测 Part 1:梯度向量、HOG 与选择性搜索

    Lilian Weng 在 "Object Detection for Dummies" 系列第一篇中讲解了图像处理的基础概念——图像梯度向量由 x、y 两个方向的偏导数构成,其幅值为 L2 范数、方向为 arctan(g_y/g_x),并可用 Prewitt、Sobel 等卷积核在整张图像上一次性计算,无需逐像素迭代。