返回 Papers
AI 底层逻辑 / 经典论文

Diffusion / Latent Diffusion:生成式媒体架构

Diffusion 的核心价值不是“模型会画图”,而是把视觉生成拆成可控制、可采样、可评测的逐步去噪过程。Latent Diffusion 进一步把昂贵的像素空间生成搬到压缩 latent space,使高分辨率生成进入可产品化成本区间。

282ai-foundations/papers/33-diffusion-latent-diffusion-generative-media.md

Diffusion / Latent Diffusion 与生成式媒体系统

Source Anchors

SourceLink读它要抓住什么
DDPMhttps://arxiv.org/abs/2006.11239为什么可以通过“加噪再去噪”学习数据分布
Improved DDPMhttps://arxiv.org/abs/2102.09672噪声调度、采样质量和 likelihood 的改进
Classifier-Free Guidancehttps://arxiv.org/abs/2207.12598如何在无显式分类器条件下增强 prompt 服从度
Latent Diffusion Modelshttps://arxiv.org/abs/2112.10752为什么在 latent space 生成能显著降低成本
Stable Diffusion / LDM Codehttps://github.com/CompVis/latent-diffusionLDM 工程生态、条件控制和图像生成链路
DALL-E 2https://arxiv.org/abs/2204.06125CLIP latent、文本条件图像生成和生成式媒体产品形态

核心导读

Diffusion 的核心价值不是“模型会画图”,而是把视觉生成拆成可控制、可采样、可评测的逐步去噪过程。Latent Diffusion 进一步把昂贵的像素空间生成搬到压缩 latent space,使高分辨率生成进入可产品化成本区间。

生成式媒体系统的架构重点,是把 prompt、输入素材、模型版本、采样参数、安全过滤、品牌审核、版权证据、人工批准和发布审计连成受控流水线。模型负责生成候选,系统负责约束事实、权利、品牌、风险和发布责任。

核心问题

视觉生成系统要解决的不是单纯“从文本生成图片”。在企业环境中,系统必须同时满足质量、控制、成本、审计和发布责任:图片要可用于营销、培训、商品展示或教育材料;结果要贴合 brief、品牌规范、产品事实和监管语言;用户需要探索空间,但系统不能允许虚假承诺、侵权素材或误导性图像进入客户可见渠道。

早期生成模型在质量、多样性、训练稳定性和控制性之间存在明显取舍。GAN 可以生成逼真图片,但训练不稳定、容易 mode collapse,也不天然适合细粒度文本条件控制。自回归图像模型可以把图片视为 token 序列,但高分辨率生成成本很高。Diffusion 把问题改写为逐步去噪:不是一次性画完,而是从噪声开始,在多个时间步中逐步逼近真实数据分布。

Latent Diffusion 进一步把生成过程搬进压缩表示空间。像素空间每一步都昂贵,latent space 保留主要语义、布局和纹理,同时显著降低计算量。这使生成式媒体从研究演示进入产品系统,也让 text-to-image、image editing、inpainting、outpainting、variation 和品牌模板化生产有了可落地的成本基础。

金融零售系统真正关心的不是模型是否“有创意”,而是创意能力能否被事实来源、权限、授权、审批和监控约束。一个可用的生成式媒体系统必须回答:输出中的产品条款来自哪里,参考素材是否有授权,图片是否会误导客户,谁批准发布,事故后是否能追溯并撤回。

论文和技术贡献

DDPM 的贡献是把扩散模型表述成清晰的概率建模过程。训练时,系统从真实图片开始,按时间步逐渐加入高斯噪声;模型学习在任意噪声程度下预测噪声或恢复干净样本。生成时,系统从纯噪声开始,反复调用模型去噪,最终得到样本。这把复杂图像生成拆成许多局部去噪任务。

Improved DDPM 说明噪声调度、variance parameterization 和采样策略会显著影响质量与效率。这对生产系统很重要,因为采样步数、速度、质量和成本不是论文外的实现细节,而是上线时必须管理的产品参数。

Classifier-Free Guidance 把条件生成中的“服从 prompt”做成可调机制。模型同时学习有条件和无条件的去噪;生成时组合两者预测,让输出更靠近文本条件。guidance scale 因此成为体验和风险参数:低 guidance 更开放、多样;高 guidance 更贴 prompt,但可能更僵硬、过饱和、伪影更多,甚至放大不当暗示。

Latent Diffusion Models 的贡献是把 diffusion 放在 autoencoder 压缩后的 latent space。高分辨率像素空间生成昂贵,latent space 让系统以更低成本生成、编辑和扩展图片。Stable Diffusion 的生态影响正来自这一点:生成链路可以围绕文本编码器、去噪 U-Net、autoencoder、safety checker、upscaler 和编辑模块组合演进。

DALL-E 2 一类系统展示了图文 embedding、prior、decoder 和生成模型组合后的产品形态。它提醒我们,生成式媒体通常不是单一模型,而是多模型、多阶段流水线。

机制原理:前向加噪与反向去噪

Diffusion 的训练从前向过程开始。给定一张真实图片,系统按时间步逐渐加入噪声;早期时间步仍保留结构,晚期时间步接近纯噪声。模型训练目标通常是预测被加入的噪声,或等价地预测去噪后的样本。

clean image
  -> add small noise
  -> add more noise
  -> nearly pure noise

生成过程反向进行:

random noise at step T
  -> denoise one step
  -> denoise one step
  -> ...
  -> generated image at step 0

每一步只做相对局部的修正,大量局部修正叠加后形成全局一致的图片。这解释了 diffusion 的稳定性:它不要求模型一次性决定所有像素,而是把生成拆成逐步逼近数据分布的路径。代价是采样成本,步数越多、分辨率越高、多候选越多,GPU 成本和延迟越高。

机制原理:条件控制与 Guidance

文本到图像生成需要把语言条件注入去噪过程。典型链路是 prompt 经过 text encoder 得到 embedding,denoising model 在每个时间步使用这个 conditioning 影响去噪方向。条件不是生成前的一次性标签,而是在每个去噪阶段反复参与决策。

prompt
  -> text encoder
  -> text embedding / conditioning
  -> denoising model uses conditioning at each step
  -> generated image

Classifier-Free Guidance 可以理解为比较两种预测:无 prompt 时模型会怎样去噪,有 prompt 时模型会怎样去噪,然后朝条件方向推得更强。guidance scale 越高,系统越强迫结果服从条件,但“更服从”不等于“更正确”。

Guidance 设置典型效果生产风险
多样、开放、探索性强可能偏离 brief
质量和服从度较平衡仍需审核
更贴 prompt、风格更强过饱和、伪影、夸张暗示、训练分布外行为

在金融营销素材中,高 guidance 可能更贴合“premium credit card lifestyle”,也可能放大财富承诺暗示。在商品展示中,高 guidance 可能更努力画出指定商品,也可能生成并不存在的颜色、配件或尺寸。因此 guidance 不应作为无边界用户参数,而应被封装在模板、风险等级和审核策略中。

机制原理:Latent Diffusion

Latent Diffusion 把图像生成分成两个问题:先学习压缩空间,再在压缩空间中运行 diffusion。autoencoder 把图片编码成 latent,再从 latent 解码回图片;denoising model 在 latent space 中完成逐步去噪。

image -> encoder -> latent
latent + noise schedule -> denoising diffusion
final latent -> decoder -> image

这带来三个架构后果。第一,生成成本变成可管理变量,同样预算下可以生成更多候选、支持更高分辨率或开放更多编辑工作流。第二,生成系统可以模块化,文本编码器、去噪模型、autoencoder、safety checker、upscaler、inpainting 和后处理可分别演进。第三,压缩会带来信息损失,细小文字、标识、复杂手部、精确图表、票据细节和产品部件容易出错。

这也是金融零售不应让 diffusion 直接生成证据图片、合同截图、真实账单、费率表或产品条款图的原因。视觉可以是辅助表达,事实不能由模型想象。

为什么有效

Diffusion 有效的第一层原因是训练目标稳定。预测噪声是密集监督任务,每张训练图片可以在多个噪声时间步产生训练样本,模型学到的是从不同污染程度恢复数据结构,而不是在生成器和判别器之间进行脆弱博弈。

第二层原因是逐步生成降低了单步复杂度。图像的全局结构、局部纹理和细节修正可以在多个采样步骤中逐渐形成,这比一次性生成完整图片更容易覆盖复杂分布。

第三层原因是条件可以在每个去噪阶段反复注入。文本、图像、mask、边缘、深度、姿态和布局都可以作为控制信号参与中间过程,比“生成完再修正”更有效。

第四层原因是 latent space 降低了计算维度。压缩表示让模型把算力集中在语义和视觉结构上,再由 decoder 恢复像素级输出。

第五层原因是生态可组合。一旦生成过程被拆成 encoder、conditioner、denoiser、decoder 和 checker,产品系统就可以围绕它建设模板、工作流、审核、缓存、版本、A/B 和成本控制。

从模型到生成式媒体流水线

企业系统不能把生成式图像能力设计成孤立的 prompt 输入框。更合理的设计是把生成过程纳入内容供应链:

flowchart TB
    B[Creative brief / task request] --> P[Prompt template and policy]
    P --> A[Approved asset registry]
    A --> G[Generation service]
    G --> S[Safety and content filters]
    S --> R[Rights / brand / product-claim review]
    R --> H[Human approval when required]
    H --> V[Asset version registry]
    V --> PUB[Publishing workflow]
    PUB --> M[Monitoring and feedback]
Component责任
brief intake表达业务目标、渠道、受众和风险等级
prompt template固化品牌语言、禁止内容、事实来源和场景边界
asset registry管理 logo、商品图、授权图片、字体、色彩、风格参考和使用期限
generation servicetext-to-image、image-to-image、inpainting、variation、upscale
safety filters处理成人、暴力、仇恨、自伤、欺骗性图像和敏感身份暴露
rights review检查输入授权、输出相似性、来源证据和 AI 标注要求
brand review检查 logo、色彩、语气、免责声明、产品定位和不可承诺事项
asset version registry保存 prompt、model、seed、input assets、review result、approver、发布和撤回记录

这里的架构重点不是“图片生成 API”,而是生成输出进入真实业务生命周期后的责任链。

局限和误用

Diffusion 的第一类局限是事实不可控。模型擅长生成看起来合理的视觉结构,但不保证产品、价格、条款、库存、账单、证件、商户名或日期真实。凡是信用卡利率、保险赔付金额、贷款额度、促销折扣、资格条件和监管披露,都必须来自业务系统。

第二类局限是精细文本和标识不可靠。图像模型常生成伪文字、错误 logo、错别字、扭曲图表或不真实 UI。金融说明图、监管披露、产品费率表和 app 截图不能由纯生成模型直接产出。

第三类局限是版权、肖像和风格边界复杂。用户上传参考图、品牌素材或竞品视觉时,系统需要判断授权范围;“生成相似风格”在内部草稿和公开投放中的风险完全不同。

第四类局限是偏见和刻板表达。金融教育、反欺诈宣传、财富管理和信贷场景容易在年龄、职业、地域、性别和族裔呈现上形成不当模式。

常见误用包括:

  • 生成或修改证据图片。
  • 把生成图片当成真实商品或真实客户场景。
  • 用 AI 生成的 UI 截图承诺尚未上线功能。
  • 在未授权参考图基础上生成公开广告。
  • 允许客户在无审核下生成银行卡、证件、账单或营销海报。
  • 用安全过滤替代版权、品牌、产品事实和人工审批。

架构/产品价值

生成式媒体的价值来自降低创意迭代成本,而不是取消治理。成熟系统可以支持 brief-to-concept、controlled variation、localized creative、image editing、asset governance 和 risk routing。

能力系统价值
brief-to-concept把营销和培训需求快速转成候选视觉方向
controlled variation在同一品牌、商品和渠道约束下生成多版本
localized creative根据地区、语言、节日和门店场景生成本地化素材
image editing背景替换、尺寸扩展、局部修复和版式探索
asset governance让每个输出带有来源、授权、版本和审批记录
risk routing按客户可见性、监管敏感性和发布渠道分层审核

产品设计的关键不是开放所有参数,而是把参数映射到用户能理解的任务:渠道、内容类型、风险等级、事实来源和审批路径。这样,diffusion 能力才从创作工具变成企业内容供应链的一部分。

金融零售系统案例

Retail Marketing Creative Studio

零售银行、信用卡、保险和电商平台都需要大量视觉素材,例如节日活动海报、信用卡权益场景图、门店培训插图、商品搭配图和社媒素材。Diffusion 可以缩短从 brief 到候选图的时间,但必须把“视觉创意”和“业务事实”分离。

marketing brief
  -> approved offer data
  -> prompt template
  -> generated visual background
  -> deterministic overlay of rates / dates / disclaimer
  -> brand and legal approval
  -> asset registry

图片可以表达场景、情绪和构图;价格、利率、返现比例、库存、资格条件、活动期限和免责声明必须来自正式系统。

Financial Education Content

反欺诈教育、预算管理、信用评分解释、退休规划和贷款风险提示都需要图像辅助。生成式图像适合制作插图、流程背景、场景化学习材料和多语言版本视觉,但主要风险是图文组合产生错误暗示。例如养老金教育不能暗示保证收益,信用教育不能让用户误以为某个动作一定提升评分。

教育内容应由知识库和合规文本先定义 claim,再让图像服务生成支持性视觉。审核不只看安全分类,还要检查视觉是否改变了文字的合规含义。

Product Visualization and Retail Catalog

零售商品图可以用 diffusion 做场景化展示、背景替换和风格统一。例如同一款家电可以生成厨房、客厅、门店陈列和节日促销背景。但商品真实性必须被保护,模型不能改变颜色、配件、比例、接口、屏幕内容或包装标识。

系统应把真实商品图锁定为主体,把生成能力限制在背景、光照和非关键道具。输出用于电商详情页时,还应与 product information management、库存和价格系统联动。

Claims, Disputes and Evidence Handling

理赔、支付争议、KYC、欺诈调查和投诉证据场景要格外谨慎。生成式图像不应创建或替换证据;证据图片可以做只读查看、脱敏、增强可读性、标注和分类。任何增强都必须保留原图、处理步骤、处理参数、操作者和时间戳。

allowed:
  classify image type
  redact PII
  improve readability with logged non-destructive transform
  create separate explanatory illustration

not allowed:
  generate missing evidence
  replace damaged evidence
  modify transaction receipt content
  synthesize customer identity documents

如果需要生成示意图,必须明确标记为 illustration,不能混入 evidence bundle。

Branch and Contact Center Training

培训材料适合用生成式媒体,系统可以生成客户沟通场景、风险识别示意、流程说明图和角色扮演素材。风险在于培训图像会影响员工判断:如果长期用同一种形象表达“欺诈受害者”“高净值客户”“逾期客户”或“新移民客户”,会形成隐性偏见。因此评测应覆盖人群多样性、场景多样性和语言适配。

评测与上线门禁

生成式媒体评测不能只问“好不好看”。至少要覆盖以下层次:

维度评测问题
prompt adherence输出是否满足 brief 和约束
visual quality构图、清晰度、伪影、文字和局部细节是否可用
product correctness是否编造产品、价格、功能、库存或收益暗示
brand compliancelogo、色彩、语气、字体、免责声明是否符合规范
safety是否包含禁止内容或可滥用内容
rights输入素材和输出资产是否有授权证据
privacy是否暴露客户数据、真实肖像或敏感场景
bias and representation人群、职业、地域和场景呈现是否失衡
workflow value是否减少迭代时间、返工次数和人工制作成本

上线门禁应按风险分层:内部草稿允许更宽探索空间,但要防止敏感素材泄露;内部培训需要品牌和偏见审核;客户可见营销需要产品事实、法务、合规和发布审计;监管敏感内容必须绑定正式条款、批准记录和撤回机制。

关键指标包括 approval rate、revision rounds、unsafe output rate、product-claim violation rate、rights exception rate、brand deviation rate、time-to-approved-asset 和 post-publication incident rate。评测集要包含 hard negatives,例如相同卡面但不同权益、相似商品但不同规格、旧版促销条款、未授权 logo、看似普通但带敏感身份暗示的场景。

学习验证

读完这组论文后,应能完成以下验证任务:

  1. 画出 text-to-image 生成式媒体流水线,标明 text encoder、denoising model、autoencoder、safety checker、asset registry 和 human approval 的位置。

  2. 为信用卡营销素材设计 prompt template,要求产品权益、活动期限和免责声明都来自系统字段,而不是由模型生成。

  3. 写一个 guidance scale 实验方案,比较低、中、高 guidance 下的 prompt adherence、视觉质量、品牌偏差和产品事实错误。

  4. 为商品背景替换设计编辑边界,说明哪些区域允许生成、哪些区域必须锁定真实像素。

  5. 为 claims evidence 场景写一份禁止清单,区分 evidence enhancement、annotation、redaction、illustration 和 synthetic evidence。

  6. 设计生成式媒体 eval set,至少包含 brand hard negatives、rights hard negatives、product claim hard negatives 和 bias slices。

  7. 写一个 ADR,比较外部生成 API、私有部署开源模型、混合模式三种方案在隐私、成本、质量、审计和供应商风险上的取舍。

  8. 为 asset registry 设计字段:prompt、model version、seed、input assets、license、reviewer、approval status、publication channel、retention period 和 withdrawal link。

关键结论

Diffusion 把生成问题转成逐步去噪,Latent Diffusion 把这个过程压缩到更经济的 latent space,Classifier-Free Guidance 让条件服从度变成可调参数。这些技术共同让生成式媒体产品成为可能,但金融零售真正的难点不是会不会生成图片,而是能否把生成能力纳入内容供应链、事实来源、权限、版权、品牌、合规、人工审批和审计。

模型输出只是候选资产。可发布资产必须有来源、有版本、有批准、有撤回路径,也必须证明没有编造产品事实、侵犯权利或误导客户。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。