Diffusion / Latent Diffusion:生成式媒体架构
Diffusion 的核心价值不是“模型会画图”,而是把视觉生成拆成可控制、可采样、可评测的逐步去噪过程。Latent Diffusion 进一步把昂贵的像素空间生成搬到压缩 latent space,使高分辨率生成进入可产品化成本区间。
Diffusion / Latent Diffusion 与生成式媒体系统
Source Anchors
| Source | Link | 读它要抓住什么 |
|---|---|---|
| DDPM | https://arxiv.org/abs/2006.11239 | 为什么可以通过“加噪再去噪”学习数据分布 |
| Improved DDPM | https://arxiv.org/abs/2102.09672 | 噪声调度、采样质量和 likelihood 的改进 |
| Classifier-Free Guidance | https://arxiv.org/abs/2207.12598 | 如何在无显式分类器条件下增强 prompt 服从度 |
| Latent Diffusion Models | https://arxiv.org/abs/2112.10752 | 为什么在 latent space 生成能显著降低成本 |
| Stable Diffusion / LDM Code | https://github.com/CompVis/latent-diffusion | LDM 工程生态、条件控制和图像生成链路 |
| DALL-E 2 | https://arxiv.org/abs/2204.06125 | CLIP latent、文本条件图像生成和生成式媒体产品形态 |
核心导读
Diffusion 的核心价值不是“模型会画图”,而是把视觉生成拆成可控制、可采样、可评测的逐步去噪过程。Latent Diffusion 进一步把昂贵的像素空间生成搬到压缩 latent space,使高分辨率生成进入可产品化成本区间。
生成式媒体系统的架构重点,是把 prompt、输入素材、模型版本、采样参数、安全过滤、品牌审核、版权证据、人工批准和发布审计连成受控流水线。模型负责生成候选,系统负责约束事实、权利、品牌、风险和发布责任。
核心问题
视觉生成系统要解决的不是单纯“从文本生成图片”。在企业环境中,系统必须同时满足质量、控制、成本、审计和发布责任:图片要可用于营销、培训、商品展示或教育材料;结果要贴合 brief、品牌规范、产品事实和监管语言;用户需要探索空间,但系统不能允许虚假承诺、侵权素材或误导性图像进入客户可见渠道。
早期生成模型在质量、多样性、训练稳定性和控制性之间存在明显取舍。GAN 可以生成逼真图片,但训练不稳定、容易 mode collapse,也不天然适合细粒度文本条件控制。自回归图像模型可以把图片视为 token 序列,但高分辨率生成成本很高。Diffusion 把问题改写为逐步去噪:不是一次性画完,而是从噪声开始,在多个时间步中逐步逼近真实数据分布。
Latent Diffusion 进一步把生成过程搬进压缩表示空间。像素空间每一步都昂贵,latent space 保留主要语义、布局和纹理,同时显著降低计算量。这使生成式媒体从研究演示进入产品系统,也让 text-to-image、image editing、inpainting、outpainting、variation 和品牌模板化生产有了可落地的成本基础。
金融零售系统真正关心的不是模型是否“有创意”,而是创意能力能否被事实来源、权限、授权、审批和监控约束。一个可用的生成式媒体系统必须回答:输出中的产品条款来自哪里,参考素材是否有授权,图片是否会误导客户,谁批准发布,事故后是否能追溯并撤回。
论文和技术贡献
DDPM 的贡献是把扩散模型表述成清晰的概率建模过程。训练时,系统从真实图片开始,按时间步逐渐加入高斯噪声;模型学习在任意噪声程度下预测噪声或恢复干净样本。生成时,系统从纯噪声开始,反复调用模型去噪,最终得到样本。这把复杂图像生成拆成许多局部去噪任务。
Improved DDPM 说明噪声调度、variance parameterization 和采样策略会显著影响质量与效率。这对生产系统很重要,因为采样步数、速度、质量和成本不是论文外的实现细节,而是上线时必须管理的产品参数。
Classifier-Free Guidance 把条件生成中的“服从 prompt”做成可调机制。模型同时学习有条件和无条件的去噪;生成时组合两者预测,让输出更靠近文本条件。guidance scale 因此成为体验和风险参数:低 guidance 更开放、多样;高 guidance 更贴 prompt,但可能更僵硬、过饱和、伪影更多,甚至放大不当暗示。
Latent Diffusion Models 的贡献是把 diffusion 放在 autoencoder 压缩后的 latent space。高分辨率像素空间生成昂贵,latent space 让系统以更低成本生成、编辑和扩展图片。Stable Diffusion 的生态影响正来自这一点:生成链路可以围绕文本编码器、去噪 U-Net、autoencoder、safety checker、upscaler 和编辑模块组合演进。
DALL-E 2 一类系统展示了图文 embedding、prior、decoder 和生成模型组合后的产品形态。它提醒我们,生成式媒体通常不是单一模型,而是多模型、多阶段流水线。
机制原理:前向加噪与反向去噪
Diffusion 的训练从前向过程开始。给定一张真实图片,系统按时间步逐渐加入噪声;早期时间步仍保留结构,晚期时间步接近纯噪声。模型训练目标通常是预测被加入的噪声,或等价地预测去噪后的样本。
clean image
-> add small noise
-> add more noise
-> nearly pure noise
生成过程反向进行:
random noise at step T
-> denoise one step
-> denoise one step
-> ...
-> generated image at step 0
每一步只做相对局部的修正,大量局部修正叠加后形成全局一致的图片。这解释了 diffusion 的稳定性:它不要求模型一次性决定所有像素,而是把生成拆成逐步逼近数据分布的路径。代价是采样成本,步数越多、分辨率越高、多候选越多,GPU 成本和延迟越高。
机制原理:条件控制与 Guidance
文本到图像生成需要把语言条件注入去噪过程。典型链路是 prompt 经过 text encoder 得到 embedding,denoising model 在每个时间步使用这个 conditioning 影响去噪方向。条件不是生成前的一次性标签,而是在每个去噪阶段反复参与决策。
prompt
-> text encoder
-> text embedding / conditioning
-> denoising model uses conditioning at each step
-> generated image
Classifier-Free Guidance 可以理解为比较两种预测:无 prompt 时模型会怎样去噪,有 prompt 时模型会怎样去噪,然后朝条件方向推得更强。guidance scale 越高,系统越强迫结果服从条件,但“更服从”不等于“更正确”。
| Guidance 设置 | 典型效果 | 生产风险 |
|---|---|---|
| 低 | 多样、开放、探索性强 | 可能偏离 brief |
| 中 | 质量和服从度较平衡 | 仍需审核 |
| 高 | 更贴 prompt、风格更强 | 过饱和、伪影、夸张暗示、训练分布外行为 |
在金融营销素材中,高 guidance 可能更贴合“premium credit card lifestyle”,也可能放大财富承诺暗示。在商品展示中,高 guidance 可能更努力画出指定商品,也可能生成并不存在的颜色、配件或尺寸。因此 guidance 不应作为无边界用户参数,而应被封装在模板、风险等级和审核策略中。
机制原理:Latent Diffusion
Latent Diffusion 把图像生成分成两个问题:先学习压缩空间,再在压缩空间中运行 diffusion。autoencoder 把图片编码成 latent,再从 latent 解码回图片;denoising model 在 latent space 中完成逐步去噪。
image -> encoder -> latent
latent + noise schedule -> denoising diffusion
final latent -> decoder -> image
这带来三个架构后果。第一,生成成本变成可管理变量,同样预算下可以生成更多候选、支持更高分辨率或开放更多编辑工作流。第二,生成系统可以模块化,文本编码器、去噪模型、autoencoder、safety checker、upscaler、inpainting 和后处理可分别演进。第三,压缩会带来信息损失,细小文字、标识、复杂手部、精确图表、票据细节和产品部件容易出错。
这也是金融零售不应让 diffusion 直接生成证据图片、合同截图、真实账单、费率表或产品条款图的原因。视觉可以是辅助表达,事实不能由模型想象。
为什么有效
Diffusion 有效的第一层原因是训练目标稳定。预测噪声是密集监督任务,每张训练图片可以在多个噪声时间步产生训练样本,模型学到的是从不同污染程度恢复数据结构,而不是在生成器和判别器之间进行脆弱博弈。
第二层原因是逐步生成降低了单步复杂度。图像的全局结构、局部纹理和细节修正可以在多个采样步骤中逐渐形成,这比一次性生成完整图片更容易覆盖复杂分布。
第三层原因是条件可以在每个去噪阶段反复注入。文本、图像、mask、边缘、深度、姿态和布局都可以作为控制信号参与中间过程,比“生成完再修正”更有效。
第四层原因是 latent space 降低了计算维度。压缩表示让模型把算力集中在语义和视觉结构上,再由 decoder 恢复像素级输出。
第五层原因是生态可组合。一旦生成过程被拆成 encoder、conditioner、denoiser、decoder 和 checker,产品系统就可以围绕它建设模板、工作流、审核、缓存、版本、A/B 和成本控制。
从模型到生成式媒体流水线
企业系统不能把生成式图像能力设计成孤立的 prompt 输入框。更合理的设计是把生成过程纳入内容供应链:
flowchart TB
B[Creative brief / task request] --> P[Prompt template and policy]
P --> A[Approved asset registry]
A --> G[Generation service]
G --> S[Safety and content filters]
S --> R[Rights / brand / product-claim review]
R --> H[Human approval when required]
H --> V[Asset version registry]
V --> PUB[Publishing workflow]
PUB --> M[Monitoring and feedback]
| Component | 责任 |
|---|---|
| brief intake | 表达业务目标、渠道、受众和风险等级 |
| prompt template | 固化品牌语言、禁止内容、事实来源和场景边界 |
| asset registry | 管理 logo、商品图、授权图片、字体、色彩、风格参考和使用期限 |
| generation service | text-to-image、image-to-image、inpainting、variation、upscale |
| safety filters | 处理成人、暴力、仇恨、自伤、欺骗性图像和敏感身份暴露 |
| rights review | 检查输入授权、输出相似性、来源证据和 AI 标注要求 |
| brand review | 检查 logo、色彩、语气、免责声明、产品定位和不可承诺事项 |
| asset version registry | 保存 prompt、model、seed、input assets、review result、approver、发布和撤回记录 |
这里的架构重点不是“图片生成 API”,而是生成输出进入真实业务生命周期后的责任链。
局限和误用
Diffusion 的第一类局限是事实不可控。模型擅长生成看起来合理的视觉结构,但不保证产品、价格、条款、库存、账单、证件、商户名或日期真实。凡是信用卡利率、保险赔付金额、贷款额度、促销折扣、资格条件和监管披露,都必须来自业务系统。
第二类局限是精细文本和标识不可靠。图像模型常生成伪文字、错误 logo、错别字、扭曲图表或不真实 UI。金融说明图、监管披露、产品费率表和 app 截图不能由纯生成模型直接产出。
第三类局限是版权、肖像和风格边界复杂。用户上传参考图、品牌素材或竞品视觉时,系统需要判断授权范围;“生成相似风格”在内部草稿和公开投放中的风险完全不同。
第四类局限是偏见和刻板表达。金融教育、反欺诈宣传、财富管理和信贷场景容易在年龄、职业、地域、性别和族裔呈现上形成不当模式。
常见误用包括:
- 生成或修改证据图片。
- 把生成图片当成真实商品或真实客户场景。
- 用 AI 生成的 UI 截图承诺尚未上线功能。
- 在未授权参考图基础上生成公开广告。
- 允许客户在无审核下生成银行卡、证件、账单或营销海报。
- 用安全过滤替代版权、品牌、产品事实和人工审批。
架构/产品价值
生成式媒体的价值来自降低创意迭代成本,而不是取消治理。成熟系统可以支持 brief-to-concept、controlled variation、localized creative、image editing、asset governance 和 risk routing。
| 能力 | 系统价值 |
|---|---|
| brief-to-concept | 把营销和培训需求快速转成候选视觉方向 |
| controlled variation | 在同一品牌、商品和渠道约束下生成多版本 |
| localized creative | 根据地区、语言、节日和门店场景生成本地化素材 |
| image editing | 背景替换、尺寸扩展、局部修复和版式探索 |
| asset governance | 让每个输出带有来源、授权、版本和审批记录 |
| risk routing | 按客户可见性、监管敏感性和发布渠道分层审核 |
产品设计的关键不是开放所有参数,而是把参数映射到用户能理解的任务:渠道、内容类型、风险等级、事实来源和审批路径。这样,diffusion 能力才从创作工具变成企业内容供应链的一部分。
金融零售系统案例
Retail Marketing Creative Studio
零售银行、信用卡、保险和电商平台都需要大量视觉素材,例如节日活动海报、信用卡权益场景图、门店培训插图、商品搭配图和社媒素材。Diffusion 可以缩短从 brief 到候选图的时间,但必须把“视觉创意”和“业务事实”分离。
marketing brief
-> approved offer data
-> prompt template
-> generated visual background
-> deterministic overlay of rates / dates / disclaimer
-> brand and legal approval
-> asset registry
图片可以表达场景、情绪和构图;价格、利率、返现比例、库存、资格条件、活动期限和免责声明必须来自正式系统。
Financial Education Content
反欺诈教育、预算管理、信用评分解释、退休规划和贷款风险提示都需要图像辅助。生成式图像适合制作插图、流程背景、场景化学习材料和多语言版本视觉,但主要风险是图文组合产生错误暗示。例如养老金教育不能暗示保证收益,信用教育不能让用户误以为某个动作一定提升评分。
教育内容应由知识库和合规文本先定义 claim,再让图像服务生成支持性视觉。审核不只看安全分类,还要检查视觉是否改变了文字的合规含义。
Product Visualization and Retail Catalog
零售商品图可以用 diffusion 做场景化展示、背景替换和风格统一。例如同一款家电可以生成厨房、客厅、门店陈列和节日促销背景。但商品真实性必须被保护,模型不能改变颜色、配件、比例、接口、屏幕内容或包装标识。
系统应把真实商品图锁定为主体,把生成能力限制在背景、光照和非关键道具。输出用于电商详情页时,还应与 product information management、库存和价格系统联动。
Claims, Disputes and Evidence Handling
理赔、支付争议、KYC、欺诈调查和投诉证据场景要格外谨慎。生成式图像不应创建或替换证据;证据图片可以做只读查看、脱敏、增强可读性、标注和分类。任何增强都必须保留原图、处理步骤、处理参数、操作者和时间戳。
allowed:
classify image type
redact PII
improve readability with logged non-destructive transform
create separate explanatory illustration
not allowed:
generate missing evidence
replace damaged evidence
modify transaction receipt content
synthesize customer identity documents
如果需要生成示意图,必须明确标记为 illustration,不能混入 evidence bundle。
Branch and Contact Center Training
培训材料适合用生成式媒体,系统可以生成客户沟通场景、风险识别示意、流程说明图和角色扮演素材。风险在于培训图像会影响员工判断:如果长期用同一种形象表达“欺诈受害者”“高净值客户”“逾期客户”或“新移民客户”,会形成隐性偏见。因此评测应覆盖人群多样性、场景多样性和语言适配。
评测与上线门禁
生成式媒体评测不能只问“好不好看”。至少要覆盖以下层次:
| 维度 | 评测问题 |
|---|---|
| prompt adherence | 输出是否满足 brief 和约束 |
| visual quality | 构图、清晰度、伪影、文字和局部细节是否可用 |
| product correctness | 是否编造产品、价格、功能、库存或收益暗示 |
| brand compliance | logo、色彩、语气、字体、免责声明是否符合规范 |
| safety | 是否包含禁止内容或可滥用内容 |
| rights | 输入素材和输出资产是否有授权证据 |
| privacy | 是否暴露客户数据、真实肖像或敏感场景 |
| bias and representation | 人群、职业、地域和场景呈现是否失衡 |
| workflow value | 是否减少迭代时间、返工次数和人工制作成本 |
上线门禁应按风险分层:内部草稿允许更宽探索空间,但要防止敏感素材泄露;内部培训需要品牌和偏见审核;客户可见营销需要产品事实、法务、合规和发布审计;监管敏感内容必须绑定正式条款、批准记录和撤回机制。
关键指标包括 approval rate、revision rounds、unsafe output rate、product-claim violation rate、rights exception rate、brand deviation rate、time-to-approved-asset 和 post-publication incident rate。评测集要包含 hard negatives,例如相同卡面但不同权益、相似商品但不同规格、旧版促销条款、未授权 logo、看似普通但带敏感身份暗示的场景。
学习验证
读完这组论文后,应能完成以下验证任务:
-
画出 text-to-image 生成式媒体流水线,标明 text encoder、denoising model、autoencoder、safety checker、asset registry 和 human approval 的位置。
-
为信用卡营销素材设计 prompt template,要求产品权益、活动期限和免责声明都来自系统字段,而不是由模型生成。
-
写一个 guidance scale 实验方案,比较低、中、高 guidance 下的 prompt adherence、视觉质量、品牌偏差和产品事实错误。
-
为商品背景替换设计编辑边界,说明哪些区域允许生成、哪些区域必须锁定真实像素。
-
为 claims evidence 场景写一份禁止清单,区分 evidence enhancement、annotation、redaction、illustration 和 synthetic evidence。
-
设计生成式媒体 eval set,至少包含 brand hard negatives、rights hard negatives、product claim hard negatives 和 bias slices。
-
写一个 ADR,比较外部生成 API、私有部署开源模型、混合模式三种方案在隐私、成本、质量、审计和供应商风险上的取舍。
-
为 asset registry 设计字段:prompt、model version、seed、input assets、license、reviewer、approval status、publication channel、retention period 和 withdrawal link。
关键结论
Diffusion 把生成问题转成逐步去噪,Latent Diffusion 把这个过程压缩到更经济的 latent space,Classifier-Free Guidance 让条件服从度变成可调参数。这些技术共同让生成式媒体产品成为可能,但金融零售真正的难点不是会不会生成图片,而是能否把生成能力纳入内容供应链、事实来源、权限、版权、品牌、合规、人工审批和审计。
模型输出只是候选资产。可发布资产必须有来源、有版本、有批准、有撤回路径,也必须证明没有编造产品事实、侵犯权利或误导客户。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。