AIGC:从内容生成到产品交付

# AIGC:从内容生成到产品交付

AIGC(AI-Generated Content)就是让 AI 生成内容。例如输入一段描述生成海报,用商品照片生成三维模型,或者把文案转换成配音。

这里按两个目标学习:做图片,先学怎样出图和控制结果;做三维展示,先学怎样生成模型并放到网页上。 不需要先训练自己的模型。

# 从哪篇开始

  • 想自己出图:先看图像生成原理,再用 ComfyUI 跑通一次文生图。
  • 想给网站加生图功能:先跑通出图,再看怎样提交任务、显示进度和获取结果。
  • 想把商品照片变成可旋转的模型:先看三维基础,再用图生 3D 工具生成,最后接入网页。
  • 想做设备数字孪生:在三维展示基础上,再关联真实设备编号、温度和运行状态。

# 学习路线

笔记 解决的问题
图像生成原理与控制方法 扩散模型、VAE、LoRA、采样器分别做什么,怎样控制构图与局部修改
ComfyUI 工作流实践 怎样连接节点完成出图,保存配置并排查错误
Stable Diffusion WebUI 的使用入口、参数与模型操作
制作艺术二维码 将二维码结构约束与图像生成结合
把 AI 生图接入网站 点击生成后的前后端流程、刷新恢复、超时与重复计费
AI 三维生成与模型基础 Mesh、NeRF、3DGS、O-Voxel、拓扑与材质是什么
图生 3D 工具选型与资产验收 Meshy、Tripo、Hitem3D、Seed3D 等路线怎么比较,如何检查几何、材质与下游可用性
TRELLIS.2 与 Hunyuan3D 本地部署 CUDA 环境、模型加载、完整推理、纹理与 GLB 导出,显存和扩展编译排错
Blender 资产处理与真实结构重建 网格清理、布尔、壁厚、UV、PBR、动画与 CT / MRI 分割
数字孪生与 Web 三维展示 怎样把模型放到网页上,并与真实设备状态关联
AI 三维工具:本地生成、参数化 CAD 与交互设计 Modly、HiCAD、ForgeCAD、Articraft、GenCAD、Spline、RIIICO 和零件复用分别解决什么问题

模型训练单独放在 模型训练与微调。使用生成模型和训练生成模型是两件事:使用 API 或本地模型出图,不代表自己训练了模型。

# 用一个目标串起知识,而不是挨个背工具名

以产品展示为例,可以按下面的产物推进:

要完成的目标 学习和操作 得到什么才算完成
生成商品海报 理解扩散和控制方法,在 ComfyUI 保存工作流 能复现的图片、参数与输入素材
让用户自己生成 服务端提交工作流、跟踪编号、转存结果 页面刷新后仍能找到原任务,不重复提交
把照片变成旋转模型 图生 3D,并在 Blender 检查背面、材质和面数 在目标浏览器正常打开的 GLB
做实景展厅 准备重建资产,理解 3DGS,使用 Spark 展示 可换视角浏览,目标手机上的性能可接受
做可动机械展示 参数化部件、关节轴和运动范围 部件可独立运动,装配和碰撞关系合理
关联真实设备 稳定设备 ID、遥测和过期处理 数据更新到正确对象,断线不伪装正常

这些是可独立选择的业务目标,不要求每个项目都从海报一路做到数字孪生。实际选择取决于需要图片、网格、可编辑 CAD,还是带真实状态的场景。

# 什么时候转去学习训练与微调

现有模型加提示词、参考素材和结构条件仍不能稳定满足目标,并且有合法高质量训练数据时,再考虑训练。训练前先建立评测样例,确认问题出在模型行为,而不是错误输入、工作流或数据缺失。

需要解决的问题 对应笔记
分清预训练、SFT、RAG 和微调用途 模型训练与微调总览
理解低秩适配、量化与显存 LoRA 与 QLoRA
准备数据、划分测试集、判断是否真的提升 训练数据与评估
将训练知识对应到智能客服项目 智能客服微调实践
区分视觉识别与视觉生成 视觉任务与 YOLO

例如客服要查询不断变化的订单,应调用业务接口;要检索产品说明,可以使用 RAG;要稳定遵循回答格式或领域表达,再评估 SFT。不是所有输出不满意,都应该立刻训练模型。

# 一次生成任务经过哪些环节

用户需求与参考素材
    ↓
选择模型、输入条件和生成参数
    ↓
生成候选 → 人工或自动验收 → 局部修改
    ↓
压缩、导出、权限与内容检查
    ↓
网页、视频、游戏或业务系统使用
1
2
3
4
5
6
7
8
9

例如制作杯子海报,上传商品图来参考外观,用提示词描述咖啡馆场景,需要固定轮廓时增加结构条件。生成后检查杯把是否变形、商标是否走样;价格、活动日期和二维码再用普通排版工具叠加,避免模型写错。

这也说明 生成得像,不等于事实或结构正确。图片可以用于创意展示;制造尺寸、医疗结构等不能由生成结果自行证明。

# 怎样选择 API、桌面工具和本地部署

方式 适合的情况 主要代价
托管 API 尽快集成产品,调用量尚不稳定 按量费用、数据出境或上传约束、服务方限制
桌面或网页工作台 人工反复调整构图与风格 操作记录需要规范化,难以直接承担多人并发
自建推理服务 明确需要私有部署、自定义模型或可控调度 显卡、环境、扩缩容、安全和运维成本

不要只比较单次价格。最终应比较每张验收合格图片的成本,包括失败、重试、放大和人工修图;本地运行也有显卡折旧、电费和维护成本。

# 视频和语音对应什么功能

图像以外的能力先按产品用途区分,不必把所有工具一次学完:

用户想做什么 对应能力 最直观的检查
让商品图动起来 图生视频 杯子在运动中是否变形、商标是否漂移、前后帧是否闪烁
把文案变成配音 TTS,Text-to-Speech,文本转语音 商品名读得对不对,停顿是否自然
把用户语音变成文字 ASR,Automatic Speech Recognition,自动语音识别 订单号、数字、专有名词是否识别准确;它是识别而不是生成
让虚拟人物讲解商品 数字人、口型驱动和语音生成 嘴型是否与声音同步,人物和声音是否有使用授权

语音客服通常先用 ASR 听懂用户,再生成回答,最后用 TTS 读出来。用户中途打断时,应停止旧回答的播放,处理新问题;不是把音频从头播到尾。声音克隆还要确认本人授权,不能把技术上可实现等同于有权使用。

# 面试问答

1. AIGC 应用开发是不是接一个模型 API 就够了?参考答案

模型 API 解决内容生成,产品还要解决可控性和交付。比如海报生成,我会把上传素材、生成任务和最终资产分开管理,用异步任务处理长耗时,用参考图和结构条件控制结果,再做内容审核和业务验收。用户最终需要的是可用的海报,而不是接口返回了一张图片。