AIGC:从内容生成到产品交付
# AIGC:从内容生成到产品交付
AIGC(AI-Generated Content)就是让 AI 生成内容。例如输入一段描述生成海报,用商品照片生成三维模型,或者把文案转换成配音。
这里按两个目标学习:做图片,先学怎样出图和控制结果;做三维展示,先学怎样生成模型并放到网页上。 不需要先训练自己的模型。
# 从哪篇开始
- 想自己出图:先看图像生成原理,再用 ComfyUI 跑通一次文生图。
- 想给网站加生图功能:先跑通出图,再看怎样提交任务、显示进度和获取结果。
- 想把商品照片变成可旋转的模型:先看三维基础,再用图生 3D 工具生成,最后接入网页。
- 想做设备数字孪生:在三维展示基础上,再关联真实设备编号、温度和运行状态。
# 学习路线
| 笔记 | 解决的问题 |
|---|---|
| 图像生成原理与控制方法 | 扩散模型、VAE、LoRA、采样器分别做什么,怎样控制构图与局部修改 |
| ComfyUI 工作流实践 | 怎样连接节点完成出图,保存配置并排查错误 |
| Stable Diffusion | WebUI 的使用入口、参数与模型操作 |
| 制作艺术二维码 | 将二维码结构约束与图像生成结合 |
| 把 AI 生图接入网站 | 点击生成后的前后端流程、刷新恢复、超时与重复计费 |
| AI 三维生成与模型基础 | Mesh、NeRF、3DGS、O-Voxel、拓扑与材质是什么 |
| 图生 3D 工具选型与资产验收 | Meshy、Tripo、Hitem3D、Seed3D 等路线怎么比较,如何检查几何、材质与下游可用性 |
| TRELLIS.2 与 Hunyuan3D 本地部署 | CUDA 环境、模型加载、完整推理、纹理与 GLB 导出,显存和扩展编译排错 |
| Blender 资产处理与真实结构重建 | 网格清理、布尔、壁厚、UV、PBR、动画与 CT / MRI 分割 |
| 数字孪生与 Web 三维展示 | 怎样把模型放到网页上,并与真实设备状态关联 |
| AI 三维工具:本地生成、参数化 CAD 与交互设计 | Modly、HiCAD、ForgeCAD、Articraft、GenCAD、Spline、RIIICO 和零件复用分别解决什么问题 |
模型训练单独放在 模型训练与微调。使用生成模型和训练生成模型是两件事:使用 API 或本地模型出图,不代表自己训练了模型。
# 用一个目标串起知识,而不是挨个背工具名
以产品展示为例,可以按下面的产物推进:
| 要完成的目标 | 学习和操作 | 得到什么才算完成 |
|---|---|---|
| 生成商品海报 | 理解扩散和控制方法,在 ComfyUI 保存工作流 | 能复现的图片、参数与输入素材 |
| 让用户自己生成 | 服务端提交工作流、跟踪编号、转存结果 | 页面刷新后仍能找到原任务,不重复提交 |
| 把照片变成旋转模型 | 图生 3D,并在 Blender 检查背面、材质和面数 | 在目标浏览器正常打开的 GLB |
| 做实景展厅 | 准备重建资产,理解 3DGS,使用 Spark 展示 | 可换视角浏览,目标手机上的性能可接受 |
| 做可动机械展示 | 参数化部件、关节轴和运动范围 | 部件可独立运动,装配和碰撞关系合理 |
| 关联真实设备 | 稳定设备 ID、遥测和过期处理 | 数据更新到正确对象,断线不伪装正常 |
这些是可独立选择的业务目标,不要求每个项目都从海报一路做到数字孪生。实际选择取决于需要图片、网格、可编辑 CAD,还是带真实状态的场景。
# 什么时候转去学习训练与微调
现有模型加提示词、参考素材和结构条件仍不能稳定满足目标,并且有合法高质量训练数据时,再考虑训练。训练前先建立评测样例,确认问题出在模型行为,而不是错误输入、工作流或数据缺失。
| 需要解决的问题 | 对应笔记 |
|---|---|
| 分清预训练、SFT、RAG 和微调用途 | 模型训练与微调总览 |
| 理解低秩适配、量化与显存 | LoRA 与 QLoRA |
| 准备数据、划分测试集、判断是否真的提升 | 训练数据与评估 |
| 将训练知识对应到智能客服项目 | 智能客服微调实践 |
| 区分视觉识别与视觉生成 | 视觉任务与 YOLO |
例如客服要查询不断变化的订单,应调用业务接口;要检索产品说明,可以使用 RAG;要稳定遵循回答格式或领域表达,再评估 SFT。不是所有输出不满意,都应该立刻训练模型。
# 一次生成任务经过哪些环节
用户需求与参考素材
↓
选择模型、输入条件和生成参数
↓
生成候选 → 人工或自动验收 → 局部修改
↓
压缩、导出、权限与内容检查
↓
网页、视频、游戏或业务系统使用
2
3
4
5
6
7
8
9
例如制作杯子海报,上传商品图来参考外观,用提示词描述咖啡馆场景,需要固定轮廓时增加结构条件。生成后检查杯把是否变形、商标是否走样;价格、活动日期和二维码再用普通排版工具叠加,避免模型写错。
这也说明 生成得像,不等于事实或结构正确。图片可以用于创意展示;制造尺寸、医疗结构等不能由生成结果自行证明。
# 怎样选择 API、桌面工具和本地部署
| 方式 | 适合的情况 | 主要代价 |
|---|---|---|
| 托管 API | 尽快集成产品,调用量尚不稳定 | 按量费用、数据出境或上传约束、服务方限制 |
| 桌面或网页工作台 | 人工反复调整构图与风格 | 操作记录需要规范化,难以直接承担多人并发 |
| 自建推理服务 | 明确需要私有部署、自定义模型或可控调度 | 显卡、环境、扩缩容、安全和运维成本 |
不要只比较单次价格。最终应比较每张验收合格图片的成本,包括失败、重试、放大和人工修图;本地运行也有显卡折旧、电费和维护成本。
# 视频和语音对应什么功能
图像以外的能力先按产品用途区分,不必把所有工具一次学完:
| 用户想做什么 | 对应能力 | 最直观的检查 |
|---|---|---|
| 让商品图动起来 | 图生视频 | 杯子在运动中是否变形、商标是否漂移、前后帧是否闪烁 |
| 把文案变成配音 | TTS,Text-to-Speech,文本转语音 | 商品名读得对不对,停顿是否自然 |
| 把用户语音变成文字 | ASR,Automatic Speech Recognition,自动语音识别 | 订单号、数字、专有名词是否识别准确;它是识别而不是生成 |
| 让虚拟人物讲解商品 | 数字人、口型驱动和语音生成 | 嘴型是否与声音同步,人物和声音是否有使用授权 |
语音客服通常先用 ASR 听懂用户,再生成回答,最后用 TTS 读出来。用户中途打断时,应停止旧回答的播放,处理新问题;不是把音频从头播到尾。声音克隆还要确认本人授权,不能把技术上可实现等同于有权使用。
# 面试问答
1. AIGC 应用开发是不是接一个模型 API 就够了?参考答案
模型 API 解决内容生成,产品还要解决可控性和交付。比如海报生成,我会把上传素材、生成任务和最终资产分开管理,用异步任务处理长耗时,用参考图和结构条件控制结果,再做内容审核和业务验收。用户最终需要的是可用的海报,而不是接口返回了一张图片。