任务谱系与算力画像WORKLOAD SPECTRUM
本方案覆盖两类常被混为一谈、但算力画像完全不同的负载:生成式绘图——文生图、图生图 (ControlNet 等结构控制[2])、视频生成,核心是扩散模型的 迭代去噪推理[1];传统 3D 渲染——Blender Cycles 等 路径追踪(path tracing)离线渲染[3],核心是大规模光线求交与 材质采样。前者吃显存与推理优化,后者吃 CUDA 核数与显存带宽:
| 负载 | 单卡显存(经验值) | 算力瓶颈 | 典型产出节奏 |
|---|---|---|---|
| 文生图(SDXL 级) | 1024² 推理 ≈ 10–12 GB | 显存容量、推理优化 | 单图秒级至十秒级 |
| 高质量图(Flux 级) | ≈ 24 GB | 显存容量 | 单图十秒级至分钟级 |
| 视频生成 | 24–48 GB+,多卡常见 | 显存容量与卡间互联 | 片段级,分钟至小时 |
| 3D GPU 渲染 | 随场景规模增长 | CUDA 核数、显存带宽 | 按帧计时长,帧级产出 |
表 1 · 两类负载的算力画像(显存均为经验值/量级参考,以实测为准)
选型前先确认三件事:目标模型与分辨率、批量规模(单张创意还是千张商品图)、 成品规格(是否含序列帧与视频母版)。三者决定显存档位、队列设计与存储方案, 比显卡型号本身更能影响交付节奏。
批量渲染流水线BATCH PIPELINE
批量出图与渲染农场的核心不是 GPU,而是任务队列。参考流水线四段:
图 1 · 批量渲染流水线(Worker 无状态化,状态全部在队列与存储)
队列层必须实现三项能力:断点续跑——视频与长任务按步骤落盘中间态,Worker 崩溃后从断点 继续而非整段重跑;失败重试——显存溢出(OOM)等瞬时失败自动降参重试并记录,连续失败进 死信队列人工介入;按优先级抢占——交付任务与付费用户插队,实验任务在空闲时段消化。 Worker 做成无状态后,扩容就是往池里加机器:GPU 服务器按队列积压量 弹性增减,整机多卡或 GPU 直通场景可选裸机云。
吞吐与并发优化THROUGHPUT TUNING
同样一张卡,吞吐可以差数倍,差距在推理工程而非硬件本身。常用优化手段与适用边界:
| 手段 | 做法 | 收益量级(经验值) | 边界 |
|---|---|---|---|
| 权重量化 | INT8 / INT4 压缩模型权重 | 显存降 30%–60% | 部分模型有质量损失,需抽检 |
| 批处理推理 | 多任务合并 batch | 吞吐提升数倍 | 单任务时延上升,交互场景慎用 |
| 推理加速框架 | TensorRT / xformers 等注意力与图优化[4] | 提速 20%–50% | 版本与模型需匹配验证 |
| 模型常驻 | 权重加载一次驻留显存 | 省去每次数十秒加载 | 多模型混跑需按显存分配 |
表 2 · 吞吐优化手段对比(收益为经验值/量级参考,以实测为准)
并发密度需要权衡:单卡单任务保时延,适合交互式创意场景; 多任务排队保吞吐,适合商品图等批量场景。判断标准是业务按哪种方式计价——交付类业务把 吞吐最大化,单位出图成本最低;设计协作类业务保响应速度,宁可让部分卡处于等待。
存储与传输STORAGE & TRANSFER
渲染业务的存储压力常被低估:PSD 源文件数 GB、序列帧一集数万张、视频母版动辄上百 GB, I/O 模式以大文件顺序读写与突发并发回传为主。三条原则:
- 就近存储:素材与成品放在渲染节点同机房,跨地域拉素材会让 GPU 等磁盘——卡时即租金。
- 大带宽回传:成品交付与客户下载经 大带宽服务器中转, 避免渲染节点的出口带宽被下载流量占满。
- 冷热分层:热数据(当前项目、序列帧工作区)放 NVMe 本地盘;冷数据(历史交付、素材归档) 转大容量归档盘,由物理服务器大容量存储型承接,单位容量成本可降一个量级。
序列帧任务对文件系统的小文件性能与 inode 数量敏感,多台 Worker 共挂网络存储时注意锁与带宽争用; 成品交付前校验帧完整性(编号连续、分辨率与色彩配置一致),可用 FFmpeg 做抽帧比对与转码封装 [5],不合格任务自动重跑。
实施清单CHECKLIST
- 基准测试:固定 seed 与参数跑基准图/基准场景,新机型上线前与现有 Worker 对比出图速度,数据入库作为扩容依据。
- 版本锁定:驱动、CUDA、推理框架版本在 Worker 池内统一锁定,升级先灰度单台验证再铺开。
- 队列监控:积压深度、任务时长 P95、OOM 率三项设告警;积压持续上涨先扩容,而不是调参硬扛。
- 成品校验:序列帧逐帧核验完整性,视频抽帧比对分辨率与时长,不合格任务自动重跑。
- 成本核算:按"千张出图成本 / 每分钟渲染成本"记账,区分实验与交付用量,定价与排期以此为准。
先租 1–2 台目标机型真机实测(本站 GPU 机型支持测试[6]), 用真实模型与场景跑基准,再决定自建规模;GPU 利用率长期低于 40% 时优先合并任务,而不是加卡。
小结SUMMARY
AI 绘图与渲染方案的决策链是:先按负载画像定显存档位,再按批量规模设计队列,最后按成品规格 定存储与带宽。生成式绘图吃显存与推理优化,传统渲染吃 CUDA 核与显存带宽,两类负载可混池但应 分队列调度。吞吐差距来自批处理、量化与模型常驻等工程手段,而非单纯堆卡;素材就近存储、 冷热分层与大带宽回传三件事,决定最终交付节奏。