工程 · 图像推理

ProsGrow 如何实现每小时生成 59,881 张 FLUX.2 图像变体

ProsGrow 在八张 GPU 上实测达到每小时 59,881 张 FLUX.2 图像变体,采用三次短时基准测试中的最低值。单 GPU 精度优化带来的 32.5% 提升,以及节点级性能分析,共同促成了最终选定的双变体工作流。

· 更新于 · ProsGrow AI 工程团队 · 阅读约 6 分钟

FLUX.2 Klein:单 GPU 吞吐量从 BF16 的 1.333 张图像/秒提升至 NVFP4 的 1.766 张图像/秒,增幅 32.5%。

整个图像服务共同决定容量

商品目录团队需要将通过审核的图像变体交付到工作流中。服务包含提示词编码、去噪、解码、API 处理、PNG 编码和输出保存。模型执行加快后,限制交付能力的环节也会改变。

ProsGrow 使用 FLUX.2 Klein 4B 测量了这一完整路径。在条件一致的单 GPU 对比中,原生 NVFP4 将吞吐量提高了 32.5%。随后的挑战来自共享基础设施:使单张 GPU 最快的配置,在整个节点部署后反而变慢。对这一反转进行性能分析后,我们选定的服务配置达到了实测每小时 59,881 张图像变体的速率。

受控的精度对比

基线 · ComfyUI BF161.333 张图像/秒
ProsGrow 配置 · 原生 NVFP41.766 张图像/秒 · +32.5%
一张 RTX PRO 6000 Blackwell GPU。使用相同的 ComfyUI 工作流、1024×1024 输出、四步采样、每个请求一张图像,客户端计时截至 PNG 保存完成。
相同 GPU、ComfyUI 工作流及输出交付计时边界
指标BF16 基线原生 NVFP4
平均请求耗时0.750 s0.566 s
吞吐量1.333 张图像/秒1.766 张图像/秒 · +32.5%
观测到的设备显存占用约 18 GiB约 11.6 GiB

官方 NVFP4 检查点来自 Black Forest Labs,ComfyUI 提供原生量化执行路径。ProsGrow 验证了预期精度路径确已启用,保持工作流不变,并将计时持续到 PNG 保存完成。除吞吐量提高外,结果还实现了请求延迟降低 24.5%。

更低的显存占用为工作重叠执行创造了空间,但仅靠精度调整并不能充分利用整个节点。首次 NVFP4 部署采样到的GPU 计算单元活跃度仅为 52.5%。这促使我们进一步研究调度,以及 GPU 操作之间的主机端处理阶段。

局部最优在节点规模下失效

ComfyUI 串行处理工作流队列。让独立常驻工作进程重叠执行,可以在其他请求处理 API 流量、PNG 编码或文件系统输出时,继续执行 GPU 工作。在独占 GPU 上,增加重叠程度提高了利用率和吞吐量。

这一趋势并未延续到节点规模。当所有 GPU 争用同一批主机资源时,单 GPU 最快的配置仅达到每小时 46,759 张图像。较低拥挤度的服务拓扑在保守的重复测试中达到每小时 57,540 张图像。低功耗平台期与主机、API、PNG 或文件系统阶段的停顿相符,但跟踪数据并未确定某一个组件是唯一原因。

这是核心的系统经验:局部最优不等于节点级最优。更高的单 GPU 利用率可能加剧其他位置的资源争用。ProsGrow 根据同步节点测量选择服务拓扑,综合考虑已完成输出、显存占用和多次运行间的波动。

为明确的创意工作流衡量容量

创意工作流通常需要同一素材的多个版本。针对这一服务约定,ProsGrow 评估了每个请求为同一提示词生成两个变体的方式。所选配置以三次同步节点运行的最低值计,达到每小时 59,881 个变体,比此前保守节点速率高出 4.07%,运行间的差幅为 1.61%。

容量单位很重要:生成的变体并不代表不同的提示词。客户端复用受控提示词并改变噪声种子,ComfyUI 缓存仍可使用。这一结果并未测量持续输入不同新提示词,或每次请求都重新编码提示词的情况。

全部 2,880 个实测输出均已核对,未命中所选错误标记。每次运行约 57 秒。这为客户试点提供了实测起点;持续到达的请求、排队和客户验收仍决定最终可用容量。

容量对成本意味着什么

明确需求和服务要求后,容量即可为成本研究提供依据。在现有价值 $100,000 的节点、付费需求占 10%的情景下,实测速率对应每年售出 52.46 百万个变体。年度基础设施成本模型约为 $40,058,对应每个售出变体 $0.000764。

该情景假定三年摊销、每年 5% 维护费、每年 8,760 小时、电价 $0.10/kWh、1.30 的用电乘数,以及服务器空闲功耗 1.016 kW、活跃功耗 6 kW。它不包含人力、业务运营、网络、存储和服务储备。在据此作出采购决策前,必须验证需求和输出验收率。

所选配置还测得每张图像消耗 0.0571 Wh 的 GPU 板卡电能,不含主机和冷却。这两项数据都基于重复提示词、双变体的任务约定,不能证明与托管服务具有相同的质量或成本。

选择生产环境运行方案

对于批量创意工作流,每小时通过验收的变体数量是一个有用目标。交互式工具还需要低请求延迟和应对突发流量的余量。工作进程重叠执行会消耗显存和共享主机容量,因此所选配置必须为输入处理、存储、重试和预期请求到达率留出空间。

这一实测过程将精度验证、服务性能分析和节点级验证联系起来,使客户下一步的决策具体化:具有代表性的提示词组合,能否在满足质量要求和交付时限的同时保持容量提升?这是规划私有端点规模的依据。

方法与局限

  • 硬件和软件:一台配备八张 RTX PRO 6000 Blackwell GPU 的节点,每张 GPU 标称显存 96 GB;ComfyUI 0.32.0、comfy-kitchen 0.2.30、PyTorch 2.11.0、CUDA 13.0。NVFP4 检查点版本为 1db2b2f7。
  • 工作负载:FLUX.2 Klein 4B、1024×1024 输出、四个 Euler 步骤,以及受控的棚拍产品照片提示词。条件一致的精度对比每个请求生成一张图像;所选节点配置每个请求生成两个变体。重复提示词和可用缓存限制了对多样化客户流量的推断。
  • 计时:计时前已加载模型并完成预热。条件一致的 ComfyUI 对比包含 API 排队/轮询开销、提示词编码、去噪、VAE 解码、PNG 编码和保存,每种精度测量 30 个请求。更早的一项 Diffusers 结果不含 PNG 编码,不作为精度对比基线。
  • 节点汇总与重复测试:所选速率以总输出数除以共同时间窗口,即首个实测客户端开始到最后完成的时间。所选速率为三次短时运行的最低值,每次产生 960 个输出;相对于其单 GPU 速率的八倍,扩展效率为 92.49%。此前将各工作进程速率相加的结果不作为条件一致的节点基线。这些测量不能确立持续生产运行的 SLA。
  • 质量:对八个选定输出进行了目视检查。所有输出均为构图合理且包含可读指定标签的产品照片;六张标签清晰且完全正确,一张增加了小字,一张增加了标点伪影。这一基本检查不能证明广泛的量化质量、提示词遵循程度、排版、安全审核或客户验收表现。

测量于 2026年8月12日至21日进行。未对托管 API 的质量、运行可靠性和总成本进行等价性测试。

通过 ComfyUI 进行私有 FLUX.2 图像生成

对于计划使用 FLUX.2 Klein 和 ComfyUI 进行私有图像生成的团队,这项基准测试有助于围绕创意工作流所需的变体数量和交付期限规划处理能力。每小时图像变体数和请求延迟回答的是不同的规划问题。部署时应使用有代表性的提示词确认性能,并统计满足质量要求的输出。

优化团队实际使用的图像工作流

请提供有代表性的提示词集、变体数量、质量门槛和交付目标。我们会在相同输出约定下,对比基线与经过优化的私有服务。

洽谈试点