一张有说服力的产品图,可以帮助团队讨论比例、材质与使用场景,却不能自动回答零件如何装配、壁厚是否足够、模具能否脱模。工业设计文生图真正有价值的技术路线,是把开放的视觉探索组织成可控制、可比较、可交接的设计过程。本文结合公开研究,讨论从生成模型到概念评审的技术选择与工程方法。
一、先确定图像需要支持什么决定
以桌面空气净化器为例,早期问题可能是圆柱与方形机身哪个更适合家居环境,中期问题是进风格栅与显示区域如何形成品牌识别,后期问题则是某种表面处理是否容易留下指纹。这三类问题所需的图像证据不同,不宜混进一次提示词,也不宜用同一个“好看程度”评分。
建议先写一张设计任务卡,列出目标用户、放置环境、必须保留的接口、体量范围与允许变化的部分。把内容分为确定约束、待验证假设和自由探索区。例如电源接口位置来自已确认布局,格栅节奏可以探索,而静音性能属于需要实验验证的假设,不能通过画面中的气流特效证明。
任务卡也应标记输入来源。现有产品照片、手绘草图、粗略三维模型和文字描述的可信度并不相同。用草图中的轮廓约束形态,并不意味着草图的透视和尺寸已经准确。记录哪些信息来自实测,哪些只是设计意图,可以防止概念图在后续会议中被当作已经冻结的产品规格。
二、扩散、DiT与Flow Matching处在不同技术层
潜空间扩散模型先借助编码器把图像转换为紧凑表示,再在这个表示中学习生成过程,最后解码成图像。LDM论文给出了这一技术路径,并通过交叉注意力引入文本等条件。对设计工作而言,这解释了为什么图像质量、细节保存和计算成本需要一起考虑;它没有把图像潜变量变成带尺寸约束的实体模型。
DiT讨论的是网络骨干:以Transformer处理潜空间中的图像块,替代常见的U-Net骨干。因此,“使用DiT”和“使用扩散”并不矛盾,也不能据此推断模型一定理解机械结构。论文中的图像生成基准反映特定数据与任务上的表现,不能直接换算为产品孔位正确率或设计人员节省的工作时间。
Flow Matching讨论如何学习概率路径上的向量场,使样本沿生成轨迹从简单分布走向数据分布。它与网络采用何种骨干是不同的选择,也与扩散路径存在联系。选型时更应比较具体模型在同一产品任务上的条件遵循、局部修改稳定性与运行成本,不能仅凭方法名称判断哪个一定更快或更适合工业设计。
三、让文字表达意图,让空间条件表达位置
文字适合表达产品类别、使用语境、风格倾向和材料意图,但“显示屏在上部居中”仍包含很多自由度。屏幕占比、边距以及它与格栅的关系,都可能在生成时改变。对于不能漂移的要素,建议补充轮廓、分区掩码、深度图或来自粗模的视图,让位置要求有明确的空间载体。
ControlNet论文展示了向预训练文生图模型加入边缘、深度、分割等空间条件的路线。这里的“控制”应理解为可学习的条件约束,而不是几何求解器作出的硬性保证。模型可能保留整体轮廓,却改变局部开孔数量;也可能遵循深度的大关系,却给平面增加看起来合理的曲率。
条件之间出现冲突时,应回到任务卡决定优先级。例如文本要求极薄机身,深度条件却来自厚重粗模,继续堆叠形容词通常只会增加不确定性。更可执行的做法是先修改粗模或删除冲突要求,再分别测试文字、空间条件和参考图的影响,并保存每轮输入,避免把偶然结果误认为稳定能力。
四、把方案探索做成可比较的实验
一次生成同时改变轮廓、材料、灯光和镜头,会让团队难以判断究竟是哪项变化带来偏好。建议先固定相机、背景与基础布局,只比较机身比例;随后固定选定比例,再比较格栅和按键;最后进入颜色、材料、表面处理,也就是CMF。这样的分阶段探索能保留明确的设计因果线索。
每个候选应关联模型与版本、输入图、提示词、随机种子、采样设置、编辑区域和人工修改记录。随机种子有助于追踪一次实验,却不是跨模型、跨版本或跨运行环境绝对复现的承诺。团队真正需要的是能解释候选如何形成,能重建主要输入,并能知道下一次试验只改了什么。
比较时应同时保留成功与失败样本。若某条路线总能产生漂亮正面图,却频繁丢失背部接口,这就是需要纳入选型的成本。可以记录一次评审通过的候选比例、必须人工修复的问题类型和修复工时,但应先定义统计口径并在真实任务中测量,不能从公开演示推导业务收益。
五、CMF与局部编辑需要保护设计锚点
把净化器外壳从白色塑料改为深灰金属质感,可能同时改变高光、阴影和边缘对比,让相同轮廓看起来像另一种厚度。CMF比较应尽量保持灯光、视角和曝光一致,并保留一张中性参考图。图像中的金属感只能表达外观意图,不能单凭渲染确定合金、涂层配方或耐磨等级。
局部编辑前先标记设计锚点,例如产品外轮廓、接口中心、品牌标识区域和装配分界。掩码应覆盖需要改变的表面,同时检查边缘过渡。即使工具支持区域编辑,也应把编辑前后叠加比较,确认掩码外的孔位、文字和接缝没有发生漂移;不要把“只改材质”的自然语言要求当作像素冻结功能。
还应区分图像编辑与材料定义。面向概念评审,可以用局部生成迅速比较视觉方向;面向后续渲染,应在三维软件中建立可检查的材质参数;面向实物,需要结合材料样板、色样与供应商工艺讨论。三个阶段可以相互提供参考,但同一张图不能替代所有阶段的验证。
六、几何一致性必须跨视图检查
单张图像中的合理透视,不代表多个视角来自同一几何体。净化器的正面格栅可能有一组竖条,侧视图却多出一道折边;顶面旋钮在不同图中可能改变直径。独立生成几张图再排成三视图,并不能赋予它们投影关系。应明确标注这些是概念参考视图,直到共同几何得到验证。
当任务开始涉及比例冻结,建议建立统一的三维粗模,用同一模型输出轮廓、深度和相机视角,再以此辅助图像生成。检查时先看主体长宽高的相对关系,再看接口、接缝和重复构件的对应位置。对称性应依据设计意图判断,不能为了画面整齐而把真实的非对称结构修成镜像。
即便各视图视觉一致,也只能支持这一层级的判断。若要验证手指可达性、零件干涉或结构承载,需要进入具有尺度和结构定义的模型与相应验证流程。建议把每次评审的结论写成具体状态,例如“外观方向通过,接口尺度待核验”,避免用一个“通过”把未知问题一并隐藏。
七、制造约束应进入设计流程,而不是写成形容词
“可制造”“易装配”不是能够由图像自动兑现的属性。注塑件需要讨论壁厚变化、拔模方向和连接方式;钣金件需要讨论展开、折弯与工具空间。具体要求取决于材料、尺寸、工艺和供应商能力,不能在概念阶段套用一个通用数值,再让生成图看起来满足它。
更实用的方法是建立约束台账。把必须容纳的部件包络、不可侵入区域、装配方向和维修通道作为设计输入,并注明来源与负责人。文生图可以探索这些条件之上的外观,但若图像与约束发生冲突,应修改设计或重新确认条件,而不是依靠视觉修饰掩盖体积不足和连接困难。
以进风格栅为例,密集细缝可能形成精致视觉,但有效通风面积、清洁便利性、结构强度和成型难度仍需分别确认。概念评审可以提出待验证问题,工程人员再通过计算、模型与样件回答。生成阶段的职责是把方向和疑点表达清楚,让后续工作接得住,而不是提前作出量产承诺。
八、用分层验收连接创意与工程
建议把验收分为意图、视觉和工程三个层级。意图层看是否解决任务卡中的问题;视觉层看轮廓、材质、接口和跨视图一致性;工程层看尺寸、结构与工艺证据。前两层通过,可以批准一个概念方向;只有相应工程证据齐备,才能推进对应的工程决策。不同层级应有各自的评审人。
交接包不应只有精选效果图,还应包含任务卡、输入与版本记录、选型理由、已知不一致以及待验证清单。对于局部编辑,应附上编辑区域和保留锚点;对于多视图,应说明是否基于共同粗模。这样,接手者能够区分视觉建议与已确认约束,也能有针对性地补充工作。
文生图的成熟使用方式,是让每一张图都拥有明确用途、来源与证据边界。它可以扩大可讨论的方案范围,帮助设计师更早暴露冲突;最终是否提高效率,要看团队减少了多少无效返工、保留了多少关键约束以及交接是否更清楚。这些结果应由项目记录证明,而不是由一张最漂亮的图替代。
参考资料
- High-Resolution Image Synthesis with Latent Diffusion Models — Rombach et al., CVPR 2022
- Scalable Diffusion Models with Transformers — Peebles and Xie, ICCV 2023
- Flow Matching for Generative Modeling — Lipman et al., ICLR 2023
- Adding Conditional Control to Text-to-Image Diffusion Models — Zhang et al., ICCV 2023
