深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?


01  当通用模型撞上“审美之墙”


过去两年,AI生图的参数量与清晰度完成了指数级跨越,但真正面向服装行业却依然面临一个极其尴尬的悖论——当GPT、Gemini等顶尖大模型在通用图像生成上大放异彩时,落地到服装产业的深水区,依然满屏是令人出戏的AI味。通用的SOTA模型做得到了“逼真”,却依然做不好“商业”


这也是通用模型进入行业之后越来越明显的一层能力边界:基础模型决定能力下限,行业Know-how决定商业体验上限。


对应到服装行业,卡点不是算力与参数,而是一堵更难跨越的墙:审美。


这两个字甚至很难被精确定义,却是决定服装行业商业视觉上限的真正变量。首先,服装是一门高度依赖视觉表达的生意。消费者购买的不只是某一种面料或版型,也包括风格、身份认同、生活方式以及由此传递出的情绪。对于服装企业而言,审美不再是模糊的感性体验,它已成为核心的内容生产力、用户转化力与品牌增长力。


前天猫3D试衣负责人、MuseGate创始人渠瑜的判断更直接:“服装行业的第一性是审美,高审美才是入场券。”在他看来审美不是一个模糊概念,而是服装 AI 产品能否真正进入商业场景的门槛。


在商业落地中,这种“审美”首先转化为对视觉表达的极致要求:真。


举个例子,同样是“老钱风”,“经典老钱”和“静奢老钱”在色彩、模特状态、场景选择和画面留白上都有细微差异;同样一件围巾单品,不同材质对于光线、褶皱和垂坠感的要求完全不同,甚至模特的妆容、发型、动作,也要与服装轮廓和品牌调性保持统一。这也是为什么顶级的设计师、造型师、品牌主理人溢价空间极高的原因。


然而,通用模型恰恰卡在了这种长尾、行业Know-how的缺失上。服装行业的审美极其非标且长尾,而这些Know-how根本不存在于公开语料库中。通用AI充其量只能照猫画虎做到“把衣服换上去”,但构图单调、姿势僵硬、背景过渡虚化、材质纹理发糊,人、衣、景三者之间完全缺乏真实场景中服装审美的灵魂。


面对这种困境,单纯增加模型参数或提高分辨率已无济于事。真正的突破口,在于如何将原本依赖人类经验的非标审美拆解、结构化,最终转化为模型可学习、可执行的算法语言。


这件事正在变得越来越迫切。尤其随着消费者审美和流行趋势的变化速度越来越快。从社交媒体热点到某一种穿搭风格走红,品牌捕捉趋势、组织拍摄、完成制作再上线的窗口正在不断缩短,企业对懂行、高质的AI内容生产需求已极为明确。供给与需求的严重错位,恰恰为垂直赛道的创业公司留出了巨大的历史性机会。


深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

Chic-Image生成的商拍级别图像


02 为什么行业模型最难复制的,是数据闭环?


商业化落地是检验行业大模型的唯一标准,但想要真正穿透服装这个万亿级赛道,门槛高得近乎苛刻。行业不缺算法,也不缺美学专家,缺的是把“不可言传的审美”翻译成“技术语言”并最终输出成直观产品的的复合型团队。


这要求三种能力同时成立:足够深的场景理解、足够厚的数据工程,以及真正深入到底层的模型能力。


顺着这三个维度往下看,跑在最前面的MuseGate正是在这种逻辑下撕开了切口。MuseGate此前的发展路径,几乎正好对应了这三层能力的积累:先进入真实场景,再沉淀数据,最后把这些行业经验转化为模型能力。


MuseGate创始人渠瑜是浙江大学人工智能博士,也曾担任天猫3D试衣负责人。团队过去近三年持续围绕服装AI做产品和技术迭代,目前已经服务近 3000 家付费服装企业客户,覆盖大量高频、真实的服装内容生产需求。


规模化的付费客户不仅是商业验证的结果,更构成了模型持续迭代的高频数据入口;场景沉淀得越深,获得的真实反馈就越密集,进化的速度也就越快。


此外,客户本身也是模型持续进化最重要的数据入口之一。MuseGate团队持续积累着服装行业最核心的Know-how,包括面料搭配、模特风格、构图光影乃至不同品牌的审美偏好。这些审美规则随后被进一步结构化、数据化与模型化,沉淀为通用模型极难通过公开语料获取的数据资产。


这也是MuseGate团队过去投入最重的一部分。MuseGate算法负责人王建国向ZP透露,整个数据体系的搭建前后持续了近一年半。第一步并不是简单扩大数据量,而是先从大量高噪声素材中筛出真正具有训练价值的数据。服装图片天然复杂,人物、服饰、背景、姿态、光线和拍摄风格往往相互耦合,如果数据本身不干净,模型最终学到的也可能只是大量表面相关性。


完成基础清洗之后,更棘手的问题才真正出现:如何给“审美”打标签。团队因此需要进一步把审美拆成更细的维度,再邀请品牌搭配师等行业专家参与标注和校准,逐步建立一套相对统一的审美坐标系。随后,专家判断还需要继续被转化成稳定的机器标签和训练信号。


这也解释了为什么行业模型的数据壁垒往往比想象中更重——专家定义标准,工程团队完成结构化抽象,模型不断训练,再回到实际客户中接受检验,新的反馈继续进入下一轮数据迭代。场景越深,反馈越真实,这个循环越难被外部复制。最终沉淀下来的,是一套围绕服装行业持续生长的美学数据基础设施。这正是行业大模型最难被复制的护城河。


03 如何训练出模型的审美能力


在长期积累行业场景与数据之后,MuseGate近期发布了面向服装审美的自研模型Chic-Image,试图把这些来自真实业务中的审美经验,进一步沉淀为底层模型能力。 


MuseGate算法负责人王建国将其中最核心的工作概括为两个字:翻译——把人类难以言传的审美,一层层翻译成数据、评测指标、训练目标和算法能够理解的信号。


这样的判断也与他过去的技术经历有关。他有9年感知理解与视觉生成相关研究经验,先后任职于阿里达摩院、通义实验室和OPPO。早期曾负责阿里云人脸与人体感知理解算法,相关API日调用量达到数千万;此后在阿里鹿班视觉生成算法团队,长期研究图像生成、编辑与图文结合等基础问题。加入OPPO后,他又负责AI中心视觉生成模型方向,并参与打造业内较早落地的人像合影生成功能,上线Reno海外系列手机和ColorOS系统。


从感知理解、视觉生成到大规模产品落地,这些经历都指向同一个问题:模型能力最终要进入真实场景,就必须把人的判断转化成机器能够稳定学习和复现的目标。而审美恰恰是其中最难被量化的一类判断。


但无法被度量的审美是虚无的,训练与评测大模型的前提,是先定义商业美学的标准。所以Chic-Image 的第一步并不是直接训练模型,而是先建立一套属于服装行业自己的审美坐标系。


现有通用图像Benchmark,大多关注语义是否准确、Prompt是否被正确执行、主体有没有生成以及整体视觉质量是否合格。但无法回答服装行业真正关心的问题:人物是否足够自然,衣服有没有质感,人物与服装是否匹配,妆容、场景和构图是否协调,以及最终生成的内容像不像品牌、电商和社交媒体真正会使用的素材。这些差异决定了商业是否成立。


基于此前积累的服装行业数据和专家经验,团队进一步建立了Chic-Image-Dataset以及面向人像美学的T2I Benchmark,将人物、服装、材质、搭配、构图、场景和摄影质感等原本高度主观的判断拆解成可以被持续比较和评估的维度。


这套Benchmark的意义也不仅仅是“测模型”,而是为整个训练过程定义了一条统一的坐标轴:后续无论是SFT监督微调、GRPO(强化学习)还是DPO偏好优化,本质上都需要围绕同一套审美标准持续校准。


定义完审美的标准,下一步才是让模型具备符合标准的内容创作能力。Chic-Image站在基础模型已有视觉能力之上,通过垂直SFT改变模型原本的生成分布,把模型进一步推向真实服装品牌和社交媒体内容的分布。


商业级的图像生成模型需要首先满足构图合理、人体结构正确、文字准确、材质真实,同时要保持足够高的分辨率。关键挑战是,这些目标并不总能在一次生成过程中被同时优化。


为了解决这种“既要又要”的工程冲突,团队提出了 StageFlow 渐进式推理和训练方案,把复杂生成任务拆成三个阶段。第一阶段先在较低分辨率下解决构图和内容问题,确定人物、服装、背景以及主体之间的关系,先把整体画面搭起来。第二阶段集中解决人体结构和文字等高错误率问题,包括手脚、姿态、局部关系以及文字渲染。等整体结构稳定之后,第三阶段再提升分辨率,重点完成面料、纹理、皮肤、光影以及其他高清细节的重建。通过这种分阶段解耦不同目标,可以有效避免所有任务挤在一次生成中相互干扰,同时兼顾推理效率与最终画质。


训练过程中,模型学习的是不同元素之间的组合关系:什么样的人物适合什么样的服装,妆容如何与面料和风格呼应,什么构图适合某类品牌,不同场景下又应该采用怎样的姿态、光线和摄影语言。这一阶段建立的,是模型最基础的一层行业审美先验。


不过这一层距离真正稳定地产出好看的内容仍有距离。在模型蒸馏和训练过程中,视觉信息经常会发生压缩,一些对于人眼非常敏感的细节最容易首先丢失,比如毛衣和针织面料的纹理被抹平;毛孔、皮肤反射和真实细节消失,最终形成一种典型的AI塑料感。


为了解决这种审美坍缩在 SFT 之外,Chic-Image 又搭建了一套更重的 Post-training 体系,让模型进一步学习“什么样的结果更好”。


第一步是蒸馏前的视觉校准针对毛衣织物、高频纹理、局部结构以及真实人脸特征,团队在蒸馏之前先进行针对性强化。此时,GRPO主要负责进一步重建模型的整体视觉表达能力,让模型能够处理更复杂的场景、构图和元素关系。


第二步是模型蒸馏,将多步推理的模型蒸馏为少步推理的模型,提升推理速度和降低推理成本。


第三步是蒸馏后的强化学习,一方面,它需要扩展蒸馏之后被压缩的视觉空间,让模型能够处理更复杂的场景、构图和元素关系;另一方面,也进一步强化了商业图片中非常关键、同时也是生成模型长期难点之一的文字能力。


第四步是DPO负责人像审美的微观对齐聚焦皮肤纹理、毛孔、高光、反射等人眼高度敏感的细节,通过偏好数据持续修正“什么更真实、什么更自然”。到这里,审美才开始真正从行业经验变成模型偏好。


深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

基于SFT、DPO、FSD、GRPO方法生成的图像


最后,Prompt Enhancement又承担了最后一层“翻译”工作。大部分服装商家并不会专业描述镜头、光线、构图、人物姿态和摄影语言。模型却需要将这些简单需求进一步拆解成更加明确的视觉条件。所以,Prompt Enhancement把专业审美能力进一步藏到产品交互背后,让普通用户不需要成为提示词专家,也能够调用模型内部已经形成的服装审美能力。


深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

用户输入提示词增强示意


04 从通用Scaling到Domain Scaling:行业模型的真正壁垒


从数据拆解到架构解耦,Chic-Image的落地最终沉淀为一整套完整的技术栈。如果将这套重构工业生产流程的能力进行分层,它可以清晰地归纳为五层演进架构:垂直数据/Benchmark—StageFlow—垂直SFT—GRPO/DPO偏好优化—Prompt Enhancement。


如果只拆开看其中的技术模块,无论SFT、强化学习还是偏好优化,都不是今天大模型行业陌生的方法。Chic-Image更值得关注的地方,在于它围绕“服装审美”这一垂直目标,重新组织了数据、评测、训练、后训练和推理的整条链路。


这才是行业模型在竞争中的立身之本。在通用模型已经具备较强基础生成能力之后,真正进入行业深水区,考验的是一个团队对行业Know-how的理解深度,以及能否把这种理解持续转化为模型能力,这也是Chic-Image最核心的壁垒。


MuseGate算法负责人王建国将这层壁垒概括为:建立在服装审美 Know-how 之上的模型能力。


在知识管理中,设计师、搭配师和摄影师脑海里那些“只可意会、难以言传”的经验,通常被称为隐性知识(Tacit Knowledge)。相比之下,通用模型更擅长从公开互联网中学习已经被文字、图片和标签显性表达出来的知识,却很难直接获得一个行业内部长期形成的判断标准。


而Chic-Image所做的,正是把这部分隐性知识逐步显性化。


团队通过长期服务服装企业,在真实业务中持续积累对人物、服装、搭配、材质、场景和内容风格的理解;再借助数据工程将这些经验拆解、结构化和数据化,进一步通过模型训练、后训练与基础工程,把原本存在于人的经验中的判断,逐渐写进模型。


从这个角度看,Chic-Image的壁垒来自一整套持续转化行业Know-how的能力:从场景中发现标准,从反馈中沉淀偏好,再从数据中训练出模型能力。


据团队内部测试,在其自建的人像美学与服装垂直评测体系中,Chic-Image在视觉品质等核心指标上已经超过GPT、Gemini、Nano等头部通用模型。单次 Benchmark的领先当然不足以定义长期竞争格局,但至少说明了一件事:在足够垂直、审美标准足够明确的商业场景里,行业模型仍然存在超越通用模型的空间。这才是Chic-Image对行业模型更重要的启示。


深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

chic-image-v1.0、gpt-image-2、gemini-3.1-flash-image、z-image-turbo生成案例对比(从左到右)


深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

各模型在Chic-Image-T2I-Benchmark上的人工评测结果