过去一年,AI 行业最确定的故事属于 Coding。
从 Copilot 到 Vibe Coding,再到今天的 Agentic Coding,代码是第一个 被 AI 真正「打穿」的工业级垂直行业。几乎所有模型公司都挤进了这条赛道,模型的迭代节奏以月为单位。关键在于 Coding 不仅是 Token 的吞吐,更能直接交付结果。
然而,在几乎所有注意力都涌向 Coding 时,商汤押注了另一个赛道。
在 2026 世界人工智能大会发布上,商汤发布了 SenseNova U1 Pro,将其定位为面向长程任务的交付级原生多模态Agent基座,而它的第一站,瞄准了设计行业。
AI 生图已经火了两年多,从 Midjourney、DALL·E 到 Nano Banana、GPT-Image,生成的图惊艳归惊艳,离真正能用始终差一口气,商业化空间有限,专业工作流进不去,更多人把它当玩具。
商汤对 U1 Pro 的判断是,当 AI 图片可以稳定交付的时候,用户的价值闭环就打通了。设计赛道正在逼近和 Coding 相同的临界点。而判断谁能跑出来的标准不是模型跑分,是工业级的「交付率」。接下来几个月,这个赛道可能会发生很大的变化。
01
从「生成模型」到「创作模型」,交付的鸿沟在哪
什么叫「交付级」?
商汤联合创始人、首席科学家林达华举了一个例子:「一张海报上有 100 个字,错了 1 个字,你大概率不敢把它满大街去贴。但在传统生图评价里,100 个字错 1 个字,模型得 99 分。对交付来说,100 个字错 1 个字,那就是 0 分。」
这就是交付的鸿沟。传统评测按维度平均打分,「细节逼真度」「构图合理性」各占几分,模型拿个综合高分并不难。但在真实商业场景下,一张图有一处硬伤就不能用,客户不会买单。
为了解决这个问题,商汤给出的方法很直接。团队组织了 200 位美院学生和设计师,面对模型生成的每张图片,只回答一个问题:「如果你是一名设计师,你愿不愿意把这张图交给客户?」
获得肯定回答的图片比例超过 60%,模型才算达到交付级。
按这个标准去测,今年上半年之前的各类生图模型,交付率都是个位数。近期发布的商业化模型,包括一些热门产品,也低于五成。目前达到这条交付线的模型只有 U1 Pro 和 GPT Image 2。
同样是生图,为什么 U1 Pro 能过线?
林达华的回答很直接:「这是一个创作模型,不是一个生成模型。」
区别在于过程。传统生成模型的逻辑是给一个 prompt,直接出一张图,中间没有过程,用户能做的只有换个 prompt 重新生成,也就是所谓的「抽卡」。U1 Pro 的工作方式完全不同,更像一个真实的设计师在工作:接到需求后,先思考用什么版式,画出草图,退后一步看是否符合意图,调整版式,然后逐区填入内容,最后整体调色和精修。
整个过程是多步迭代的 Agentic Generation Loop,每一步都包含理解、判断和修正。虽然用户看到的只是最终成品,但背后模型已经经历了数十轮的自我反思和优化。
林达华把它类比为 Coding Agent:「Coding Agent 构建一个 software,也不是一步 build 出来的,是经过若干步思考、反馈、迭代,一步一步构造出复杂软件。我们的模型也一样,你可以理解为它就是一个数字空间里的设计师。」
在技术层面,这种能力来自 U1 Pro 的核心架构特征:理解、生成、行动在同一个模型内统一。它不是多个模型拼接协作,而是一个模型在不断调用自身的不同能力,省去了模块间频繁传递和「翻译」信息的损耗。而且 U1 Pro 可支持原生 8K 分辨率输出(GPT Image 2 只能到 4K),在中文渲染与东方美学细节上做了定向的强化学习机制训练。

现场展示的长图,限于尺寸,只显示全图。
在 WAIC 现场展示的一幅 4:1 超宽画幅的水墨风长卷很好的证明了这点。这幅跨越九年历程的长卷,包含海量文字、地标以及各种高密度信息。U1 Pro 很好的完成了成品交付。从这个角度看,U1 Pro 想得很清楚:从「给我一张图」,走向「替我完成一次设计交付」。
02
统一架构、分层策略与「沿途下蛋」
设计能否成为商汤的竞争优势,首先取决于底层技术路线能不能转化为更高的迭代效率。
U1 Pro 使用 NEO-unify 原生统一架构。这套架构去掉了传统多模态模型中的 ViT(视觉编码器)和 VAE(变分自编码器),以纯 Transformer 统一处理文字与视觉。理解、生成和行动都使用同一种表征,模型无需在不同模块之间频繁「翻译」。
统一表征带来的第一个价值是学习效率。商汤此前披露,这套架构可以用约十分之一的数据达到同类 SOTA 模型的水平。第二个价值是计算效率,结构更简单,更容易扩展训练和推理,也能降低每一轮模型迭代的成本。
林达华把这条路径类比为 DeepSeek 路径:「当你有了一个很高效的架构之后,你在学习和各方面的成本就会降下来。」
对于商汤这样的中等体量公司,架构效率直接关系到竞争方式。它很难与 OpenAI、Google 等巨头正面比拼资源体量,更现实的选择是依靠更高的学习效率和计算效率,换取更快的迭代速度。
高效架构的终点,是把低成本迭代变成长期竞争优势。

U1 Pro 生成的超长国风景观画卷
在产品侧,商汤围绕统一架构做了三层策略:
U1(开源),面向开源社区。采用更轻量的模型和更通用的数据,让研究者、开发者可以真正部署和探索。林达华认为,一套有生命力的技术体系需要形成社区和生态,不能只存在于一家公司。
U1 Pro(闭源),面向专业级交付。一张图大约需要 10 分钟,模型会在这段时间里经过多轮迭代、自我检查和修正,直到输出零瑕疵的成品,可以直接拿去印刷或上线。目前已有设计和游戏行业的 KA 客户在内部试用。
U1 Fast,10 秒出图,适合成本敏感、对设计感要求没那么极致的场景。
商汤已有的产品体系,也是模型走向真实用户的入口。
商汤科技董事长兼 CEO 徐立在 WAIC 演讲中披露,小浣熊过去两个月周活超过 300 万,累计服务超 2000 万用户,企业用户超过 8000 家。Seko 的创作者用户已达 100 万,赋能 1500 家企业,付费创作者日均创作时长超过 1 小时,相关企业营收实现 80 多倍增长。
这里有一个商汤称为「C to B」的路径:个人用户先使用和认可产品,企业采购时的教育成本随之降低。C 端用户也会持续提供需求和反馈,帮助产品找到更明确的企业场景。
在迭代模式上,商汤已经形成了两条并行的反馈通路。线上产品有用户行为数据回流,可以做大规模数据驱动的训练。B 端私有化部署的客户会给出具体的反馈——哪里好用,哪里不好用。团队把这些反馈转化为强化学习的训练样本,再做定向优化,效果也很好。
从开源社区,到 C 端产品,再到企业客户,商汤试图让技术反馈、用户增长和商业收入进入同一个循环。
这就是商汤的「沿途下蛋」:走向终极愿景的过程中,先打穿能打穿的行业,让商业闭环支撑自己继续往下走。
03
商业范式转移:超级个体正成为新客户
「沿途下蛋」是商汤对自己的要求,但市场端正在发生一件更值得关注的事:买单的人变了。
徐立在 WAIC 演讲中提到一个判断:「过去的客户如今已不再是目标客户,而新增的用户群体,往往是从真实需求出发而来的。」他把这个过程叫做从「专业人士」到「超级个体」的迁移。
过去,设计行业的付费用户几乎都是专业设计师和设计团队。AI 生图工具出现后,第一波用户也主要是设计从业者,用它提高效率。但当模型真正越过交付线,生成的东西不用修就能直接用之后,买单的人就不再限于行业内部了。一批过去请不起设计师、甚至从未想过自己需要「设计服务」的人,开始成为新客户。
不再是在存量市场里竞争,是市场扩容。
商汤的产品数据已经在印证这个变化。小浣熊办公 2000 万用户、300 万周活,Seko 100 万创作者用户、1500 家企业客户——增长最快的不是传统设计从业者,而是那些被徐立称为「超级个体」的人。他们的共同特征是:拥有某个领域的专业经验或强烈兴趣,过去缺少工具将其转化为可交付的成果,现在 AI 补上了这一环。

U1 Pro 生成的动漫角色设定图
几个真实案例能说明这种变化的商业含义。
一位拥有 20 年景观经验的审图老总工,完全不懂编程,用小浣熊的专属 Skills 把自己的审图经验固化成了「总工之眼」。一套高度专业化的行业知识,不再锁在个人经验里,而是变成了可复制、可付费的企业级工具,这是典型的垂直 SaaS 场景。
一位历史爱好者,凭借 AI 的能力拓展,打造出覆盖数百位历史人物的故事地图,用户可以从不同角度探索任意一段历史。个人兴趣驱动的内容,因为 AI 降低了制作门槛,具备了产品化的可能。
大三学生李让通过 Seko 创作的短片《告别》拿到了 1.5 亿播放量,普通记者凭个人兴趣生成的 MV 直接登上卫视舞台。Seko 平台上付费创作者日均创作时长超过 1 小时,相关企业营收实现 80 多倍增长。这些不是设计行业的存量用户在迁移,而是全新的创作者经济在生长。
最具代表性的案例来自一位视障人士。他想去解决国内 1700 万视障群体的需求,全程通过语音与模型交互,搭建了一整套面向视障人群的教育系统。这个场景在过去根本不存在于任何设计公司的客户名单上,但它就是真实的付费需求。
当这些非专业用户能直接拿到成品交付,他们在意的不是模型消耗了多少 Token,而是「做一张海报多少钱」「一套教育材料多少钱」。计费维度从 Token 转向 Task——用户购买的是确定的任务成果,不是底层算力。
这对商汤也意味着定价权上移。卖 Token 是基础设施生意,卷的是算力成本;卖 Task 是应用层生意,定价锚点是用户获得的商业价值。徐立在演讲中进一步指出,Task 的计算成本会持续降低,「从而使得真正意义上 AI 变成一个普惠的门槛」。成本下降带来市场扩容,市场扩容带来更多数据和收入,收入又支撑模型继续迭代,这是一个正向飞轮。
值得注意的是,这些超级个体的故事指向同一个方向:AI 没有替代他们原有的能力,而是让他们的能力延伸到了过去到不了的地方。徐立在演讲中特别强调,好的 AI 产品「目标不是制造依赖,而是聚焦于个人成长」。用户在使用过程中能力也在同步提升,这才是产品能长期留住用户的根本原因。
设计赛道的商业闭环正在形成:交付级的产品能力打开了新市场,新市场催生了新的计费模式,超级个体作为新的用户群体提供了持续增长的需求和数据。
04
不是 Coder AGI,是 General AGI
实际上,商汤真正想验证的是多模态 AGI 的终极路径。
今天的大语言模型主要从海量文本中学习世界,Coding Agent 也主要工作在语言和数字空间。进入机器人、自动驾驶、城市治理等物理场景后,智能还要理解空间、物体关系、运动变化和真实环境。许多视觉信息无法被完整压缩成文字,General AGI 离不开视觉。
林达华把它称为「打开物理空间 AGI 的钥匙」。他的判断很明确:「不是 Coder AGI,而是 General 的 AGI,一定是离不开视觉的。很多东西没有办法完全用语言来表达。」
林达华说,团队已经看到了「视觉涌现的一点点苗头」,虽然还处在早期阶段。
设计是这条长期路线上的一个阶段性落点。它足够大,也已经接近模型能力的临界点。如果 U1 Pro 能够稳定跨过交付线,设计行业就可能率先形成商业闭环,为统一架构积累用户、数据和收入。
再往前,视觉理解、世界模型和具身智能会继续把这套架构推向真实物理空间。
这也是商汤选择设计的完整逻辑:Coding 已经证明 AI 如何落地一个行业,多模态设计提供了下一次验证机会;今天先让一张图真正交付,最终目标是让视觉与语言共同支撑 General AGI。
U1 Pro,就是商汤在通往 General AGI 路上,押下的一个设计行业落点。
文章来自于"Founder Park",作者 "Founder Park"。