产品化方案 · 方案 A

视觉资产工厂图、视频、3D 与配音,出自同一套视觉规范

大多数企业试过 AI 生图然后放弃了,原因不是「画得不好看」,是同一批图凑不齐一套、产品还长得不对。 这两件事都有解,但不是靠换一个更强的模型——是先选对档位,再把流程固定下来。 流程固定之后,视频、3D 与配音都是接在同一套规范上往下走的事, 不用再各找一家、各是一套。

进去的

你手里已有的实拍图

出来的

图 · 视频 · 3D · 音频

跑在哪

你自己的服务器

交付节奏

分块交付 · 诊断后核定

一句话讲清这条管线

进去的是产品照,出来的是能直接上架的一整套

进去的

你手里已有的实拍产品图。不用为它重拍一轮,也不用先整理成什么特定格式。

出来的

图、视频、3D、音频四类——整批风格一致,文件命名和替代文本一并生成好,可以直接回写到你的商品库。不必四类都上,多数从图开始。

中间那一段

跑在你自己的服务器上。素材、配置与模型都不出你的边界,也不按张数向谁付费。

先说问题在哪

不是画得不好看,是不可控

这三条是实际卡住企业的原因,也是下一节要你做选择的原因。

每次都不一样

同样的描述生成十次,出来十个样子。做单张图没问题,做一整个商品系列就崩了。

说不准要什么

「产品放左边、留白在上」——文字描述做不到精确控制,改一版赌一次。

产品长得不对

通用模型没见过你的产品,细节全靠编。放到电商详情页上,这是致命的。

还有一条更现实的:产品图外包,一张几十块、等三天、风格还对不齐。 上新一多,图就成了整条链路的瓶颈。

不只是图

四类产出,共用同一套视觉规范

这条线最初是为商品图做的,现在往下接了三段。值钱的地方不在于「什么都能出」,在于四类东西出自同一套规范—— 视频里的产品和主图是同一件,配音的口径和详情页的文案是同一份。 分开找四家做,最难对齐的恰恰是这个。
01

场景图、白底主图、详情图、社媒图。多尺寸一次导出,每套的安全区、留白与主体占比各自适配,不是简单裁一刀;文件命名与替代文本一并生成,可直接回写商品库。

整批出来是一套的

02

视频

产品展示动态、场景短片、社媒竖版切片。用的是同一批已过审的图和同一套视觉规范,所以视频和图不会各说各话。

接在图后面的一步

03

3D

从产品照或一段描述做出可用的三维模型,出多角度渲染图、结构拆解与爆炸图。尺寸想调就调、拆解想重排就重排——这一段在你自己的机器上算,改一版不额外花钱。

改一版不额外花钱

04

音频

视频配音、字幕转写、背景音乐。多语种版本用同一份稿子生成,口径不会在翻译环节走样。

多语种同一份稿子

不必四类都上。多数合作从图开始,跑顺了再往下接——底子是同一套,所以往后每加一类都比第一类轻。

三个档位

不是一套通用做法,是三个档位

上到哪一档,取决于你的产品有多需要「长得对」。 这是这页最该看的一节:档位选错,要么图不能用,要么钱花在你根本用不上的地方。
档位 01最快 · 最便宜

直接生成

用通用大模型出图。适合场景氛围图、背景素材、社媒配图这类不要求产品细节严格准确的用途,量大、出得快。

局限:产品的具体形态它是「猜」的,做详情页主图不合格。

档位 02大多数电商图的落点

受约束生成

以你的实拍图作为生成依据:产品主体不被重画,只重建背景、光影与场景。构图和轮廓稳定,整批出来是一套的,可以直接进详情页。

前提:这个产品得有一张能用的实拍图。

档位 03你的资产

专属模型

用你自己的产品照训练一个只认识你产品的模型。之后不需要每次都有实拍图,也能生成形态正确的产品图——包括实拍拿不到的角度和场景。适合 SKU 多、上新频繁,或者需要大量实拍做不到的场景图。

模型是你的资产,存在你自己的服务器上,可以带走。

三档可以混着用:主图走第二档保证准确, 场景与社媒走第三档批量出,氛围素材走第一档。 诊断时我们按你的品类给建议—— 包括「你只需要第二档,别花第三档的钱」这种结论。

一批图是怎么走完的

四段,其中一段是你的人在动

下面只写谁在动
01你给素材产品实拍图,加上你的视觉规范——要什么调性、留白多少、导出几套尺寸。没有规范我们帮你定一次,之后就固定下来。
02机器批量出机器整批处理,每张出多个备选版本。机器先自检一轮,不合格的自己重跑,这一段不占你的时间。
03你的人挑片你的人从备选里选定。这一步不自动化,是设计决定——每张约 20 秒,一批 24 张八分钟。不合格打回重跑。
04自动交付机器多尺寸一次导出,文件命名与替代文本自动生成,回写商品图库;这一批谁审的、什么时候,全部入表。

下一批新品,你自己的人就能跑起来。上面那个八分钟是我们自己跑一批的节奏,不是对你的承诺—— 你的批量、品类与终审要求不一样,诊断时按你的实际情况估。

视频与音频

同一套素材,顺手出短视频与配音

商品图做完之后,短视频是加一步的事: 产品展示动态、场景短片、社媒竖版切片。用的是同一批已通过审核的图和同一套视觉规范, 所以视频和图是一套的,不会各说各话。配音、字幕与背景音乐接在后面—— 多语种版本从同一份稿子出,口径不会在翻译环节走样。

交付的是能重复跑的产出能力,不是一批剪好的片子。下个月新品来了,你自己的人跑同一条流程—— 这也是它和「找人剪一批视频」的根本区别:那笔钱花完就没了,这套东西留下来。

这一节不包含

  • 实物拍摄
  • 真人出镜模特
  • 剧本与创意策划
  • 平台账号代运营与评论互动

3D

需要讲清楚结构的产品,图往往说不明白

家具、器械、配件这类产品,客户真正想知道的是它怎么装、里面什么样、放进我家占多大—— 这些用平面图很难说清。做出模型之后,多角度渲染、结构拆解、爆炸图都是从同一个模型出的, 不会出现「图上有五颗螺丝、实物有六颗」这种事。

多角度渲染

一个模型出任意角度,包括实拍根本架不了机位的那些。换角度不用重新协调一次拍摄。

结构拆解与爆炸图

零件怎么装、装配顺序是什么,一张图讲完。安装说明、售后工单、经销商培训都用得上。

尺寸与配置调整

同系列不同尺寸、不同配置,改参数重出一版就行——这一段在你自己的机器上算,改一版不额外花钱。

这一节的两条边界

一,能不能拆得开取决于模型怎么来。从一张照片直接转出来的模型通常是一整张壳,拆不出零件;要做拆解图,得按结构建。这在诊断时就会说清楚,不会等到交付前才发现。

二,这不是工程图纸。它讲的是「长什么样、怎么装」,不是可以拿去开模的精确尺寸件。要那个精度,该找结构工程师。

专属模型

训一个属于你的模型,你需要准备什么

这一节写的是你要出什么、拿到什么、什么时候别做——怎么训是方案阶段的事。
素材单个产品 20–40 张实拍,覆盖主要角度和不同光照。素材质量决定上限,这一步省不掉。
时间素材齐不齐决定快慢——挑图与标注是大头,训练本身不是。具体排期在方案阶段按你的品类与素材量定。
验证训完我们会用一组没参与训练的图,检查形态和关键结构件对不对,不通过就调素材重来。不拿「差不多」的模型交付。
归属训练素材、配置和模型文件全部在你自己的服务器上,是你的资产,可以自己继续训练新版本。
什么时候不适合产品每批外观都变的,学不到稳定特征——这种我们会直说,不硬做。

三条不让步的

这三条会让工具变窄,但让这批东西能用

模型每几个月换一轮,这三条没动过。单看每一条都像在把自由度往回收,合起来才是「这批能对齐、这个月花了多少心里有数」。
01

出的必须是同一件产品

只要这张图会被客户拿来判断「这东西到底长什么样」,就一律以你的实拍图为依据来生成,产品本体不被重画。宁可少一点自由度——一件长得像的东西,售后是你在接。

02

图上的字不交给模型写

让模型排字,十次里总有几次糊、拼错或多一个字母,而且改一个词要重跑整张图。所以文字是后合成上去的:位置精确、字形正确,同一张图一次出十个语种的版本,改词不用重跑。

03

花钱的地方有闸门

每一次调用先估价再放行,超出当天上限就直接拒绝,不是弹个提示让你自己拿主意;实际花费逐笔入流水,按板块、按天可查。视频比图片贵一到两个数量级,这道闸门必须先跑通。

这几条是我们自己那张生产台上摸出来的,完整的一组写在自研视觉生产台 →

你会拿到什么

交付的是一条能自己跑的管线,不是一批图

这是这套方案和「找人修图」的根本区别:下次上新,你自己就能跑。

可重复运行的管线

同一套配置下个月再跑,结果和这个月是一套的。不用有人记得当时是怎么调的。

配方库

把「怎么问才出得对」沉淀成一条条可复用的配方,按用途分好。第二批和第一批能对齐,靠的是这个,不是靠谁还记得。

素材库

产出与原始素材都归在一处,按属性能检索。上一次的成品可以直接当下一次的输入,不用先下载再上传。

品牌专属模型

上到第三档时交付:用你的产品照训练出来的模型,存在你自己的服务器上,不依赖任何平台。

导出规范

主图 / 详情 / 社媒的尺寸、留白、命名规则,写成规范交付,新人照着就能用。

运行记录与花费流水

每一批谁审的、什么时候、出了多少张、花了多少钱,全部入表,可追溯、可从断点续跑。

不包含什么

  • 实物拍摄:材质、真实使用场景、模特
  • 模特与场地、外景拍摄
  • 配音演员与出镜模特、剧本与创意策划
  • 代持广告账户与代做预算决策
  • 内容合规与法务审查

什么时候不值得做

  • 一年只上新几款,总共就几十张图——外包更划算
  • 只要 3D 但产品形态简单、一眼看得懂——边际收益不高
  • 还没有品牌视觉规范:机器只能执行规范,不能替你定规范
  • 产品每批外观都不一样,专属模型学不到稳定特征
  • 只要几张惊艳的营销大图——那是创意活,不是管线活

这条线接在站上是什么样,看独立站运营自动化与客服 Agent →

常见问题

你大概率会问的几个问题

第一条是选型问题,也是这页最该被问的,所以放在最前面。
01我该上到哪一档?+

判断依据只有一条:这张图会不会被客户拿来判断「这东西到底长什么样」。会——比如主图、详情图——那就从第二档起步,产品形态必须是准的;不会——氛围图、背景、社媒配图——第一档就够,别多花钱。SKU 多、上新频繁,或者需要大量实拍根本拿不到的角度和场景,才值得上第三档。诊断时我们会按你的品类逐项给结论,包括「你只需要第二档」这种结论。

02生成的图能直接上架吗?+

能,但要过你自己的人那一关。挑片这一步我们不自动化——商品主图会直接影响退货率,这类东西不该在没人看过的情况下发出去。机器把备选和多尺寸都准备好,选哪一版是你的人点的。

03必须先有品牌视觉规范吗?+

最好有。没有的话我们帮你定一次并写成文件,之后就固定下来,新人照着也能跑。但要说清楚:机器只能执行规范,不能替你决定品牌该长什么样。规范这件事没定,出来的图就只能是「好看」,不会是「像你家的」。

04专属模型是不是要一直交钱?+

不是。训练素材、配置和模型文件全部在你自己的服务器上,是你的资产,你可以自己继续训练新版本,也可以换人接手。我们不按张数、不按调用次数计费——出图多少,不影响你付给我们的钱。但要说清楚另一头:出图本身要用的图像模型是要花钱的,这笔钱不含在交付费里,也不经我们的手——账号由你自己充值、算力用你自己的服务器,我们不代收、不加价,后台按模块、按人、按月看得见花了多少。单张多少取决于用哪个模型、出多大尺寸、要跑几轮:我们自己这条线跑下来,一张商品图的综合成本在 10 元上下(来源:出图记录;同一张外包要 200 元)。你的品类和尺寸不一样,具体单价与一个月大概花多少,诊断时按你要出的量算给你。

05产品每批外观都不一样,能做吗?+

第三档不适合——模型学不到稳定特征,硬训出来的东西不可靠,这种我们会直说。第一、二档仍然成立:只要有这一批的实拍图,场景与背景照样能批量出。

063D 那一段,我们的产品适合做吗?+

看客户在决定买之前需不需要弄明白「它怎么装、里面什么样、放进我家占多大」。家具、器械、配件这类,答案通常是需要——平面图很难说清结构,而结构说不清就会变成售后工单和退货。反过来,形态简单、一眼看得懂的产品,做 3D 的边际收益不高,我们会直说。还有一条要提前对齐:**要出拆解图,模型得按结构建**;从一张照片直接转出来的通常是一整张壳,拆不出零件。这在诊断时就会说清楚。

07AI 生成的图,需要标注吗?+

多数市场现在是要的,而且已经在施行——中国的《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起生效,要求显式标识(文字提示、角标这类)和隐式标识(写进文件元数据);欧盟 AI 法案的透明度义务按时间表自 2026 年 8 月起适用;部分广告与社媒平台另有自己的披露要求,不合规可能导致广告被拒或限流。落到这条线上就一件事:标识应该长在管线里,而不是指望运营每次记得手动加——角标、文字提示和元数据都可以在出图与导出那一步自动写进去,这是交付范围内的。⚠️ 但要分清:我们能把标识这个动作做进流程,但判断你这个市场、这个渠道具体该怎么标,属于合规问题,不在我们的交付范围内,规则各地不同且在变,请以当地最新规定和你自己的法务意见为准。

08生成出来的图,版权算谁的?+

这块目前各地立场不完全一致,只能讲大致情况:完全由 AI 生成、几乎没有人类创作投入的,通常难以主张权利;人在提示、筛选、编排、修改上的投入,可能受到保护。多数主流厂商的条款把输出的权利给使用者,但通常不保证输出不侵犯他人权利——这是两件事。所以有三条我们会建议你做:保留创作过程记录(提示词、迭代版本、人工修改,争议时这就是证据);核心品牌资产——Logo、主视觉、吉祥物——由人主导创作或深度修改;发布前过一道审核,看品牌、商标、肖像和宣传用语。⚠️ 以上是一般性说明,不构成法律意见,具体业务请咨询专业律师。

09多语种版本是每种语言重跑一遍吗?+

不是,这也是我们不让模型在图上写字的原因。文字是后合成上去的,所以同一张图换一份文案就能出下一个语种,位置和字形都不会变;改一个词也不用重跑整张图。配音与字幕同理——多语种从同一份稿子出,口径不会在翻译环节走样。这件事对上十个语种的站点差别很大:以前是十倍的出图量,现在是一次出图、十次合成。

先拿你的图跑一批看看

诊断阶段我们会拿你自己的产品图实测一批,告诉你该停在哪一档、哪些能进管线、哪些必须靠拍—— 包括不值得做的部分。结论归你,不合作也可以拿走自己实施。

诊断费在后续合作中全额抵扣。