一句话讲清这条管线
进去的是产品照,出来的是能直接上架的一整套
进去的
你手里已有的实拍产品图。不用为它重拍一轮,也不用先整理成什么特定格式。
出来的
图、视频、3D、音频四类——整批风格一致,文件命名和替代文本一并生成好,可以直接回写到你的商品库。不必四类都上,多数从图开始。
中间那一段
跑在你自己的服务器上。素材、配置与模型都不出你的边界,也不按张数向谁付费。
先说问题在哪
不是画得不好看,是不可控
每次都不一样
同样的描述生成十次,出来十个样子。做单张图没问题,做一整个商品系列就崩了。
说不准要什么
「产品放左边、留白在上」——文字描述做不到精确控制,改一版赌一次。
产品长得不对
通用模型没见过你的产品,细节全靠编。放到电商详情页上,这是致命的。
还有一条更现实的:产品图外包,一张几十块、等三天、风格还对不齐。 上新一多,图就成了整条链路的瓶颈。
不只是图
四类产出,共用同一套视觉规范
图
场景图、白底主图、详情图、社媒图。多尺寸一次导出,每套的安全区、留白与主体占比各自适配,不是简单裁一刀;文件命名与替代文本一并生成,可直接回写商品库。
整批出来是一套的
视频
产品展示动态、场景短片、社媒竖版切片。用的是同一批已过审的图和同一套视觉规范,所以视频和图不会各说各话。
接在图后面的一步
3D
从产品照或一段描述做出可用的三维模型,出多角度渲染图、结构拆解与爆炸图。尺寸想调就调、拆解想重排就重排——这一段在你自己的机器上算,改一版不额外花钱。
改一版不额外花钱
音频
视频配音、字幕转写、背景音乐。多语种版本用同一份稿子生成,口径不会在翻译环节走样。
多语种同一份稿子
不必四类都上。多数合作从图开始,跑顺了再往下接——底子是同一套,所以往后每加一类都比第一类轻。
三个档位
不是一套通用做法,是三个档位
直接生成
用通用大模型出图。适合场景氛围图、背景素材、社媒配图这类不要求产品细节严格准确的用途,量大、出得快。
局限:产品的具体形态它是「猜」的,做详情页主图不合格。
受约束生成
以你的实拍图作为生成依据:产品主体不被重画,只重建背景、光影与场景。构图和轮廓稳定,整批出来是一套的,可以直接进详情页。
前提:这个产品得有一张能用的实拍图。
专属模型
用你自己的产品照训练一个只认识你产品的模型。之后不需要每次都有实拍图,也能生成形态正确的产品图——包括实拍拿不到的角度和场景。适合 SKU 多、上新频繁,或者需要大量实拍做不到的场景图。
模型是你的资产,存在你自己的服务器上,可以带走。
三档可以混着用:主图走第二档保证准确, 场景与社媒走第三档批量出,氛围素材走第一档。 诊断时我们按你的品类给建议—— 包括「你只需要第二档,别花第三档的钱」这种结论。
一批图是怎么走完的
四段,其中一段是你的人在动
下一批新品,你自己的人就能跑起来。上面那个八分钟是我们自己跑一批的节奏,不是对你的承诺—— 你的批量、品类与终审要求不一样,诊断时按你的实际情况估。
视频与音频
同一套素材,顺手出短视频与配音
交付的是能重复跑的产出能力,不是一批剪好的片子。下个月新品来了,你自己的人跑同一条流程—— 这也是它和「找人剪一批视频」的根本区别:那笔钱花完就没了,这套东西留下来。
这一节不包含
- ✕实物拍摄
- ✕真人出镜模特
- ✕剧本与创意策划
- ✕平台账号代运营与评论互动
3D
需要讲清楚结构的产品,图往往说不明白
多角度渲染
一个模型出任意角度,包括实拍根本架不了机位的那些。换角度不用重新协调一次拍摄。
结构拆解与爆炸图
零件怎么装、装配顺序是什么,一张图讲完。安装说明、售后工单、经销商培训都用得上。
尺寸与配置调整
同系列不同尺寸、不同配置,改参数重出一版就行——这一段在你自己的机器上算,改一版不额外花钱。
这一节的两条边界
一,能不能拆得开取决于模型怎么来。从一张照片直接转出来的模型通常是一整张壳,拆不出零件;要做拆解图,得按结构建。这在诊断时就会说清楚,不会等到交付前才发现。
二,这不是工程图纸。它讲的是「长什么样、怎么装」,不是可以拿去开模的精确尺寸件。要那个精度,该找结构工程师。
专属模型
训一个属于你的模型,你需要准备什么
三条不让步的
这三条会让工具变窄,但让这批东西能用
出的必须是同一件产品
只要这张图会被客户拿来判断「这东西到底长什么样」,就一律以你的实拍图为依据来生成,产品本体不被重画。宁可少一点自由度——一件长得像的东西,售后是你在接。
图上的字不交给模型写
让模型排字,十次里总有几次糊、拼错或多一个字母,而且改一个词要重跑整张图。所以文字是后合成上去的:位置精确、字形正确,同一张图一次出十个语种的版本,改词不用重跑。
花钱的地方有闸门
每一次调用先估价再放行,超出当天上限就直接拒绝,不是弹个提示让你自己拿主意;实际花费逐笔入流水,按板块、按天可查。视频比图片贵一到两个数量级,这道闸门必须先跑通。
这几条是我们自己那张生产台上摸出来的,完整的一组写在自研视觉生产台 →
你会拿到什么
交付的是一条能自己跑的管线,不是一批图
可重复运行的管线
同一套配置下个月再跑,结果和这个月是一套的。不用有人记得当时是怎么调的。
配方库
把「怎么问才出得对」沉淀成一条条可复用的配方,按用途分好。第二批和第一批能对齐,靠的是这个,不是靠谁还记得。
素材库
产出与原始素材都归在一处,按属性能检索。上一次的成品可以直接当下一次的输入,不用先下载再上传。
品牌专属模型
上到第三档时交付:用你的产品照训练出来的模型,存在你自己的服务器上,不依赖任何平台。
导出规范
主图 / 详情 / 社媒的尺寸、留白、命名规则,写成规范交付,新人照着就能用。
运行记录与花费流水
每一批谁审的、什么时候、出了多少张、花了多少钱,全部入表,可追溯、可从断点续跑。
不包含什么
- ✕实物拍摄:材质、真实使用场景、模特
- ✕模特与场地、外景拍摄
- ✕配音演员与出镜模特、剧本与创意策划
- ✕代持广告账户与代做预算决策
- ✕内容合规与法务审查
什么时候不值得做
- ✕一年只上新几款,总共就几十张图——外包更划算
- ✕只要 3D 但产品形态简单、一眼看得懂——边际收益不高
- ✕还没有品牌视觉规范:机器只能执行规范,不能替你定规范
- ✕产品每批外观都不一样,专属模型学不到稳定特征
- ✕只要几张惊艳的营销大图——那是创意活,不是管线活
这条线接在站上是什么样,看独立站运营自动化与客服 Agent →
常见问题
你大概率会问的几个问题
01我该上到哪一档?+
判断依据只有一条:这张图会不会被客户拿来判断「这东西到底长什么样」。会——比如主图、详情图——那就从第二档起步,产品形态必须是准的;不会——氛围图、背景、社媒配图——第一档就够,别多花钱。SKU 多、上新频繁,或者需要大量实拍根本拿不到的角度和场景,才值得上第三档。诊断时我们会按你的品类逐项给结论,包括「你只需要第二档」这种结论。
02生成的图能直接上架吗?+
能,但要过你自己的人那一关。挑片这一步我们不自动化——商品主图会直接影响退货率,这类东西不该在没人看过的情况下发出去。机器把备选和多尺寸都准备好,选哪一版是你的人点的。
03必须先有品牌视觉规范吗?+
最好有。没有的话我们帮你定一次并写成文件,之后就固定下来,新人照着也能跑。但要说清楚:机器只能执行规范,不能替你决定品牌该长什么样。规范这件事没定,出来的图就只能是「好看」,不会是「像你家的」。
04专属模型是不是要一直交钱?+
不是。训练素材、配置和模型文件全部在你自己的服务器上,是你的资产,你可以自己继续训练新版本,也可以换人接手。我们不按张数、不按调用次数计费——出图多少,不影响你付给我们的钱。但要说清楚另一头:出图本身要用的图像模型是要花钱的,这笔钱不含在交付费里,也不经我们的手——账号由你自己充值、算力用你自己的服务器,我们不代收、不加价,后台按模块、按人、按月看得见花了多少。单张多少取决于用哪个模型、出多大尺寸、要跑几轮:我们自己这条线跑下来,一张商品图的综合成本在 10 元上下(来源:出图记录;同一张外包要 200 元)。你的品类和尺寸不一样,具体单价与一个月大概花多少,诊断时按你要出的量算给你。
05产品每批外观都不一样,能做吗?+
第三档不适合——模型学不到稳定特征,硬训出来的东西不可靠,这种我们会直说。第一、二档仍然成立:只要有这一批的实拍图,场景与背景照样能批量出。
063D 那一段,我们的产品适合做吗?+
看客户在决定买之前需不需要弄明白「它怎么装、里面什么样、放进我家占多大」。家具、器械、配件这类,答案通常是需要——平面图很难说清结构,而结构说不清就会变成售后工单和退货。反过来,形态简单、一眼看得懂的产品,做 3D 的边际收益不高,我们会直说。还有一条要提前对齐:**要出拆解图,模型得按结构建**;从一张照片直接转出来的通常是一整张壳,拆不出零件。这在诊断时就会说清楚。
07AI 生成的图,需要标注吗?+
多数市场现在是要的,而且已经在施行——中国的《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起生效,要求显式标识(文字提示、角标这类)和隐式标识(写进文件元数据);欧盟 AI 法案的透明度义务按时间表自 2026 年 8 月起适用;部分广告与社媒平台另有自己的披露要求,不合规可能导致广告被拒或限流。落到这条线上就一件事:标识应该长在管线里,而不是指望运营每次记得手动加——角标、文字提示和元数据都可以在出图与导出那一步自动写进去,这是交付范围内的。⚠️ 但要分清:我们能把标识这个动作做进流程,但判断你这个市场、这个渠道具体该怎么标,属于合规问题,不在我们的交付范围内,规则各地不同且在变,请以当地最新规定和你自己的法务意见为准。
08生成出来的图,版权算谁的?+
这块目前各地立场不完全一致,只能讲大致情况:完全由 AI 生成、几乎没有人类创作投入的,通常难以主张权利;人在提示、筛选、编排、修改上的投入,可能受到保护。多数主流厂商的条款把输出的权利给使用者,但通常不保证输出不侵犯他人权利——这是两件事。所以有三条我们会建议你做:保留创作过程记录(提示词、迭代版本、人工修改,争议时这就是证据);核心品牌资产——Logo、主视觉、吉祥物——由人主导创作或深度修改;发布前过一道审核,看品牌、商标、肖像和宣传用语。⚠️ 以上是一般性说明,不构成法律意见,具体业务请咨询专业律师。
09多语种版本是每种语言重跑一遍吗?+
不是,这也是我们不让模型在图上写字的原因。文字是后合成上去的,所以同一张图换一份文案就能出下一个语种,位置和字形都不会变;改一个词也不用重跑整张图。配音与字幕同理——多语种从同一份稿子出,口径不会在翻译环节走样。这件事对上十个语种的站点差别很大:以前是十倍的出图量,现在是一次出图、十次合成。