結論先講
生圖模型看規格表選不出來,因為決定因素不是畫質,是三件事:
- 你要不要反覆對話修圖?
- 圖裡要不要有正確的中文字?
- 要不要印出來?
回答完這三題,選型基本就定了。
三問決策流程
Q1:你主要用它做什麼?
| 用途 | 特徵 | 往哪個方向 |
|---|---|---|
| 社群配圖、對話修圖 | 量大、要改得快 | 支援多輪編輯的模型 |
| 含中文字的海報/DM | 文字不能亂碼 | 中文渲染強的模型 |
| 純商業攝影感、產品圖 | 要真實質感、不需要改 | 純文生圖模型 |
| 會講話的人像影片 | 照片+聲音變影片 | 另一條產品線(見下方) |
先挑「最常用的場景」。 如果每種都做,回答用量最大的那一種——選型是為了主力工作流,不是為了涵蓋所有可能。
Q2:會頻繁對話式修圖嗎?
「把背景換成咖啡廳」「表情改開心一點」「再給我一個正方形版本」——如果你的工作長這樣,這一項的權重高於畫質。
| 你的情況 | 需要什麼 |
|---|---|
| 常常改 3–5 次才滿意 | 多輪對話編輯 + 人物一致性 |
| 提示詞給好就直接量產 | 不需要編輯能力,可選純文生圖 |
為什麼這一項比畫質重要:多數行銷用圖的瓶頸不是畫質,是「改到滿意要幾輪」。一顆畫質稍遜但能對話修改的模型,總成本與總時間往往遠低於一顆畫質頂尖但每次都得重新描述的。
Q3:中文字,還是解析度?
如果 Q2 答「會改」,接著問:圖裡需要清楚的中文品牌字嗎?
| 需要 | 不需要 | |
|---|---|---|
| 例子 | 圖上要直接秀「限時 8 折」 | 純圖,文字後製疊上去 |
| 選擇 | 中文渲染最強的那一顆 | 一般模型即可,省下大筆預算 |
如果 Q2 答「不改、要量產」,接著問:要印出來嗎?
| 網路投放 | 印刷輸出 | |
|---|---|---|
| 解析度 | 1-2K 足夠 | 需要 4K |
| 場景 | 社群廣告、圖文選單 | A3 以上、戶外大圖、展場主視覺 |
| 成本影響 | 基準 | 通常約兩倍 |
中文字這一項值得單獨講
中文字渲染是生圖模型公認的難題。 多數模型會產生變形、缺筆畫或完全亂碼的字。
所以如果海報上必須出現正確的中文品牌字或活動名稱,這一項會直接排除掉大部分選項。
但先考慮另一個做法
用一般模型生圖,再用設計工具把文字疊上去。
這個做法通常更快、更可控,而且成本低很多:
| 靠模型渲染中文字 | 生圖後疊字 | |
|---|---|---|
| 字的正確性 | 不保證,可能要重生成多次 | 100% 正確 |
| 字體選擇 | 模型決定 | 你的品牌字體 |
| 改一個字 | 整張重生成 | 三秒 |
| 成本 | 高單價模型 | 低單價模型 + 免費工具 |
只有在「文字必須跟畫面元素融合」時(例如字寫在杯身弧面上、招牌上),才真的需要模型渲染中文字。單純把字放在圖上,後製更好。
人像影片是另一條線,不要混進來比
把照片變成會動嘴說話的影片——這不是文生圖:
| 文生圖 | 人像影片 | |
|---|---|---|
| 輸入 | 文字 | 照片 + 音檔 |
| 輸出 | 靜態圖 | 影片 |
| 計價 | 每張 | 每秒 |
把兩者放在同一張比較表會得出錯誤結論。選型前先確認自己要的是哪一種產出。
用量試算:兩個數字就能估
不要問「這個貴不貴」,要算「我一個月花多少」。
公式:
月成本 ≈ 單張價格 × 每次滿意所需張數 × 每月產出張數
中間那項最常被漏掉。如果一張圖平均要生四次才滿意,你的實際單價是標示價格的四倍。
一張可以填的試算表
| 項目 | 你的數字 |
|---|---|
| 單張價格(查官方定價頁) | |
| 平均幾張才滿意 | |
| 每月需要幾張成品 | |
| 月成本 | 三者相乘 |
填完會發現:能對話修圖的模型,即使單張貴一點,總成本常常反而低——因為「改一次」比「重生成四次」便宜。
關於價格,一個必要的提醒
本文不提供具體數字。
生圖模型的定價與方案變動頻繁,任何文章寫下的價格都會過期,而拿過期價格去做預算或報價是實際的風險。
實際單價請以各家官方定價頁當日的數字為準。要學會的是上面那個試算方法與量級感,不是背數字。
一份選型結論的寫法
決定之後,把結論寫成三句話存檔,之後團隊有人問就直接給:
主力用 A(社群配圖、需要對話修改,用量最大) 含中文字或要印刷時切 B(每月約佔一成) 人像影片走 C(另一條線,按秒計價,只在特定專案用)
九成的圖用一顆、特殊需求切另一顆,這是多數團隊最後會落到的配置。一開始就想找到「一顆全包」的模型,通常是走了遠路。
常見問題
為什麼不直接選畫質最好的那一顆?
因為畫質最好的通常不支援反覆對話修圖,或是單價高好幾倍。實務上多數行銷用圖的瓶頸不是畫質,是「改到滿意要幾輪」。一顆畫質稍遜但能對話修改的模型,總成本與總時間往往遠低於一顆畫質頂尖但每次都得重新描述的模型。
圖裡要放中文字,為什麼要特別挑模型?
因為中文字渲染是生圖模型公認的難題,多數模型會產生變形或亂碼的字。如果海報上必須出現正確的中文品牌字或活動名稱,這一項會直接排除掉大部分選項。另一個做法是用一般模型生圖、再用設計工具把文字疊上去,那通常更快也更可控。
要印出來的圖,解析度該開多高?
網路投放用 1-2K 通常足夠,要印 A3 以上或戶外大圖才需要 4K。這個選擇會直接影響單價,多數模型的高解析模式價格是標準模式的兩倍左右。判斷方式很簡單:這張圖最終會出現在螢幕上還是紙上。
會講話的人像影片跟生圖模型是同一類嗎?
不是,那是另一條產品線。文生圖的輸入是文字、輸出是靜態圖;人像影片模型的輸入是照片加音檔、輸出是會動嘴的影片,計價方式也從「每張」變成「每秒」。把兩者放在同一張比較表會得出錯誤結論,選型時要先確認自己要的是哪一種產出。
文章裡的價格可以直接參考嗎?
不要。生圖模型的定價與方案變動頻繁,任何文章寫下的數字都會過期。本文只提供試算的方法與量級感,實際單價請以各家官方定價頁當日的數字為準——尤其在做預算或報價之前。