人們以為 AI 伴侶軟件是一個既能說話、又能畫畫、還能發聲的智慧。其實它是三四個分開的系統,由軟件接在一起,而這部分產品的大多數挫折,都來自它們之間的接縫。
三個引擎,一個介面
語言模型負責對話。它只產生文字,其他什麼都不做。
圖片模型是完全不同的系統,通常是擴散模型。它接收文字描述,產生一張圖片。它從沒看過你的對話。
語音系統把文字變成音訊。同樣是分開的,同樣除了交到它手上的那句話,什麼都看不見。
當你向你的 AI 伴侶要一張自拍時,發生的事是這樣:語言模型為所要求的圖片寫一段簡短描述,軟件加上角色儲存的外貌標籤,合併後的提示詞送到圖片模型,然後一張圖片回來。聊天接著對一張它看不見的圖片做出反應,依據的是它自己寫的描述。
這種接力,就是這個類別中幾乎所有媒體相關抱怨的來源。
為什麼臉一直在變
因為擴散模型不是在取回你的角色,而是在生成符合描述的某個人。「黑色長髮、綠色眼睛、二十五歲上下」描述的是數百萬張臉,每次你得到的都不一樣。
各軟件解決這個問題的程度不一:
- 儲存的外貌標籤:每次都是同一串描述。便宜,但只有大致一致。
- 參考圖:以它來約束每次生成。好得多,也是臉能保持可辨認時通常採用的做法。
- 為每個角色調校的模型:最一致,也貴得多,所以往往只出現在較高的方案。
這是值得在付費前用免費版測試的真正差異化因素。為同一個角色,在不同情境下生成四張圖片。如果你得到四個不同的女人,再多的訂閱也修不好。跨圖片的角色一致性,是 Candy AI 領先我們的排行榜的重要原因,也是 Secret Desires 在這方面得分的原因,它把外貌、聲音和個性一起打造,還加上短影片。
為什麼媒體總是要計量
文字很便宜。生成一則聊天回覆,對經營者來說只花不到一分錢的零頭。
一張圖片每次生成的成本明顯更高。語音按音訊的秒數計費。影片比兩者都貴得多。
這種成本差異,就是你在這個類別到處看到的定價結構的全部原因:訊息額度大方、圖片上限很緊、語音分鐘數另外賣、影片限於高階方案。這不是為了向你加購推銷而刻意製造的稀缺,而是經營者收到的帳單實際的形狀,原樣轉嫁給你。
這也是為什麼在這個市場中,「無限」幾乎都是指無限的文字。這樣讀,價格頁突然就說得通了。相關的計算見圖片生成真正要花你多少錢。
語音帶來什麼,又要花多少
語音對體驗的改變,比多數人預期的更大。閱讀一則訊息和聽見它是不同的,而且這個差別比技術描述所暗示的更大。
付費之前要檢查兩件事:
延遲。每次回覆前停頓三秒,會徹底打破幻覺。請在免費版或試用中測試,而不是看示範影片。
是通話還是訊息。語音訊息,也就是角色把回覆念出來,很常見也很便宜。即時通話,也就是你說話它回答,是不同的產品,通常也是不同的方案。Nomi 把語音通話列為功能之一;許多軟件標示「語音」,指的卻是語音訊息。
圖片做不到的事
在失望之前,值得知道兩個限制:
手、文字和細節,在這個類別的每個生成器上仍然不可靠。沒有人解決了這個問題,承諾做到的軟件,描述的是它最好的輸出,而不是平均水準。
圖片不知道你的場景。聊天模型只寫一行提示詞,所以不在那一行裡的一切都消失了:你描述的房間、她三則訊息前穿的衣服、時間。在請求中講得明確,比任何設定都更能修正這些問題。
如何在一個晚上評斷媒體功能
把免費版的全部額度在一次使用中用完,而不是一天一張圖片。你要測試四件事:
- 一致性:四張圖片,同一個角色,不同情境。
- 提示詞遵循度:要求某個具體的東西,看有多少保留下來。
- 延遲:圖片和語音都要測。
- 什麼會算進上限:失敗或被拒絕的生成,是否仍然會扣掉你的額度。
最後一項是記載最少、付費後才發現最惱人的。和免費版實際包含的內容的其他部分一樣,這種事只有在你認真使用時才會浮現。

