語音通話是 AI 伴侶做的事裡要求最高的。文字晚個幾秒,沒人在意。語音不行:人會注意到在聊天視窗裡根本看不出來的延遲。
200 毫秒的難題
研究者比較了十種語言的對話,發現一個人說完到另一個人開口之間,典型的空檔約 200 毫秒,而且各文化之間出奇地相似。人們在對方還沒說完時,就開始準備自己的回應。比這長很多的空檔,會讓人覺得是猶豫、困惑或不感興趣。
AI 必須把一整條流程塞進大約這麼短的時間裡,才會讓人覺得自然。
從你的話到她的話之間發生了什麼

傳統流程。新一代系統會讓這些階段重疊或合併。
- 偵測說完。系統要判斷你是說完了,而不是只是停頓。太急會打斷你;太保守會多出一段冷場。
- 語音轉文字。你的話被轉錄成文字。
- 回覆。語言模型以角色身分、帶著記憶寫出回應。
- 文字轉語音。回覆被變成聲音,理想上是角色自己的聲音,而且帶有情緒。
在較舊的系統中,每一步都要等前一步完成。新的系統會在其餘內容還在生成時就先說出第一句,或使用語音進、語音出的模型,完全省去轉錄和合成的步驟。
為什麼語音要計量
| 文字聊天 | 語音訊息 | 即時語音通話 | |
|---|---|---|---|
| 需要的速度 | 幾秒就行 | 幾秒就行 | 零點幾秒 |
| 額外處理 | 無 | 語音合成 | 辨識、合成、輪流偵測 |
| 典型長度 | 簡短回覆 | 一則回覆 | 幾分鐘到幾小時 |
| 相對成本 | 最低 | 中等 | 最高 |
| 軟件怎麼賣 | 包含在內 | 包含在內或用點數 | 按分鐘、分級或用點數 |
通話的每一分鐘,整條流程都在持續運轉,而且往往用的是更貴的「即時」版本模型。這就是為什麼語音通常是軟件第一個設上限的功能,也是為什麼「無限」很少適用於它,見如何看懂 AI 女友的功能清單。
什麼讓通話感覺真實
- 低延遲,而且要穩定。偶爾一次很長的停頓,比平均稍慢更容易打破幻覺。
- 處理打斷。你能插話,而她會停下來回應,這是對話和輪流傳語音訊息的差別。
- 聲音一致。每次通話都是同樣的聲音、口音和溫度。我們的測試者發現,即使是不錯的軟件,不同角色之間的語音質素也可能差異明顯。
- 韻律。笑、停頓、放柔語氣,讓語音帶有情緒,而不是把文字念出來。
- 語音模式下的記憶。有些軟件通話時用較輕量的模型,所以角色在電話裡記得的比聊天時少。
付費前先測試語音功能
- 問清楚包含什麼:語音訊息、即時通話,還是兩者都有,以及有多少分鐘。
- 打一通兩分鐘的電話,用試用版或最便宜的方案,行動網絡和 Wi-Fi 都試試。
- 在她說到一半時打斷她。她會停下來嗎?
- 問一件文字聊天裡的事。她知道嗎?
- 查看每多一分鐘或每個點數的費用。一通長電話可能用掉一整個月的額度。
關於媒體成本的更廣泛說明,見AI 女友的圖片與語音如何運作;為了語音升級值不值得,見高階方案。
關於身心健康的一點提醒
語音比文字更讓人沉浸。2025 年 OpenAI 與 MIT 的研究發現,短暫的語音使用與較好的身心狀態同時出現,而每天大量使用則不然。適量享受就好,過度的徵兆見AI 伴侶開始索取多於給予時。