「內容審查」聽起來像一件事。在 AI 伴侶軟件中,它至少是四件事,以不同的速度運作,牽涉不同的人。
四個層次

每一層看到的內容越來越少,但看得越來越細。
1. 即時過濾。 你送出的每一則訊息,以及模型寫出的每一則回覆,在顯示之前都可能被自動分類器檢查。它們會抓出被禁止的類別,包括任何涉及未成年人的內容、某些暴力內容、自傷訊號,然後擋下訊息、柔化回覆,或顯示警告。拒絕回應與危機提示卡就是這麼來的;我們關於內容過濾的文章,說明了它們為什麼有時會在場景進行到一半時觸發。
2. 對話層級的標記。 另外,系統可能會替整段對話或帳戶的模式打分數:反覆嘗試繞過過濾、騷擾、未成年人使用成人軟件的跡象。標記不是處罰,只是提醒真人可能會看一下。
3. 真人審查。 信任與安全團隊的人員(常常是外包商)會審查一部分被標記的對話、用戶舉報與投訴。有些公司也會抽樣一般對話,以檢查質素或訓練模型。私隱權政策中「為了改善我們的服務」或「為了執行我們的條款」這類說法,指的就是這一層。
4. 法律請求。 法院、警方與主管機關可以用法律命令請求資料。公司依自己的政策與當地法律回應。
通常什麼會引來真人查看
| 觸發條件 | 原因 |
|---|---|
| 涉及未成年人的內容 | 多數國家有法律義務;常常會進一步通報 |
| 自傷或自殺訊號 | 美國多個州現已立法要求危機處理程序 |
| 對真實人物的威脅 | 可能造成現實中的傷害 |
| 你自己的舉報或客服單 | 你請人去看 |
| 反覆嘗試繞過過濾 | 執行服務條款 |
| 隨機質素抽樣 | 改善產品,若政策允許 |
新法律增加了什麼
美國的陪伴聊天機械人法律,從 2025 年的紐約州開始,再到 2026 年的加州,要求軟件偵測自殺念頭與自傷的表達,並將用戶轉介到危機服務。加州也要求公司報告其處理程序。實際上,這代表對最敏感的對話有更多的自動監控,而不是更少。細節請見美國的 AI 伴侶法律。
從政策裡讀出這些
在私隱權政策與條款中搜尋:
- 「審查」、「內容管理」、「真人」:是否有人讀對話,以及為什麼。
- 「承包商」或「服務提供者」:審查員是否替別人工作。
- 「改善」、「訓練」:一般聊天是否被抽樣。
- 「執法機關」、「法律程序」、「法院命令」:資料何時被交出,以及是否需要法院命令。
謹慎的政策會列出觸發條件,並說明審查員只在必要時才看到對話。含糊的政策若讓員工可以「為任何業務目的存取所有內容」,同樣也說明了一些事。我們的四項私隱檢查涵蓋了文件的其餘部分。
實用的結論
- 寫的時候,當作審查員可能會讀到。 因為在少數情況下,真的會有人讀。
- 不要把其他人的可識別資訊放進聊天中, 尤其是在露骨的場景裡,審查員讀到被標記的對話時,也會看到這些。
- 如果過濾在虛構情節中誤判, 通常用一句跳出角色的說明就能解決;在角色內爭辯反而可能產生更多標記。
- 如果你最在意的是誰能讀到你的聊天內容, 唯一沒有其他人能讀的做法,就是在自己電腦上執行的 AI 伴侶,請見在本機執行 AI 伴侶。
內容審查不等於監控。對絕大多數的對話來說,自動過濾之外,沒有任何東西、也沒有任何人會再多看一眼。但例外情況由政策決定,而不是軟件的溫暖語氣決定,在需要之前先知道,是值得的。