為法國企業部署符合 GDPR 的 LLM(Claude、Gemini、GPT)——完整檢查清單:資料假名化、資料處理協議(DPA)、不保留資料(Zero Data Retention)、日誌託管,以及 Mistral/數位主權問題。
法規最低要求
- 在任何外部 LLM 呼叫前,先對個人識別資訊(PII)進行假名化
- RGPD 第 28 條 DPA:與每一個處理資料的次處理者簽署。Kunavo 不提供此協議;如果你的處理流程需要,請直接與模型供應商簽約
- 維持最新的處理活動紀錄,包括每次 LLM 呼叫的目的
- 告知當事人:您的隱私權政策必須說明 AI 的使用情況
1)假名化——可直接使用的程式碼
在提示離開您的後端之前,先將直接識別資料替換為 token。對照表會保留在本機:
pseudonymiser.py
# Pseudonymiser les données personnelles avant l'appel LLM
import re
from openai import OpenAI
PATTERNS = [
(re.compile(r"[\w.+-]+@[\w-]+\.[\w.-]+"), "<EMAIL>"),
(re.compile(r"\b(?:\+33|0)\s*[1-9](?:\s*\d{2}){4}\b"), "<PHONE_FR>"),
# Numéro de sécurité sociale français (15 chiffres)
(re.compile(r"\b[12]\d{2}(?:0[1-9]|1[012])(?:\d{2})(?:\d{3})(?:\d{3})(?:\d{2})\b"), "<NIR>"),
# IBAN FR
(re.compile(r"\bFR\d{2}\s?(?:\d{4}\s?){5}\d{3}\b"), "<IBAN_FR>"),
]
def pseudonymiser(texte: str) -> tuple[str, dict]:
masque = texte
mapping = {}
for i, (pat, tag) in enumerate(PATTERNS):
for m in pat.finditer(texte):
cle = f"{tag}_{i}_{m.start()}"
mapping[cle] = m.group(0)
masque = masque.replace(m.group(0), f"[{cle}]")
return masque, mappingLLM 看到的是「[EMAIL_0_42] 已訂購 [IBAN_FR_3_158]」,而不是真實識別資料。如果回應需要重新注入原值(例如寄送確認電子郵件),就在事後反向替換,絕不在 API 呼叫中進行。
2)DPA——誰需要簽署什麼
- 你 ↔ Kunavo:Kunavo 不提供 RGPD 第 28 條 DPA。你的 requests 會在美國處理,並傳送給上游供應商;其各自的隱私權和資料保留政策適用於內容
- 你 ↔ 模型供應商:如果你的處理流程需要 DPA,請直接依照 Anthropic、OpenAI 或 Google 的企業條款與其簽署
- 標準契約條款(CCT):若要將資料傳輸至美國(Anthropic、OpenAI),請確認你與供應商簽署的 DPA 中包含經歐盟執委會核准的 CCT
3) Zero Data Retention(ZDR):直接與供應商合作
預設情況下,Anthropic 和 Google 會分別保留提示日誌 30 天(Anthropic)/60 天(Google),用於濫用監控。對於 GDPR 敏感工作負載:
- Kunavo:不提供 ZDR。Requests 會經由我們在美國的閘道,再傳送給上游供應商;其各自的保留政策適用於 requests
- Anthropic ZDR:Anthropic 向企業客戶提供,需直接與 Anthropic 簽約
- Google Vertex AI EU:直接與 Google Cloud 簽約,可將路由導向 europe-west1(比利時)或 europe-west4(荷蘭)——資料不會離開歐盟。Kunavo 不提供任何歐盟區域
- OpenAI:Enterprise 層級提供 ZDR,需直接與 OpenAI 簽約
Mistral 與數位主權問題
許多法國團隊希望降低對美國業者的依賴。需要考量三個面向:
- 透過 Kunavo 使用 Mistral:不行。目錄中沒有任何 Mistral 模型或其他歐洲供應商,也不存在僅路由至歐洲供應商的限制
- 直接使用 Mistral:對於真正敏感的案例(公共部門、醫療),Mistral 提供本地部署。Kunavo 無法取代這項需求
- 結合兩者:敏感案例直接使用 Mistral,強推理工作透過 Kunavo 使用 Claude。這是兩個供應商與兩組金鑰,由您的程式碼決定每次呼叫要前往何處
日誌託管與資料駐留
- Kunavo 路由:閘道位於單一區域(US-East,Ashburn)。只有前置的 anycast edge 會在您附近終止 TLS
- 帳戶持久化與計費:唯一的主要資料庫位於 US-East,並對磁碟區進行每日加密快照。沒有僅限歐盟的路由,也沒有歐盟區域儲存,即使提出要求也一樣
- 你的應用程式 logs:請自行在歐盟境內託管(OVH、Scaleway、Hetzner)。不要成為最薄弱的一環
告知當事人——應說明的內容
如果您讓 LLM 處理個人資料,隱私權政策必須加以說明。最小範本:
我們透過 Kunavo(https://kunavo.com)以次處理方式使用人工智慧模型(Anthropic Claude、Google Gemini、OpenAI GPT),用途如下:[分類、摘要、回覆生成等]。個人資料會在傳送前進行假名化。Kunavo 不會使用這些資料訓練模型;每個模型供應商會依照其自身的隱私權與資料保留政策處理資料。你可依據 RGPD 第 15 至 21 條行使存取、更正、反對及刪除權。
上線前應檢查的事項
- 與每個次處理者簽署 DPA(直接與模型供應商簽署;Kunavo 不提供)
- 處理活動紀錄保持最新
- 已在真實樣本上測試假名化(外洩率 < 0.1%)
- 日誌位於歐盟區域
- 具備回應第 17 條請求(刪除權)的程序
- 隱私權政策已更新並可供存取
- 若為大規模或敏感處理,已諮詢資料保護長(DPO)
準備開始了嗎?免費註冊,然後從 10 $ 起儲值。