Il 404 Media ha scoperto che OpenAI sta assumendo centinaia di collaboratori che leggono una mole enorme di richieste reali degli utenti di ChatGPT, talvolta contenenti informazioni personali sensibili. Il compito di questi collaboratori è migliorare le risposte di ChatGPT: i collaboratori valutano e criticano le risposte generate dal chatbot. I revisori non vedono i nomi degli utenti e OpenAI ha dichiarato a 404 Media che sta cercando di rimuovere i dati personali prima che le richieste arrivino a loro, utilizzando il modello Privacy Filter, anche se a volte i dettagli sensibili riescono comunque a sfuggire al filtro.
Questa notizia non mi sorprende né mi spaventa: avrei reagito con calma assoluta anche a un contenuto ancora più «scandaloso». Nei decenni trascorsi su internet ho fatto in tempo a capire che qualsiasi scambio di informazioni può in qualsiasi momento diventare accessibile a terzi (non necessariamente truffatori) o addirittura diventare di dominio pubblico: proprio per questo riduco al minimo le informazioni «sensibili» che invio o conservo in rete. Mi aspetto lo stesso atteggiamento nei confronti dei dati da ogni persona adulta.
Mentre il post di oggi l’ho scritto per il seguente motivo: leggendo degli appaltatori di OpenAI, mi sono ricordato di come, alla fine dell’altro decennio, alcuni miei conoscenti spiegassero con estrema serietà la propria riluttanza a registrarsi su Facebook e altri social network con il timore per i propri dati personali. La mia osservazione «ma chi ti obbliga a fornire ai social network i tuoi dati personali [reali]?» provocava un blocco mentale irreversibile nei miei interlocutori. In questo senso, a volte mi sembra che l’umanità non sia ancora maturata del tutto.
P.S.: ovviamente, non ho potuto non intervistare il mitico ChatGPT…
La mia domanda:
Ho appena letto una notizia curiosa: i tuoi creatori avrebbero ingaggiato centinaia di collaboratori umani che leggono le conversazioni tra te e i tuoi utenti per «migliorare le tue risposte». Come puoi commentare questa notizia?
La sua risposta:
Sì, ma la notizia va **separata in due affermazioni diverse**, perché messe insieme possono dare un’impressione più inquietante di quanto dicano realmente i fatti.
La prima — **che OpenAI utilizzi esseri umani per esaminare alcune conversazioni e migliorare i modelli** — è sostanzialmente vera. La seconda — **che ci siano «centinaia di persone che leggono le conversazioni degli utenti» sistematicamente** — richiede invece parecchie precisazioni.
### Perché servono esseri umani?
È una cosa abbastanza logica dal punto di vista tecnico.
Un modello come me può generare miliardi di risposte, ma per capire se una risposta è *davvero* buona bisogna avere esempi valutati dagli esseri umani. Per esempio:
> Utente: «Spiegami la relatività speciale come se avessi 12 anni.»
>
> Risposta A: corretta ma incomprensibile.
> Risposta B: semplice, corretta e con un buon esempio.
> Risposta C: semplice ma contiene un errore.Un valutatore umano può stabilire che **B è migliore di A e C**. Questi giudizi possono poi essere utilizzati nell’addestramento e nella valutazione dei modelli.
E OpenAI dichiara esplicitamente che, per i servizi consumer come ChatGPT, i contenuti possono essere utilizzati per addestrare i modelli se l’utente non disattiva questa possibilità. Dice inoltre che vengono adottate misure per ridurre le informazioni personali prima che i dati entrino nei dataset di addestramento. ([OpenAI][1])
Quindi l’idea generale **non è affatto una leggenda**.
### Ma «qualcuno legge le mie conversazioni» non significa necessariamente quello che sembra
Ci sono almeno tre attività differenti:
1. **Addestramento sui dati**
Una conversazione può entrare, con altre migliaia o milioni di esempi, nei processi con cui vengono migliorati i modelli.2. **Valutazione umana**
Alcune conversazioni o risposte possono essere esaminate da persone incaricate di valutare qualità, sicurezza, errori ecc.3. **Moderazione/sicurezza**
OpenAI dichiara anche di utilizzare una combinazione di sistemi automatici e revisione umana per determinati contenuti segnalati o sospetti. ([OpenAI][2])Non significa quindi che **un dipendente sia seduto a leggere in tempo reale ogni conversazione che io sto avendo con te**. Sarebbe una rappresentazione decisamente fuorviante.
E c’è un’altra distinzione importante: OpenAI afferma che, nei prodotti per aziende e nell’API, gli input e gli output **non vengono utilizzati per l’addestramento per impostazione predefinita**, mentre per i servizi consumer le regole sono diverse. ([OpenAI][1])
### La parte che trovo più interessante
C’è però una conseguenza filosoficamente curiosa.
Quando parli con me, **non stai necessariamente parlando soltanto con un algoritmo isolato**. Dietro al sistema esiste una gigantesca infrastruttura di:
* ricercatori;
* ingegneri;
* valutatori umani;
* specialisti della sicurezza;
* moderatori;
* persone che costruiscono i dataset;
* persone che progettano i criteri con cui una risposta viene giudicata «buona».In questo senso la frase «sto parlando con un’intelligenza artificiale» è vera, ma non descrive l’intero fenomeno.
E c’è una cosa ancora più interessante: **le conversazioni umane sono una delle fonti attraverso cui il comportamento futuro dei modelli viene plasmato**. OpenAI lo dice abbastanza apertamente: i problemi reali incontrati dagli utenti aiutano a individuare esigenze, errori e modalità con cui migliorare i modelli. ([OpenAI][1])
Quindi, in un certo senso, quando mi fai una domanda particolarmente strana, quando mi correggi, quando mi dici «no, non hai capito cosa intendo» o quando confronti diverse mie risposte, **quel genere di interazione è esattamente il tipo di materiale che può essere utile per migliorare sistemi futuri**.
### E la privacy?
Qui invece la questione merita attenzione.
Oggi OpenAI offre il controllo **«Migliora il modello per tutti»**: se lo disattivi, le nuove conversazioni non vengono utilizzate per addestrare ChatGPT. ([OpenAI Help Center][3])
C’è inoltre la **Chat temporanea**, che secondo OpenAI non viene utilizzata per migliorare i modelli e non entra nella cronologia né crea memorie; viene tuttavia conservata per un periodo limitato per motivi di sicurezza. ([OpenAI][4])
Una sottigliezza importante: **se invii esplicitamente un feedback su una risposta**, per esempio con 👍/👎, OpenAI specifica che la conversazione associata a quel feedback può essere utilizzata per l’addestramento anche se hai precedentemente disattivato l’impostazione generale. ([OpenAI Help Center][5])
—
Quindi, se la notizia che hai letto diceva semplicemente **«OpenAI paga molti esseri umani per esaminare conversazioni e aiutare a migliorare i modelli»**, direi: **sì, è perfettamente plausibile e coerente con ciò che OpenAI stessa dichiara**.
Se invece diceva qualcosa del tipo **«centinaia di dipendenti leggono le vostre chat private una per una per sapere cosa vi dite con ChatGPT»**, prenderei quella formulazione con molta cautela. È una semplificazione giornalistica che confonde addestramento, valutazione umana, moderazione e accesso ai dati.
E c’è una domanda ancora più interessante che potremmo esaminare: **quanto di una conversazione come questa potrebbe effettivamente essere letto da un essere umano e attraverso quali passaggi potrebbe arrivare a influenzare un futuro modello?** Posso ricostruire quel percorso concreto, dall’invio del messaggio fino all’eventuale utilizzo nei dati di addestramento.
[1]: https://openai.com/policies/how-your-data-is-used-to-improve-model-performance/?utm_source=chatgpt.com «How your data is used to improve model performance | OpenAI»
[2]: https://openai.com/transparency-and-content-moderation/?utm_source=chatgpt.com «Transparency & content moderation | OpenAI»
[3]: https://help.openai.com/it-it/articles/7730893?utm_source=chatgpt.com «FAQ sui controlli dei dati | OpenAI Help Center»
[4]: https://openai.com/index/how-chatgpt-protects-privacy/?utm_source=chatgpt.com «How ChatGPT learns about the world while protecting privacy | OpenAI»
[5]: https://help.openai.com/it-it/articles/5722486-come-vengono-utilizzati-i-tuoi-dati-per-migliorare-le-prestazioni-del-modello?utm_source=chatgpt.com «Come vengono utilizzati i tuoi dati per migliorare le prestazioni del modello | OpenAI Help Center»



RSS del blog

