Google usa le foto e le registrazioni per addestrare l’AI
Google lo conferma direttamente: Come la vostra Cronologia servizi di ricerca, anche i media salvati vengono utilizzati per sviluppare e migliorare i servizi Google e le tecnologie, inclusi i modelli AI generativi e le misure di sicurezza.
La modifica, annunciata a giugno con un’email agli utenti, ha attivato per impostazione predefinita la raccolta di immagini, file, audio e video sotto una nuova impostazione separata.
Cosa viene raccolto
Non solo la cronologia di ricerca, adesso anche i media. Foto cercate con Lens, gli audio delle ricerche vocali, le registrazioni di Search Live, gli audio di Traduttore. L’impostazione si applica anche a Maps, Shopping, Flights, Hotels, Translate e News.
Google dice che parte di questi dati è temporanea e necessaria al funzionamento del prodotto. Ma dice anche che i media salvati possono essere conservati specificamente per addestrare l’AI, con l’aiuto di revisori umani.
Come disattivare la raccolta dati
Per disattivare la raccolta dati di Google, basta andare sulla pagina Cronologia servizi di ricerca. Deselezionare la casella “Salva media”, si può fare separatamente dalla cronologia. Naturalmente, è possibile anche deselezionare entrambe.
Configurare la cancellazione automatica dei dati salvati: ogni 3 mesi, 18 mesi o 36 mesi. Andare poi sulla pagina Personalizzazione servizi di ricerca per controllare le raccomandazioni personalizzate.
Perché Google lo fa
Invece di addestrare i modelli solo sui dati presi da Internet, Google raccoglie i dati che le persone creano e caricano usando i propri servizi. Meta fa lo stesso, addestra l’AI sulle immagini e i media degli utenti, incluse le registrazioni degli occhiali AI.
La differenza è che i dati che gli utenti creano intenzionalmente, come foto di prodotti che vogliono comprare, registrazioni vocali delle lingue che studiano, ricerche di voli, sono più specifici, più personali e più preziosi per l’addestramento AI rispetto a una pagina web qualsiasi. Il comportamento di ricerca è il dataset perfetto.