
Visibile all'IA, no al training: sovranità dei dati con TDMRep e l'EU AI Act
Berger+Team · 25 set 2026
Tema: Sovranità dei dati e sicurezza
C'è un effetto collaterale scomodo quando rendi il tuo sito perfettamente leggibile dall'IA: proprio quella struttura pulita che ti rende visibile nelle risposte IA ti trasforma anche nel bersaglio ideale per i data scraper che addestrano modelli IA su vasta scala. Si pone così una domanda di fondo a cui ogni azienda deve rispondere: il tuo know-how conquistato con fatica deve finire gratis nel materiale di training dei colossi tecnologici globali?
La buona notizia: non devi scegliere tra visibilità e sovranità dei dati. Puoi avere entrambe — se usi gli strumenti giusti.
robots.txt non basta
robots.txt non basta perché da un lato è uno strumento grossolano che dovresti aggiornare di continuo, e dall'altro esclude completamente un bot IA che la rispetta – non solo dal training, ma anche dal recupero in tempo reale con cui l'IA risponde a una richiesta in corso di un cliente. Il riflesso più immediato resta comunque bloccare i bot IA tramite il robots.txt.
Primo, è uno strumento grossolano: dovresti gestire manualmente centinaia di nomi di bot in continuo cambiamento — GPTBot, ClaudeBot, PerplexityBot e i loro successori. Una corsa persa in partenza.
Secondo, e più grave: chi blocca un bot IA tramite il robots.txt lo esclude completamente, se il bot la rispetta. Questo non impedisce solo la raccolta di dati di training, ma anche il recupero in tempo reale con cui l'IA risponde a una richiesta in corso di un cliente. Il risultato è la totale invisibilità nel canale automatizzato — getti via la visibilità per impedire il training. Questo non è protezione, è auto-esclusione.
La separazione netta: discovery sì, training no
Quello che ti serve è un controllo granulare invece di un muro tagliafuoco: «Visibile nella ricerca IA e per le raccomandazioni: sì. Training di massa dei modelli con i miei dati: no.»
È esattamente ciò che fa il TDM Reservation Protocol (TDMRep) del W3C Community Group. La sua forza la trae direttamente dal diritto europeo:
- L'articolo 4 della Direttiva UE sul diritto d'autore (Direttiva CDSM 2019/790) consente in linea di principio il Text and Data Mining per scopi commerciali — a meno che i titolari dei diritti non se lo siano espressamente riservato con mezzi leggibili dalla macchina.
- L' EU AI Act (Regolamento 2024/1689) obbliga all' articolo 53 i fornitori di grandi modelli IA a rispettare queste riserve di diritti leggibili dalla macchina — indipendentemente dal Paese in cui avviene il training.
Il tuo opt-out non è quindi solo una richiesta, ma un segnale ancorato giuridicamente.
Come funziona
TDMRep lavora con due semplici indicazioni:
tdm-reservation— un valore sì/no che dichiara se ti riservi i diritti per il training dell'IA.tdm-policy— un rimando a condizioni leggibili dalla macchina (ad esempio: utilizzo solo previo consenso o dietro compenso).
Si può implementare in tre modi, che non interrompono il normale traffico di ricerca IA:
- Centralizzato: un file sotto
/.well-known/tdmrep.jsoncon regole valide per tutto il sito. - Dinamico: i valori direttamente nell'header HTTP della risposta del server.
- Granulare: come meta-tag nell'HTML di singole pagine, ad esempio per proteggere in modo mirato un determinato articolo specialistico.
Il punto decisivo
Il gruppo di lavoro del W3C chiarisce espressamente: le classiche funzioni di ricerca e reperibilità — esplicitamente anche nei motori di ricerca IA — non rientrano nell'opt-out dal training. In questo modo disaccoppi due cose che robots.txt confonde: scoperta (resti visibile) ed estrazione (ti opponi a che il tuo sapere confluisca nel training dei modelli).
Questo è il nucleo pratico della sovranità dei dati: partecipare al web dell'IA senza regalare il tuo capitale più prezioso.
Perché questo conta per la tua azienda
Conta perché i tuoi veri dati di prima parte, il tuo sapere esperto locale e i tuoi casi concreti — ciò che un'IA non può inventare — sono esattamente il valore da proteggere e giocare in modo mirato, invece di regalarlo al materiale di training. In un mondo in cui l'IA genera testo generico all'infinito, il valore dei contenuti standard scende a zero. Cosa resta prezioso? Esattamente ciò che un'IA non può inventare: i tuoi veri dati di prima parte, il tuo sapere esperto locale, i tuoi casi concreti. Questo è il tuo fossato difensivo — e non lo si regala al materiale di training, lo si protegge e lo si gioca in modo mirato.
Per un'azienda specializzata in Alto Adige questa è una vera opportunità: il tuo sapere concreto sulla tua regione, sui tuoi clienti, sulla tua nicchia è esattamente la materia prima di cui le ricerche IA hanno bisogno — e che dovresti mettere a disposizione alle tue condizioni.
È proprio questo equilibrio che btlabs Core costruisce di serie: da un'unica base dati vengono generati in parallelo il sito web visibile, i dati leggibili dalla macchina e le riserve di training leggibili dalle macchine secondo il diritto UE — sul tuo server UE, con piena sovranità dei dati.
Inquadramento onesto: questi standard sono giovani, e non tutti i fornitori IA li rispettano ancora spontaneamente. Ma in UE hanno una base giuridica, l'implementazione costa poco e la protezione della tua proprietà intellettuale vale ampiamente lo sforzo. La casa la compri, non la affitti — e questo vale anche per i tuoi dati.
Fonti & standard
- W3C TDM Reservation Protocol (TDMRep) — W3C Community Group, Final Report 2024. w3.org
- Direttiva (UE) 2019/790 (CDSM), articolo 4 — Text and Data Mining. eur-lex.europa.eu
- Regolamento (UE) 2024/1689 (Regolamento sull'IA / AI Act), articolo 53 — Obblighi per i fornitori di GPAI. artificialintelligenceact.eu
- We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — Ahrefs, 2026. ahrefs.com
Nota: TDMRep, l'EU AI Act e gli standard correlati sono un campo giovane e in evoluzione. La base giuridica in UE è fissata, l'adesione volontaria da parte di tutti i fornitori non lo è ancora.
Domande frequenti.
Il mio sito può comparire nelle risposte IA senza che i modelli IA vengano addestrati con i miei contenuti?
Sì — la visibilità nelle risposte IA e l’addestramento dei modelli sono due processi separati, che puoi gestire separatamente. La ricerca IA legge il tuo sito in tempo reale quando risponde a una domanda; per l’addestramento, invece, i contenuti vengono incorporati stabilmente nei modelli. Con riserve d’uso leggibili dalle macchine come TDMRep permetti la prima e vieti il secondo.
Posso impedire che l'IA venga addestrata con i miei contenuti — senza diventare invisibile?
Sì — con un opt-out TDM (TDMRep): una riserva d'uso leggibile dalle macchine che vieta il text and data mining dei tuoi contenuti per l'addestramento IA. La base giuridica è il quadro normativo UE, che obbliga i fornitori di grandi modelli IA a rispettare tali riserve. La lettura e la citazione da parte dei sistemi di risposta IA restano permesse — quindi rimani visibile e citabile. Definisci la regola una sola volta in forma leggibile dalle macchine, invece di affidarla solo a un testo legale. Va detto con onestà: è una dichiarazione, non un blocco tecnico — chi non la rispetta non viene fermato. La riserva è però il presupposto perché tu possa farla valere.


