
Visibile all'IA, protetto dal training: sovranità dei dati con TDMRep e l'EU AI Act
btlabs Core · 23 lug 2026
C'è un effetto collaterale scomodo quando rendi il tuo sito perfettamente leggibile dall'IA: proprio quella struttura pulita che ti rende visibile nelle risposte IA ti trasforma anche nel bersaglio ideale per i data scraper che addestrano modelli IA su vasta scala. Si pone così una domanda di fondo a cui ogni azienda deve rispondere: il tuo know-how conquistato con fatica deve finire gratis nel materiale di training dei colossi tecnologici globali?
La buona notizia: non devi scegliere tra visibilità e sovranità dei dati. Puoi avere entrambe — se usi gli strumenti giusti.
robots.txt non basta
robots.txt non basta perché da un lato è uno strumento grossolano che dovresti aggiornare di continuo, e dall'altro esclude un bot IA completamente a livello di rete – non solo dal training, ma anche dal recupero in tempo reale con cui l'IA risponde a una richiesta attuale di un cliente. Il riflesso più immediato resta comunque bloccare i bot IA tramite il robots.txt.
Primo, è uno strumento grossolano: dovresti gestire manualmente centinaia di nomi di bot in continuo cambiamento — GPTBot, ClaudeBot, PerplexityBot e i loro successori. Una corsa persa in partenza.
Secondo, e più grave: chi blocca un bot IA tramite il robots.txt lo esclude completamente a livello di rete. Questo non impedisce solo la raccolta di dati di training, ma anche il recupero in tempo reale con cui l'IA risponde a una richiesta attuale di un cliente. Il risultato è la totale invisibilità nel canale automatizzato — getti via la visibilità per impedire il training. Questo non è protezione, è auto-esclusione.
La separazione netta: discovery sì, training no
Quello che ti serve è un controllo granulare invece di un muro tagliafuoco: «Visibile nella ricerca IA e per le raccomandazioni: sì. Training di massa dei modelli con i miei dati: no.»
È esattamente ciò che fa il TDM Reservation Protocol (TDMRep) del W3C Community Group. La sua forza la trae direttamente dal diritto europeo:
- L'articolo 4 della Direttiva UE sul diritto d'autore (Direttiva CDSM 2019/790) consente in linea di principio il Text and Data Mining per scopi commerciali — a meno che i titolari dei diritti non se lo siano espressamente riservato con mezzi leggibili dalla macchina.
- L' EU AI Act (Regolamento 2024/1689) obbliga all' articolo 53 i fornitori di grandi modelli IA a rispettare queste riserve di diritti leggibili dalla macchina — indipendentemente dal Paese in cui avviene il training.
Il tuo opt-out non è quindi solo una richiesta, ma un segnale ancorato giuridicamente.
Come funziona
TDMRep lavora con due semplici indicazioni:
tdm-reservation— un valore sì/no che dichiara se ti riservi i diritti per il training dell'IA.tdm-policy— un rimando a condizioni leggibili dalla macchina (ad esempio: utilizzo solo previo consenso o dietro compenso).
Si può implementare in tre modi, che non interrompono il normale traffico di ricerca IA:
- Centralizzato: un file sotto
/.well-known/tdmrep.jsoncon regole valide per tutto il sito. - Dinamico: i valori direttamente nell'header HTTP della risposta del server.
- Granulare: come meta-tag nell'HTML di singole pagine, ad esempio per proteggere in modo mirato un determinato articolo specialistico.
Il punto decisivo
Il gruppo di lavoro del W3C chiarisce espressamente: le classiche funzioni di ricerca e reperibilità — esplicitamente anche nei motori di ricerca IA — non rientrano nell'opt-out dal training. In questo modo disaccoppi due cose che robots.txt confonde: scoperta (resti visibile) ed estrazione (il tuo sapere non confluisce nel training dei modelli).
Questo è il nucleo pratico della sovranità dei dati: partecipare al web dell'IA senza regalare il tuo capitale più prezioso.
Perché questo conta per la tua azienda
Conta perché i tuoi veri dati di prima parte, il tuo sapere esperto locale e i tuoi casi concreti — ciò che un'IA non può inventare — sono esattamente il valore da proteggere e giocare in modo mirato, invece di regalarlo al materiale di training. In un mondo in cui l'IA genera testo generico all'infinito, il valore dei contenuti standard scende a zero. Cosa resta prezioso? Esattamente ciò che un'IA non può inventare: i tuoi veri dati di prima parte, il tuo sapere esperto locale, i tuoi casi concreti. Questo è il tuo fossato difensivo — e non lo si regala al materiale di training, lo si protegge e lo si gioca in modo mirato.
Per un'azienda specializzata in Alto Adige questa è una vera opportunità: il tuo sapere concreto sulla tua regione, sui tuoi clienti, sulla tua nicchia è esattamente la materia prima di cui le ricerche IA hanno bisogno — e che dovresti mettere a disposizione alle tue condizioni.
È proprio questo equilibrio che btlabs Core costruisce di serie: da un'unica base dati vengono generati in parallelo il sito web visibile, i dati leggibili dalla macchina e le riserve di training giuridicamente vincolanti — sul tuo server UE, con piena sovranità dei dati.
Inquadramento onesto: questi standard sono giovani, e non tutti i fornitori IA li rispettano ancora spontaneamente. Ma in UE hanno una base giuridica, l'implementazione costa poco e la protezione della tua proprietà intellettuale vale ampiamente lo sforzo. La casa la compri, non la affitti — e questo vale anche per i tuoi dati.
Fonti & standard
- W3C TDM Reservation Protocol (TDMRep) — W3C Community Group, Final Report 2024. w3.org
- Direttiva (UE) 2019/790 (CDSM), articolo 4 — Text and Data Mining. eur-lex.europa.eu
- Regolamento (UE) 2024/1689 (Regolamento sull'IA / AI Act), articolo 53 — Obblighi per i fornitori di GPAI. artificialintelligenceact.eu
- We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — Ahrefs, 2026. ahrefs.com
Nota: TDMRep, l'EU AI Act e gli standard correlati sono un campo giovane e in evoluzione. La base giuridica in UE è fissata, l'adesione volontaria da parte di tutti i fornitori non lo è ancora.
Domande frequenti.
Il mio sito può comparire nelle risposte IA senza che i modelli IA vengano addestrati con i miei contenuti?
Sì — la visibilità nelle risposte IA e l’addestramento dei modelli sono due processi separati, che puoi gestire separatamente. La ricerca IA legge il tuo sito in tempo reale quando risponde a una domanda; per l’addestramento, invece, i contenuti vengono incorporati stabilmente nei modelli. Con riserve d’uso leggibili dalle macchine come TDMRep permetti la prima e vieti il secondo.
Posso impedire che l'IA venga addestrata con i miei contenuti — senza diventare invisibile?
Sì — con un opt-out TDM (TDMRep): una riserva d'uso leggibile dalle macchine che vieta il text and data mining dei tuoi contenuti per l'addestramento IA. La base giuridica è il quadro normativo UE, che obbliga i fornitori di grandi modelli IA a rispettare tali riserve. La lettura e la citazione da parte dei sistemi di risposta IA restano permesse — quindi rimani visibile e citabile, mentre i tuoi testi non confluiscono stabilmente nei modelli. Definisci la regola una sola volta in forma leggibile dalle macchine, invece di affidarla solo a un testo legale.


