Illustrazione minimalista in verde menta su nero: uno scudo attorno a un knowledge-graph blocca il training (ingressi a sinistra con X), ma lascia fluire liberamente la discovery (flusso di punti a destra) — sovranità dei dati.

Visibile all'IA, protetto dal training: sovranità dei dati con TDMRep e l'EU AI Act

btlabs Core · 23 lug 2026

C'è un effetto collaterale scomodo quando rendi il tuo sito perfettamente leggibile dall'IA: proprio quella struttura pulita che ti rende visibile nelle risposte IA ti trasforma anche nel bersaglio ideale per i data scraper che addestrano modelli IA su vasta scala. Si pone così una domanda di fondo a cui ogni azienda deve rispondere: il tuo know-how conquistato con fatica deve finire gratis nel materiale di training dei colossi tecnologici globali?

La buona notizia: non devi scegliere tra visibilità e sovranità dei dati. Puoi avere entrambe — se usi gli strumenti giusti.

robots.txt non basta

robots.txt non basta perché da un lato è uno strumento grossolano che dovresti aggiornare di continuo, e dall'altro esclude un bot IA completamente a livello di rete – non solo dal training, ma anche dal recupero in tempo reale con cui l'IA risponde a una richiesta attuale di un cliente. Il riflesso più immediato resta comunque bloccare i bot IA tramite il robots.txt.

Primo, è uno strumento grossolano: dovresti gestire manualmente centinaia di nomi di bot in continuo cambiamento — GPTBot, ClaudeBot, PerplexityBot e i loro successori. Una corsa persa in partenza.

Secondo, e più grave: chi blocca un bot IA tramite il robots.txt lo esclude completamente a livello di rete. Questo non impedisce solo la raccolta di dati di training, ma anche il recupero in tempo reale con cui l'IA risponde a una richiesta attuale di un cliente. Il risultato è la totale invisibilità nel canale automatizzato — getti via la visibilità per impedire il training. Questo non è protezione, è auto-esclusione.

La separazione netta: discovery sì, training no

Quello che ti serve è un controllo granulare invece di un muro tagliafuoco: «Visibile nella ricerca IA e per le raccomandazioni: sì. Training di massa dei modelli con i miei dati: no.»

È esattamente ciò che fa il TDM Reservation Protocol (TDMRep) del W3C Community Group. La sua forza la trae direttamente dal diritto europeo:

  • L'articolo 4 della Direttiva UE sul diritto d'autore (Direttiva CDSM 2019/790) consente in linea di principio il Text and Data Mining per scopi commerciali — a meno che i titolari dei diritti non se lo siano espressamente riservato con mezzi leggibili dalla macchina.
  • L' EU AI Act (Regolamento 2024/1689) obbliga all' articolo 53 i fornitori di grandi modelli IA a rispettare queste riserve di diritti leggibili dalla macchina — indipendentemente dal Paese in cui avviene il training.

Il tuo opt-out non è quindi solo una richiesta, ma un segnale ancorato giuridicamente.

Come funziona

TDMRep lavora con due semplici indicazioni:

  • tdm-reservation — un valore sì/no che dichiara se ti riservi i diritti per il training dell'IA.
  • tdm-policy — un rimando a condizioni leggibili dalla macchina (ad esempio: utilizzo solo previo consenso o dietro compenso).

Si può implementare in tre modi, che non interrompono il normale traffico di ricerca IA:

  • Centralizzato: un file sotto /.well-known/tdmrep.json con regole valide per tutto il sito.
  • Dinamico: i valori direttamente nell'header HTTP della risposta del server.
  • Granulare: come meta-tag nell'HTML di singole pagine, ad esempio per proteggere in modo mirato un determinato articolo specialistico.

Il punto decisivo

Il gruppo di lavoro del W3C chiarisce espressamente: le classiche funzioni di ricerca e reperibilità — esplicitamente anche nei motori di ricerca IA — non rientrano nell'opt-out dal training. In questo modo disaccoppi due cose che robots.txt confonde: scoperta (resti visibile) ed estrazione (il tuo sapere non confluisce nel training dei modelli).

Questo è il nucleo pratico della sovranità dei dati: partecipare al web dell'IA senza regalare il tuo capitale più prezioso.

Perché questo conta per la tua azienda

Conta perché i tuoi veri dati di prima parte, il tuo sapere esperto locale e i tuoi casi concreti — ciò che un'IA non può inventare — sono esattamente il valore da proteggere e giocare in modo mirato, invece di regalarlo al materiale di training. In un mondo in cui l'IA genera testo generico all'infinito, il valore dei contenuti standard scende a zero. Cosa resta prezioso? Esattamente ciò che un'IA non può inventare: i tuoi veri dati di prima parte, il tuo sapere esperto locale, i tuoi casi concreti. Questo è il tuo fossato difensivo — e non lo si regala al materiale di training, lo si protegge e lo si gioca in modo mirato.

Per un'azienda specializzata in Alto Adige questa è una vera opportunità: il tuo sapere concreto sulla tua regione, sui tuoi clienti, sulla tua nicchia è esattamente la materia prima di cui le ricerche IA hanno bisogno — e che dovresti mettere a disposizione alle tue condizioni.

È proprio questo equilibrio che btlabs Core costruisce di serie: da un'unica base dati vengono generati in parallelo il sito web visibile, i dati leggibili dalla macchina e le riserve di training giuridicamente vincolanti — sul tuo server UE, con piena sovranità dei dati.

Inquadramento onesto: questi standard sono giovani, e non tutti i fornitori IA li rispettano ancora spontaneamente. Ma in UE hanno una base giuridica, l'implementazione costa poco e la protezione della tua proprietà intellettuale vale ampiamente lo sforzo. La casa la compri, non la affitti — e questo vale anche per i tuoi dati.

Fonti & standard

  • W3C TDM Reservation Protocol (TDMRep) — W3C Community Group, Final Report 2024. w3.org
  • Direttiva (UE) 2019/790 (CDSM), articolo 4 — Text and Data Mining. eur-lex.europa.eu
  • Regolamento (UE) 2024/1689 (Regolamento sull'IA / AI Act), articolo 53 — Obblighi per i fornitori di GPAI. artificialintelligenceact.eu
  • We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — Ahrefs, 2026. ahrefs.com

Nota: TDMRep, l'EU AI Act e gli standard correlati sono un campo giovane e in evoluzione. La base giuridica in UE è fissata, l'adesione volontaria da parte di tutti i fornitori non lo è ancora.

Domande frequenti.

Il mio sito può comparire nelle risposte IA senza che i modelli IA vengano addestrati con i miei contenuti?

Sì — la visibilità nelle risposte IA e l’addestramento dei modelli sono due processi separati, che puoi gestire separatamente. La ricerca IA legge il tuo sito in tempo reale quando risponde a una domanda; per l’addestramento, invece, i contenuti vengono incorporati stabilmente nei modelli. Con riserve d’uso leggibili dalle macchine come TDMRep permetti la prima e vieti il secondo.

Posso impedire che l'IA venga addestrata con i miei contenuti — senza diventare invisibile?

Sì — con un opt-out TDM (TDMRep): una riserva d'uso leggibile dalle macchine che vieta il text and data mining dei tuoi contenuti per l'addestramento IA. La base giuridica è il quadro normativo UE, che obbliga i fornitori di grandi modelli IA a rispettare tali riserve. La lettura e la citazione da parte dei sistemi di risposta IA restano permesse — quindi rimani visibile e citabile, mentre i tuoi testi non confluiscono stabilmente nei modelli. Definisci la regola una sola volta in forma leggibile dalle macchine, invece di affidarla solo a un testo legale.

Prossimo passo

Diamo un’occhiata insieme?

Niente pitch, niente pacchetti standard — una valutazione onesta del tuo progetto. Risposta di norma entro 24 h.

Iniziamo a parlarne
Blogverzeichnis Bloggerei.de - Wissenschaftsblogs