Cosa vedono i crawler AI – e cosa no

Gran parte di ciò che è considerato scontato nella SEO quotidiana è invisibile per i LLM in modalità conversazionale. Il nuovo studio Writesonic 2026 ha analizzato sei principali crawler LLM (ChatGPT, Claude, Gemini-Conversation, Perplexity, Bing Copilot, Google AI Overviews) e ha confermato: tutti i contenuti devono essere erogati in modo da rimanere comprensibili senza JavaScript, senza eccessivo scrolling e senza metadati nell'head.
I tre livelli di crawler (HTML-only / Headless / Full-Browser)
Per orientarsi, è utile una semplice griglia in cui gli odierni crawler LLM rientrano solitamente nei Tier 1–2:
- Tier 1: HTML-only Parser – leggono HTML statico, seguono i link in modo limitato, non eseguono JavaScript, non effettuano lo scrolling.
- Tier 2: Headless Light – possono analizzare l'HTML in modo più robusto, considerare singoli fallback (es. <noscript>), ma senza un vero rendering o scrolling.
- Tier 3: Full-Browser – eseguono JavaScript e rendering complessi ed effettuano lo scrolling. Nello studio, tuttavia, dominano i comportamenti dei Tier 1–2.
Cosa vedono (e cosa no) in modo affidabile tutti i 6 LLM
I test di Writesonic rivelano modelli chiari:
- 3 LLM su 6 non eseguono JavaScript. I contenuti JS-only (SPA, recensioni iniettate lato client, contenuti lazy-load) rimangono invisibili.
- 0 LLM su 6 leggono JSON-LD in modalità conversazione live. Importante: il JSON-LD rimane rilevante per l'indice di ricerca di Google – sono due mondi diversi.
- 0 LLM su 6 leggono la Meta-Description o i tag OG in modalità conversazione.
- 5 LLM su 6 leggono il tag <title> in modo affidabile. È quindi l'elemento head più importante per la lettura dei LLM.
- 0 LLM su 6 effettuano lo scrolling. I contenuti "below the fold" e le immagini/blocchi di testo caricati in modalità lazy vengono ignorati.
- 4 LLM su 6 leggono i fallback <noscript>.
- Il contenuto nascosto tramite CSS (es. display:none, accordion) è visibile; i pseudo-contenuti ::before/::after sono invisibili.
- I microdati nel body vengono letti meglio del JSON-LD nell'head.
Il Title-Tag è il nuovo oro — raccomandazioni pratiche
Se 5 crawler su 6 leggono il Title in modo affidabile, esso diventa la leva centrale. Raccomandazioni:
- Preciso, denso di informazioni, sotto i 60 caratteri; evitate frasi fatte vuote.
- Proposta di struttura: Argomento primario | beneficio concreto | brand.
- Variate in base al tipo di pagina (categoria, prodotto, guida), ma mantenete la terminologia coerente.
- Posizionate i termini più forti all'inizio; il nome del brand alla fine, a meno che non ci sia una forte domanda di brand.
- Sincronizzate semanticamente H1 e Title, senza farne una copia cieca: il Title sintetizza, l'H1 spiega.
Il JSON-LD non è morto, ma i Microdata vincono nella lettura LLM
Lo studio dimostra che: in modalità conversazione, il JSON-LD non viene letto, mentre i Microdata nel body hanno maggiori probabilità di esserlo. Raccomandazioni operative:
- Mantenete il JSON-LD per l'indice di ricerca (prodotti, FAQ, organizzazione, breadcrumb).
- Specchiate i fatti critici come Microdata direttamente nel body visibile (prezzi, disponibilità, recensioni), con contenuti identici a quelli del JSON-LD.
- Evitate contraddizioni tra dati strutturati e testo visibile.
- Utilizzate elementi HTML semantici (article, header, nav, main, footer) per strutturare in modo pulito il contenuto del body per i parser.
Lazy Loading & Below-the-fold — i killer sottovalutati
Poiché 0 LLM su 6 effettuano lo scrolling, i meccanismi di lazy-load escludono i contenuti centrali dalla percezione. Conseguenze:
- Posizionate il messaggio principale, gli USP del prodotto, i prezzi e le call-to-action primarie al di sopra dell'altezza del primo viewport.
- Caricate immagini/contenuti testuali rilevanti per l'hero senza lazy-load (o con fallback inline lato server). Non utilizzate l'iniezione puramente lato client per i contenuti principali.
- Offrite fallback <noscript> per gli asset critici (es. immagini prodotto statiche, abstract testuali).
- Controllate le SPA e i widget delle recensioni: senza rendering lato server rimangono invisibili.
Cosa ne fa il nostro audit
Stiamo ampliando gli audit tecnici con quattro controlli mirati e adattando moderatamente i pesi:
- title_tag_present: verifica l'esistenza, la lunghezza e la precisione del title tag per ogni URL.
- lazy_loaded_main_content: avviso se i contenuti essenziali sono caricati esclusivamente in lazy-load o diventano visibili solo dopo l'interazione.
- noscript_fallback_present: rileva se esiste un fallback <noscript> per immagini/moduli di testo critici.
- css_generated_critical_content: segnala il rischio se i testi rilevanti sono generati tramite pseudo-elementi CSS (::before/::after). Il peso dei singoli segnali on-page viene moderatamente spostato a favore dell'HTML above-the-fold e della qualità del markup semantico.
Conclusione e 5 misure concrete per i gestori di shop
Lo studio separa i classici segnali SEO da ciò che i LLM colgono effettivamente in modalità dialogo. Puntate su contenuti robusti erogati in modalità HTML-first e proteggete le informazioni critiche dalle limitazioni del rendering. Cinque misure prioritarie:
- Affinare il programma dei Title: ogni pagina di categoria e ogni prodotto riceve un titolo preciso, breve e orientato al beneficio.
- Consolidare l'above-the-fold: USP, prezzo, disponibilità, CTA primaria e un paragrafo descrittivo direttamente nell'HTML renderizzato dal server.
- Progressive Enhancement anziché JS-only: gestire SPA e widget con SSR/ISR o fallback statici; non iniettare testi critici tramite JavaScript.
- Raddoppiare i dati strutturati: mantenere JSON-LD, ma contrassegnare le informazioni chiave anche come Microdata nel body.
- Controllo fallback e CSS: fallback <noscript> per i moduli principali; non inserire testi critici per il business in ::before/::after.
I risultati di Writesonic forniscono quindi linee guida chiare: ciò che non si trova nell'HTML iniziale e above the fold, di fatto non esiste per molti LLM. Allineate i vostri template di conseguenza e convalidate regolarmente con controlli reali dei crawler.