Un sito dedicato al lavoro pubblica e rimuove continuamente annunci. A differenza di un sito vetrina le cui pagine rimangono stabili per mesi, un portale di offerte di lavoro vede il suo contenuto cambiare ogni giorno: nuove pubblicazioni, posti occupati, schede archiviate. Esplorare tutte queste pagine implica comprendere come sono organizzate, indicizzate e talvolta nascoste.
Sitemap XML su un sito di lavoro: cosa rivela davvero questa pagina tecnica
Il sitemap XML è un file che elenca gli URL che un sito desidera rendere visibili ai motori di ricerca. Su un portale di lavoro, questo file gioca un ruolo particolare perché gli annunci hanno una vita breve.
Quando un’offerta scade, l’URL corrispondente deve essere rimosso dalla sitemap o restituire un codice HTTP appropriato. Senza questo aggiornamento, i motori continuano a indicizzare pagine obsolete, il che degrada l’esperienza di navigazione per i candidati.
Accedere al sitemap di un sito di lavoro consente di distinguere rapidamente le pagine attive (offerte in corso, schede professionali, pagine di categorie) dalle pagine statiche (note legali, chi siamo). Per accedervi, è generalmente sufficiente aggiungere /sitemap/ o /sitemap.xml alla fine del nome di dominio. È proprio consultando questo tipo di pagina che si può vedere tutte le pagine di Tous un Job e misurare l’estensione reale del catalogo di offerte proposto.

Indexing API e dati strutturati JobPosting: il meccanismo riservato alle offerte di lavoro
Google raccomanda ai siti che pubblicano offerte di lavoro di utilizzare l’Indexing API piuttosto che attendere il passaggio classico di Googlebot. Questo meccanismo consente di segnalare direttamente a Google che una pagina è stata pubblicata, modificata o rimossa.
L’interesse è evidente: un annuncio messo online lunedì mattina può apparire nei risultati di ricerca molto più rapidamente rispetto a un semplice sitemap. Tuttavia, il sitemap rimane necessario per coprire l’intero sito.
I limiti concreti dell’Indexing API
L’API prevede un quota iniziale destinata ai test e all’integrazione. Per un uso su larga scala, è necessaria un’approvazione aggiuntiva. Secondo Search Engine Journal (settembre 2026), diversi siti di lavoro hanno segnalato ritardi o assenza di risposta riguardo a queste richieste di aumento della quota.
Questo scostamento tra la raccomandazione ufficiale di Google e la realtà operativa crea una situazione frustrante per gli editori di piccole o medie dimensioni. I grandi portali dispongono delle risorse tecniche per gestire queste limitazioni, mentre i siti più modesti rimangono dipendenti dal crawl classico.
Per quanto riguarda i dati strutturati, il markup JobPosting (schema.org) consente ai motori di identificare il titolo del lavoro, il luogo, lo stipendio e la data di pubblicazione direttamente nel codice della pagina. Questo markup alimenta i riquadri “offerte di lavoro” che appaiono nei risultati di Google.
Pagine orfane e annunci scaduti: le zone invisibili di un sito di lavoro
Su un sito di lavoro attivo, una proporzione significativa di pagine non è accessibile né dal menu principale, né dai risultati di ricerca interna. Queste pagine orfane esistono tecnicamente ma non sono collegate a nessun’altra pagina del sito.
Appaiono tipicamente in tre casi:
- Un’offerta è stata rimossa dal listing principale ma il suo URL rimane attivo, senza reindirizzamento né codice 410 (Gone)
- Una pagina di categoria è stata rinominata o ristrutturata, lasciando vecchi URL senza link in entrata
- Un modulo di candidatura o una pagina di conferma rimane dopo la chiusura del reclutamento
Perché il semplice noindex non è sempre sufficiente
Aggiungere un tag noindex impedisce alla pagina di apparire nei risultati di ricerca, ma rimane fisicamente presente sul server. Google può continuare a visitarla senza indicizzarla, il che consuma budget di crawl.
Per le offerte scadute, la rimozione definitiva con un codice 410 o un reindirizzamento 301 verso una pagina di offerte simili rimane il metodo più pulito. Un codice 410 indica esplicitamente che la risorsa non esiste più, il che accelera la pulizia dell’indice.

Strumenti per esplorare tutte le pagine di un sito di lavoro online
Numerosi approcci consentono di redigere un inventario completo degli URL di un portale di lavoro, ognuno con i propri punti di forza e le proprie zone d’ombra.
- L’operatore di ricerca
site:in Google (ad esempiosite:esempio.it) mostra le pagine indicizzate, ma ignora quelle bloccate dal file robots.txt o contrassegnate come noindex - Il file robots.txt, accessibile alla radice del sito, indica quali directory sono vietate al crawl. Su un sito di lavoro, alcune cartelle (area candidati, back-office) figurano logicamente
- Un crawler come Screaming Frog o Xenu esplora il sito link per link e genera un elenco esaustivo degli URL accessibili, comprese le pagine non indicizzate ma tecnicamente collegate
- La Google Search Console, accessibile solo al proprietario del sito, fornisce l’elenco delle pagine indicizzate, quelle con errori e quelle escluse volontariamente
Combinare il sitemap con un crawler esterno offre la visione più completa. Il sitemap mostra ciò che il sito desidera rendere visibile. Il crawler mostra ciò che è realmente accessibile seguendo i link.
Dati strutturati e navigazione a faccette: l’architettura nascosta dei portali di lavoro
I siti di lavoro utilizzano massicciamente la navigazione a faccette: filtri per città, tipo di contratto, settore di attività, livello di esperienza. Ogni combinazione di filtri genera potenzialmente un URL distinto.
Un portale che offre filtri per regione, professione e tipo di contratto può teoricamente creare migliaia di combinazioni di URL. La maggior parte di queste pagine filtrate è volutamente esclusa dall’indicizzazione per evitare contenuti duplicati, ma esistono effettivamente sul server.
Per un candidato, comprendere questa meccanica consente di navigare in modo più efficace. Piuttosto che scorrere i risultati pagina per pagina, modificare direttamente i parametri dell’URL consente di accedere a combinazioni di filtri specifiche che l’interfaccia non propone sempre in modo evidente.
La struttura di un sito di lavoro riflette un compromesso permanente tra completezza e leggibilità. Il sitemap, i dati strutturati e la gestione delle pagine scadute formano un ecosistema tecnico la cui qualità determina direttamente la facilità con cui un candidato trova l’offerta che gli corrisponde.



