{
  "schemaVersion": "crawler-atlas-1",
  "atlasVersion": "atlas-2026-07-28-v1",
  "canonical": "/atlas/sitemap-discovery",
  "title": "Sitemap discovery",
  "category": {
    "slug": "discovery",
    "title": "Discovery and crawl frontiers"
  },
  "definition": "An XML sitemap is a canonical inventory of URLs a site would like crawlers to know about.",
  "mechanism": "Crawlers may fetch the sitemap from robots.txt, a remembered location, or a webmaster tool. The sitemap is a hint: inclusion does not guarantee fetching or indexing.",
  "validation": "Use absolute canonical URLs, accurate last-modified dates, and a cohort that has no other discovery route; observe sitemap and page requests as separate events.",
  "commonFailure": "Listing duplicates, redirects, blocked URLs, and non-canonical variants creates ambiguous signals and spends crawl attention on low-value addresses.",
  "related": [
    "/atlas/orphan-pages",
    "/atlas/seed-urls"
  ],
  "modified": "2026-07-28"
}