# ────────────────────────────────────────────────────────────────────── # Hyreskollen robots.txt # # Två kategorier av disallows: # 1. SEO/dataskrapnings-bots vi inte vill ha (sänker serverlast, inget värde) # 2. Web-arkiv-bots (förhindrar tredjeparts-snapshots av vår data) # # AI-bots är MEDVETET INTE blockerade (ändrat 2026-08-20, peber): vi vill att # Google (inkl. Google-Extended → Gemini/AI Overviews), Meta AI och stora # LLM:er som ChatGPT/Claude/Perplexity kan läsa och citera hyreskollen i sina # svar — även för träningsdata, inte bara realtidshämtning. De bots som # tidigare låg i en egen AI-kategori här (GPTBot, ClaudeBot, anthropic-ai, # PerplexityBot, CCBot, Google-Extended, FacebookBot, Meta-ExternalAgent/ # -Fetcher m.fl.) träffas nu bara av wildcard-gruppens path-disallows längst # ner — samma regler som alla andra okända bots (inkl. Googlebot, som aldrig # stod i en egen blockeringsgrupp). # # Hederliga bots respekterar disallows här. Oärliga gör det inte — se # Cloudflare AI/Bot Fight Mode + WAF-regler för det. Disallow ger oss också # en dokumenterad signal för EU-databasdirektivet (96/9/EG) om vi behöver # argumentera juridiskt mot återpublicering av kategori 1 och 2 nedan. # ────────────────────────────────────────────────────────────────────── # 1. SEO-/dataskrapnings-bots User-agent: Yandex Disallow: / User-agent: baiduspider Disallow: / User-agent: MJ12bot Disallow: / User-agent: AhrefsBot Disallow: / User-agent: SemrushBot Disallow: / User-agent: GrapeshotCrawler Disallow: / User-agent: domaincrawler Disallow: / User-agent: BLEXBot Disallow: / User-agent: proximic Disallow: / User-agent: AddThis Disallow: / User-agent: spbot Disallow: / User-agent: dotbot Disallow: / User-agent: PetalBot Disallow: / User-agent: DataForSeoBot Disallow: / User-agent: SeekportBot Disallow: / User-agent: SerpstatBot Disallow: / User-agent: ZoominfoBot Disallow: / # 2. Web-arkiv-bots (förhindra Wayback-snapshots) User-agent: ia_archiver Disallow: / User-agent: archive.org_bot Disallow: / # Metas sökindexerare (meta-webindexer, 2a03:2880::/32). Följer bevisligen INTE # wildcard-gruppens Disallow /minasidor/ (juli 2026: tusentals hits på # login/create_account?redirect=… → en sessionsfil per cookielös request). # Egen namngiven grupp som förhoppningsvis respekteras — OBS: en bot som matchar # sin egen grupp ignorerar `*`-gruppen HELT, så alla wildcard-disallows # replikeras här. Hjälper inte detta → Cloudflare WAF-block. User-agent: meta-webindexer Disallow: /openmap/bigtile/ Disallow: /minasidor/ Disallow: /api/ Disallow: /*?force_sub= Disallow: /ut/ # ────────────────────────────────────────────────────────────────────── # Övriga / okända bots: hindrad åtkomst till tunga paths # ────────────────────────────────────────────────────────────────────── User-agent: * Disallow: /openmap/bigtile/ Disallow: /minasidor/ Disallow: /api/ Disallow: /*?force_sub= # Utgående källänk-redirect (/ut/ → extern annons). Ren redirect utan eget # innehåll; håll crawl-budgeten på objekt-/söksidorna och crawla inte ~30k # redirects ut till källsajterna. Länkarna är dessutom rel="nofollow". Se paywall.md. Disallow: /ut/ Sitemap: https://hyreskollen.se/sitemap.xml