Människor går uppför en grå askväg mot en bevakad öppning i en hög betongmur i ett färglöst apokalyptiskt landskap, medan världen bortom öppningen visar en solbelyst blomsteräng i mättade färger
Nyheter

EU:s nya AI-riktlinjer ger din robots.txt en roll, och IMY höll i pennan

Den 7 juli 2026 antog Europeiska dataskyddsstyrelsen (EDPB) ett utkast till riktlinjer om webbskrapning för generativ AI, Guidelines 03/2026 on web scraping in the context of generative AI. Svenska Integritetsskyddsmyndigheten (IMY) var huvudrapportör för arbetet, alltså den myndighet som ledde framtagandet. I dokumentet finns en detalj som gått svensk bevakning förbi, och den handlar om en fil som ligger på ditt webbhotell just nu.

Robots.txt beskrivs i praktiskt taget varje guide som en artighetsförfrågan utan rättslig verkan. Tekniskt stämmer det fortfarande. Men EDPB gör filen till något annat i två sammanhang som spelar roll enligt GDPR. Den blir ett faktum som ska vägas in i en rättslig bedömning av om skrapningen alls är tillåten.

Först en nödvändig reservation. Riktlinjerna är ett utkast som ligger ute på offentligt samråd till och med den 30 oktober 2026. Det är alltså inte fastställd praxis, ordalydelsen kan ändras och paragrafnumren kan flyttas innan en slutversion antas. Det som följer bygger på version 1.0.

Två ställen där textfilen väger in

Riktlinjerna beskriver hur en AI-utvecklare som samlar in träningsdata från webben ska förhålla sig till dataskyddsförordningen. Robots.txt nämns första gången redan i beskrivningen av själva insamlingssteget, där EDPB skriver att steget "also implies implementing measures to exclude certain sources from the collection (e.g. websites which oppose web scraping with measures such as robots.txt or CAPTCHA)" (§11). Det är en beskrivning av hur processen ser ut, inte ett krav med egen rättsverkan.

Uppgiftsminimeringen kräver att den som skrapar utesluter sajter som säger nej

I avsnittet om åtgärder före insamlingen listar EDPB vad principen om uppgiftsminimering innebär i praktiken. Den som samlar in ska utesluta webbplatser som tydligt motsätter sig att deras innehåll skrapas, "through the use of technical measures, such as the use of robots authentication to view content, robots.txt or ai.txt files, or CAPTCHA" (§37).

Märk formuleringen "clearly oppose". En robots.txt som blockerar en namngiven AI-robot är ett tydligt uttryck för att sajten motsätter sig insamlingen. Enligt utkastet ska den som skrapar då hålla sig borta, inte för att filen har egen rättskraft, utan för att uppgiftsminimeringen i artikel 5.1 c kräver att man begränsar insamlingen till det som är nödvändigt och lämpligt.

Intresseavvägningen väger in vilka spärrar sajten har

Här väger bedömningen tyngre än vid uppgiftsminimeringen ovan. AI-bolag som skrapar webben i stor skala lutar sig i praktiken mot berättigat intresse enligt artikel 6.1 f, eftersom samtycke inte fungerar. EDPB är rakt på sak om varför. "Consent would most probably not be an applicable legal basis, since it is often difficult to obtain the consent of individuals when personal data are collected indirectly and at large scale" (§44).

Berättigat intresse förutsätter en avvägning mot de registrerades intressen och rimliga förväntningar. Bland de faktorer som EDPB räknar upp för den bedömningen finns "the restrictions imposed by the scraped website", med robots.txt, ai.txt och CAPTCHA som uttryckliga exempel. Slutsatsen i samma paragraf är den intressanta. Om de registrerade känner till att en webbplats har sådana åtgärder och sajten skrapas ändå, "it is less likely that they can expect the processing of their personal data by a scraping entity" (§64).

Två exempel direkt efter paragrafen visar hur EDPB tänker sig att det slår. I det ena laddar en person upp material till en plattform som är fritt tillgänglig, saknar förbud mot skrapning och dessutom berättar för användarna att innehållet kan komma att skrapas. Där kan man rimligen förvänta sig att tredje part hämtar materialet för att träna modeller (Exempel 4). I det andra ser det annorlunda ut:

"If a person uploads their data to a content sharing platform that prohibits scraping through the use of robots.txt files and the implementation of CAPTCHA, and expressly states on their site that they do not allow the use of their users' data for the development of AI models, they cannot reasonably expect third parties to scrape that data for that purpose." (Exempel 5)

Det är kombinationen som gör skillnaden i exemplet. Robots.txt gör inte jobbet ensam, utan filen tillsammans med CAPTCHA och en uttrycklig skriven policy på sajten. Tre signaler som pekar åt samma håll väger tyngre än en.

Frånvaro av robots.txt är inte samtycke

Riktlinjerna innehåller en motvikt som är minst lika viktig som huvudpoängen, och den bör läsas av alla som frestas att dra växlar åt andra hållet. EDPB slår fast att "the absence or non-applicability of a robots.txt file on a web site does not amount to consent within the meaning of the GDPR" (§45).

Filen är alltså ingen strömbrytare. Den som saknar robots.txt har inte sagt ja till någonting, och den som har en har inte fått en rättighet som inte redan fanns. Vad filen gör är att flytta ett faktum in i bedömningen. Resten av GDPR gäller oavsett.

Berör det här din webbplats?

Bara om det finns personuppgifter på sajten. GDPR träffar behandling av uppgifter som kan knytas till en fysisk person, och en helt anonym webbplats berörs inte den här vägen. En rent teknisk dokumentationssajt utan namn, utan bilder på människor och utan kommentarer faller utanför.

Problemet är att den beskrivningen passar väldigt få riktiga småföretagssajter. Kontaktsidan med förnamn, efternamn, direktnummer och mejladress är personuppgifter. Medarbetarpresentationer med bild är personuppgifter. Kundomdömen där någon skrivit under med namn och ort är personuppgifter. Detsamma gäller kommentarsfält, signerade blogginlägg och den där personalsidan som ingen rört på tre år.

Har du något av det på sajten är resonemanget relevant för dig. Saknar du det handlar robots.txt fortfarande om upphovsrätt och serverbelastning, vilket är fullt legitima skäl men en annan diskussion.

Vad de olika åtgärderna faktiskt gör

Fyra av åtgärderna nämns i riktlinjerna, en gör det inte, och bara två av dem stoppar faktisk trafik. De blandas ihop hela tiden, trots att de gör helt olika saker.

Åtgärd Vad den gör tekniskt Hur riktlinjerna behandlar den
robots.txt Talar om för välartade robotar vad de inte bör hämta. Stoppar ingen trafik alls. Nämns uttryckligen i §11, §37 och §64 som ett tydligt uttryck för att sajten motsätter sig skrapning.
ai.txt Samma princip i egen fil riktad mot AI-insamling. Långt mindre etablerad, ingen standard i klass med robots.txt. Nämns vid sidan av robots.txt både i §37 och i §64.
CAPTCHA Kräver en handling som bara en människa ska klara. Bromsar enkel automatik, men är ingen garanti. Nämns i §11, §37 och §64, och ingår i Exempel 5 tillsammans med robots.txt.
Inloggningsvägg Innehållet är inte fritt tillgängligt. Den som saknar konto kommer inte åt materialet. Väger tyngst. §66 c lyfter fram att skraparen bör utesluta uppgifter som bara är åtkomliga för inloggade och därför inte är fritt tillgängliga.
Blockering på servernivå Avvisar förfrågningar innan sidan levereras. Det enda i listan som verkligen stoppar trafiken. Nämns inte i riktlinjerna.

Att inloggningsväggen väger tyngst är logiskt. Innehåll bakom inloggning är inte offentligt, och hela resonemanget om rimliga förväntningar bygger på hur öppet materialet ligger. För en vanlig företagssajt är det förstås ingen framkomlig väg att låsa in kontaktsidan bakom ett konto. Poängen är snarare att veta var på skalan man befinner sig.

EDPB pekar också åt andra hållet, mot skraparens egen öppenhet. Bland skyddsåtgärderna finns att den som samlar in publicerar information om verksamheten brett och ser till "that an updated list of scraped websites is published" (§66 e). En publik lista över vilka sajter som skrapats vore, om den blev verklighet, betydligt mer användbar för webbplatsägare än någon textfil.

Så hanterar du robots.txt på ditt webbhotell

Filen ska ligga i webbroten och heta exakt robots.txt, alltså direkt i public_html eller motsvarande katalog hos din leverantör. Den nås sedan på https://dindoman.se/robots.txt. Ligger den i en undermapp har den ingen verkan. Redigering sker via filhanteraren i kontrollpanelen eller via FTP, och det är en vanlig textfil utan krav på rättigheter utöver de vanliga.

Formatet är enkelt. En rad anger vilken robot regeln gäller, nästa vad den inte får hämta. Så här ser en blockering av några av de mest kända AI-robotarna ut:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: PerplexityBot
Disallow: /

Listan över AI-robotar ändras löpande, nya tillkommer och namn byts ut, så stäm av mot respektive leverantörs egen dokumentation innan du litar på en lista du hittat någonstans. Google-Extended styr dessutom bara Googles AI-användning, inte den vanliga sökindexeringen. Googlebot berörs inte av raden ovan, så du tappar inte sökresultat på att lägga in den. Syntaxen i sig är standardiserad sedan 2022 i RFC 9309, som också slår fast att efterlevnaden är frivillig.

WordPress serverar en virtuell fil, och det lurar många

Kör du WordPress finns det en fallgrop värd att känna till. WordPress genererar en robots.txt dynamiskt när ingen fysisk fil finns i webbroten. Besöker du /robots.txt får du alltså ett svar, ser innehåll och drar slutsatsen att filen finns. Den gör den inte, den skapas i farten vid varje anrop.

Lägger du en riktig fil i webbroten tar den över helt, och den virtuella slutar användas. Alternativet är att redigera den virtuella varianten via ett SEO-tillägg, där de flesta större erbjuder ett fält för just detta. Blanda inte metoderna. Har du en fysisk fil och redigerar i tillägget kan du bli sittande och undra varför ändringen inte syns.

Vill du faktiskt stoppa trafiken krävs ett annat verktyg

Robots.txt är en förfrågan riktad till robotar som väljer att lyssna. En skrapare som struntar i filen möter inget som helst hinder, och riktlinjerna ändrar inte på den saken. De ändrar den juridiska bedömningen, inte trafiken till din server.

Vill du att förfrågningar ska avvisas på riktigt behövs regler i .htaccess eller en brandvägg som blockerar på user-agent eller IP-adress. Många webbhotell har någon form av botskydd i kontrollpanelen som gör samma sak utan handpåläggning. Notera bara att den vägen inte nämns i riktlinjerna. Vill du att din invändning ska synas i en dataskyddsbedömning behöver den vara läsbar för den som tittar, och där är robots.txt fortfarande det format som EDPB pekar på. Ai.txt kan du lägga till om du vill, men förvänta dig inte att den är lika väl förstådd på mottagarsidan.

IMY ledde arbetet och samrådet pågår

Att IMY var huvudrapportör betyder att den svenska myndigheten höll i pennan och drev arbetet fram till antagandet, vilket är ovanligt. Det ger en svensk ingång till ett dokument som annars diskuteras mest i Bryssel. IMY har publicerat en egen nyhet om antagandet, och EDPB beskriver beslutet i sitt pressmeddelande. Själva riktlinjerna finns som PDF för den som vill läsa paragraferna i sitt sammanhang.

Samrådet är öppet till och med 30 oktober 2026 och synpunkter lämnas via EDPB:s webbplats. Remissvaren från branschorganisationer och stora plattformar brukar sätta avtryck i slutversionerna, så formuleringarna ovan kan se annorlunda ut när dokumentet fastställs.

Vad det betyder i praktiken

Ingen webbplatsägare blir skyldig att göra något av det här. Riktlinjerna riktar sig till den som skrapar, alltså den personuppgiftsansvarige som bygger AI-modeller. Det som förändras är att en åtgärd du kan välja att göra numera pekas ut som något en tillsynsmyndighet ska väga in.

Kvar står att robots.txt inte stoppar en enda förfrågan. Men om en tvist någon gång landar hos IMY eller en annan tillsynsmyndighet är skillnaden mellan en sajt som tydligt sagt nej och en som inte sagt något alls inte längre bara symbolisk. Mönstret känns igen från annan EU-reglering, där ansvaret formellt ligger hos någon annan men konsekvenserna landar hos den som driver sajten. Så ser det ut både i e-bevislagen och webbhotellens skyldighet att lämna ut uppgifter och i NIS2 sett från webbhotellskundens sida.

Vill du ha kontroll över var uppgifterna faktiskt hanteras hänger frågan ihop med serverns placering och vad GDPR kräver, och den som följt turerna kring dataavtalet mellan EU och USA känner igen dynamiken. Samrådet om de här riktlinjerna pågår i flera månader till, medan åtgärden som diskuteras här, att lägga in eller uppdatera robots.txt, tar tio minuter i filhanteraren redan i dag.