Gör din sajt läsbar för AI-sökmotorer och språkmodeller

Rådet återkommer i nästan varje text om AI-synlighet: lägg upp en llms.txt, så hittar språkmodellerna rätt på din sajt. Filen tar en kvart att skriva. Frågan som sällan ställs är vem som läser den.

Leverantörerna skriver själva om en annan fil. I robots.txt styr du vilka robotar som får hämta dina sidor, och där har OpenAI, Anthropic, Google, Perplexity, Meta, Apple och Common Crawl egna namngivna robotar. Huruvida din text sedan får återges i ett AI-svar avgörs på ett tredje ställe, i några direktiv i sidans HTML, och där är Microsoft tydligast av alla.

Vill du bara veta om llms.txt är värd besväret kommer svaret direkt: ingen leverantör har åtagit sig att läsa filen, Google skriver rakt ut att du inte behöver skapa nya AI-textfiler för att synas i AI-funktionerna, och i den enda större mätning som finns fick 97 procent av de giltiga filerna noll förfrågningar under en månad. Robots.txt och direktiven i sidans HTML är däremot dokumenterade, och det är där leverantörerna själva skrivit ned vad som gäller. Underlaget för siffrorna, och en färdig mall för filen, finns i avsnittet om llms.txt längre ned.

Gul metallport med en rund förbudsskylt ovanför ett dörrhandtag
Foto: Jan van der Wolf via Pexels

Tre beslut som blandas ihop

Att blockera en robot, att tillåta den och att servera den en färdigskriven sammanfattning är tre olika beslut, och bara de två första har en mekanism som leverantörerna dokumenterar.

Blockeringen sker i robots.txt, med ett Disallow riktat mot robotens namn. Tillåtandet sker på samma ställe, och det är ingen formalitet. OpenAI skriver rakt ut att sajter som valt bort OAI-SearchBot inte visas i ChatGPT:s söksvar, men att de fortfarande kan förekomma som navigeringslänkar. Den tredje idén, att lägga upp en kort textfil som modellen kan läsa i stället för hela sajten, är vad llms.txt försöker vara.

Meta säger rent ut vilken yta bolaget räknar med. Webbplatsägare bör enligt bolaget uttrycka sina önskemål med etablerad praxis som robots.txt, hellre än med format vid sidan av standarden, som NoAI-taggar.

Vad varje leverantör dokumenterar om sina robotar

Namnen nedan är hämtade ur leverantörernas egen dokumentation. Tre roller återkommer i leverantörernas listor: en robot som samlar träningsdata, en som bygger sökindexet bakom tjänstens svar, och en som hämtar en enskild sida i samma stund som en användare frågar om den.

Leverantör Namn i robots.txt Uppgift Vad leverantören säger om robots.txt
OpenAI GPTBot Träning av modellerna Ett Disallow anger att innehållet inte ska användas till träning
OAI-SearchBot Lyfter fram sajter i ChatGPT:s sökfunktion Bortvald sajt visas inte i söksvaren, men kan fortfarande förekomma som navigeringslänk. En ändring slår igenom efter ungefär ett dygn
ChatGPT-User Hämtar en sida när en användare eller en anpassad GPT frågar Reglerna i robots.txt behöver inte gälla, eftersom hämtningen startas av en användare
Anthropic ClaudeBot Träning av modellerna Bolagets robotar respekterar branschstandardens direktiv i robots.txt. Inget undantag anges för användarinitierad hämtning
Claude-SearchBot Förbättrar kvaliteten i söksvaren
Claude-User Hämtar en sida när en användare frågar Claude
Google Googlebot Sök, inklusive AI-översikterna Robotarna lyder alltid robots.txt vid automatisk crawlning
Google-Extended Träning av och grundning i Gemini Påverkar varken din närvaro i sökresultaten eller din ranking där
Perplexity PerplexityBot Lyfter fram och länkar sajter i söksvaren. Används inte till modellträning Bolaget rekommenderar att den tillåts i robots.txt
Perplexity-User Hämtar en sida när en användare frågar Hämtaren struntar i regel i robots.txt
Apple Applebot Spotlight, Siri och Safari Respekterar robots.txt. Nämner filen Googlebot men inte Applebot, följer Applebot de regler du satt för Googlebot
Applebot-Extended Enbart avanmälan från träning av Apples generativa modeller Ett Disallow är hela mekanismen
Meta meta-externalagent Träning av modellerna och direkt indexering Blockeras med ett Disallow. Inget undantag anges
meta-webindexer Bygger sökunderlaget bakom Meta AI:s svar Att tillåta den hjälper Meta att citera och länka ditt innehåll i Meta AI:s svar
meta-externalfetcher Hämtar enskilda länkar på en användares begäran Roboten kan gå förbi robots.txt, eftersom hämtningen begärts av användaren
Microsoft Bingbot Sök, Copilot och grundnings-API:et Bolaget listar fem robotar, ingen av dem AI-specifik, och lägger AI-styrningen i metataggen i stället
Common Crawl CCBot Öppet webbarkiv som flera AI-projekt använder som träningskälla Stiftelsen anger själv ett Disallow som vägen att stänga ute den
Robotnamn och formuleringar kontrollerade mot respektive leverantörs egen dokumentation den 25 augusti 2026. Listorna ändras, så läs dem igen innan du skriver om din robots.txt.

Hämtaren som användaren startar behöver inte lyda

I Perplexitys egen crawlerdokumentation står skälet: eftersom det är användaren som begärt hämtningen struntar hämtaren i regel i robots.txt. OpenAI skriver samma sak något mjukare om ChatGPT-User, att reglerna i robots.txt kanske inte gäller när åtgärden startats av en användare. Google har en egen dokumentationssida för de användarstartade hämtarna och säger där att de i allmänhet ignorerar robots.txt.

Meta är den fjärde, och den tydligaste. I bolagets dokumentation står förbehållet på två ställen: meta-externalfetcher hämtar enskilda länkar på en användares begäran och kan därför gå förbi robots.txt. Samma sida noterar att facebookexternalhit kan göra det när den utför säkerhets- eller integritetskontroller.

Anthropic gör ingen sådan uppdelning. Bolagets sida säger att robotarna respekterar branschstandardens direktiv i robots.txt, och listar Claude-User bland dem utan att undanta den.

För dig som webbplatsägare betyder det att ett Disallow är en instruktion, inte ett lås. Det stoppar de systematiska svepen. Det stoppar inte nödvändigtvis den enskilda hämtningen som sker för att någon just klistrat in din adress i en chatt.

Direktiven som styr vad som får återges

Robots.txt reglerar hämtningen. Hur mycket av din text som sedan får återges i ett genererat svar styrs av direktiven i sidans HTML, och tre leverantörer skriver ut det svart på vitt.

Google anger i sin dokumentation för robots-metataggen att nosnippet också hindrar att innehållet används som direkt underlag för AI-översikterna och AI-läget, och att max-snippet på motsvarande sätt begränsar hur mycket av innehållet som får användas där. Apple beskriver samma direktiv i sin Applebot-dokumentation: innehåll märkt med nosnippet används inte som extra sammanhang när Apples modeller genererar text i Apples produkter och tjänster.

Microsoft går längst och är den enda som helt saknar en AI-specifik robot i robots.txt. I Bings riktlinjer konstateras att robots.txt styr crawlningen och inte indexeringen, och att noarchive hindrar att innehållet används i Copilots svar och i grundningsresultaten, medan nocache begränsar Copilot till adress, titel och textutdrag. I bolagets genomgång av metataggarna anges dessutom att både noindex och noarchive stoppar användning av innehållet för träning av Microsofts generativa modeller. All styrning ligger alltså i taggen, vilket förutsätter att sidan hämtas. Ett Disallow mot Bingbot förmedlar inget träningsval alls.

Priset för nosnippet är att du samtidigt tackar nej till det vanliga textutdraget under din träff i sökresultatet. Direktivet skiljer inte på de två användningarna. Vill du bara begränsa mängden, sätt max-snippet med ett teckenantal i stället, eller märk enskilda stycken med attributet data-nosnippet.

Applebot läser dina Googlebot-regler

Nämner din robots.txt Googlebot men inte Applebot, följer Applebot de instruktioner du satt för Googlebot. Regeln står i Apples egen dokumentation och slår till utan att du märker det.

Ett Disallow som du en gång skrev för Googlebot, kanske för en katalog med gamla kampanjsidor, gäller alltså tyst även för Spotlight, Siri och Safaris innehållsförslag. Apple noterar samtidigt att Applebot inte följer crawl-delay, så en fördröjning du satt för andra robotar biter inte på den.

Har llms.txt någon dokumenterad effekt?

Specifikationen kallar sig själv ett förslag om att standardisera en fil på /llms.txt som hjälper agenter att använda en webbplats. Den skrevs av Jeremy Howard och underhålls som ett öppet projekt. Något åtagande från de leverantörer vars robotar besöker din sajt finns inte.

Argumentet som brukar anföras är att AI-bolagen själva publicerar llms.txt. Det stämmer, och det syns direkt på deras crawlerdokumentation: både OpenAI och Perplexity visar en banner som pekar agenter till dokumentationssajtens egen /llms.txt. Men det är ett besked om hur du läser deras dokumentation, inte om att deras robotar hämtar din fil.

Google är den enda av dem som skrivit ned en rekommendation som täcker frågan. I vägledningen om hur innehåll syns i AI-funktionerna står att du inte behöver skapa nya maskinläsbara filer, AI-textfiler eller uppmärkning för att synas där.

Ahrefs gick i maj 2026 igenom 137 000 domäner och fann att 28 procent hade en llms.txt. Av de omkring 38 000 domäner som hade en giltig fil fick 97 procent noll förfrågningar om den under månaden. Urvalet består av domäner hos teknikintresserade användare av bolagets eget analysverktyg, så andelen som publicerar filen är sannolikt högre än på webben i stort.

Effekten på din synlighet är alltså inte dokumenterad åt något håll. Filen skadar ingenting, den kostar en kvart och den kan visa sig bli användbar den dag agenter börjar läsa den. Betrakta den som en billig chansning, inte som den åtgärd som avgör om du citeras.

Väljer du att lägga upp den, ser en fil enligt konventionen ut så här. Det enda som krävs är en H1 med sajtens namn. Därefter kommer en kort sammanfattning som blockcitat och sedan länklistor under H2-rubriker, helst till markdownversioner av sidorna:

# Exempelbolaget

> Vi säljer och installerar bergvärmepumpar i Mälardalen. Sajten
> innehåller produktsidor, prisexempel och guider om installation.

## Guider

- [Så fungerar bergvärme](https://example.com/bergvarme.md): grundprinciperna
- [Installation steg för steg](https://example.com/installation.md)

## Om företaget

- [Kontakt och öppettider](https://example.com/kontakt.md)

## Optional

- [Pressmeddelanden](https://example.com/press.md)

Rubriken Optional är den enda som har en bestämd innebörd i förslaget: länkarna där får hoppas över när agenten behöver ett kortare underlag. Allt annat är fri text.

Vår AI-läsbarhetskoll räknar med filen och sänker betyget med 5 av 100 poäng när den saknas. Den vägningen följer konventionen, inte ett belagt utfall, och ska läsas med reservationen ovan.

En robots.txt som säger det du menar

Ett vanligt upplägg är att säga nej till träning och ja till citering. Det ser ut så här:

# Nej till modellträning
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

# Ja till att bli citerad
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: meta-webindexer
Allow: /

Räkna med eftersläpning. Både OpenAI och Meta anger ungefär ett dygn innan en ändrad robots.txt slagit igenom i deras system.

Motsatt strategi, att släppa in träningsrobotarna för att öka chansen att modellerna känner till din sajt, är lika legitim. Inget av valen är objektivt rätt.

Den vanligaste bristen i äldre filer är inte ett felaktigt val utan namn som rostat. Beteckningarna anthropic-ai och Claude-Web lever kvar i äldre robots.txt-filer men står inte i Anthropics nuvarande lista över tre robotar. Samtidigt saknas de nyare söknamnen OAI-SearchBot, Claude-SearchBot och PerplexityBot, alltså de robotar som leverantörerna själva pekar ut som vägen in i söksvaren. Perplexity-User hör inte till dem: den hämtaren struntar enligt Perplexity i regel i robots.txt, så ett namn för den avgör ingenting.

När du väl har skrivit om filen kan du kontrollera vilka robotar som verkligen varit hos dig, och om namnet i loggen är äkta, med hjälp av vår genomgång av hur du ser AI-botarnas besök i serverloggen.

Fyra saker att kontrollera i HTML:en

Filer och direktiv avgör vem som får hämta och återge. Vad roboten sedan hittar på sidan avgörs av hur sidan är byggd.

Strukturerad data. Ett JSON-LD-block enligt Schema.org beskriver innehållet maskinläsbart. Article anger rubrik, datum och författare, Organization beskriver avsändaren, FAQPage gör enskilda svar hämtbara och BreadcrumbList placerar sidan i strukturen. Uppmärkningen och de vanliga misstagen går vi igenom i guiden om strukturerad data och schema.org.

Metadata. Unik och beskrivande titel per sida, en beskrivning som sammanfattar i stället för att upprepa titeln, en utpekad kanonisk adress och lang="sv" på <html>-elementet. Vad du styr själv och vad Google skriver om finns i genomgången av meta description och sidtitel.

Rubrikstruktur. En <h1> per sida som sammanfattar ämnet, sedan <h2> och <h3> i ordning, utan att hoppa över en nivå. En sida med ordnade rubriker går att dela upp i meningsfulla stycken, vilket är förutsättningen för att ett enskilt avsnitt ska kunna citeras.

Text som finns i svaret från servern. Common Crawls CCBot kör inte JavaScript, utan läser den råa HTML som servern skickar. Det står i stiftelsens egen frågelista. Motsvarande besked finns varken hos OpenAI eller Anthropic, så vad GPTBot och ClaudeBot gör med klientrenderad text är inte dokumenterat åt något håll. Googlebot renderar JavaScript via sin renderingstjänst, men fördröjt. Ligger brödtexten bara i ett klientrenderat ramverk är den alltså bevisligen osynlig för CCBot, fördröjd för Googlebot och en öppen fråga för GPTBot och ClaudeBot. Att lägga texten i det första svaret från servern är det enda sättet att slippa frågan. Fler tekniska grunder finns i guiden om teknisk SEO.

Utöver detta gör AI-systemen samma slags bedömning av trovärdighet som Google beskriver med ramverket E-E-A-T. Namngiven författare med kort presentation, synliga publicerings- och uppdateringsdatum, en riktig om-sida och inline-länkar till primärkällorna är de signaler som går att kontrollera maskinellt. Hur din sajt står sig på punkterna i den här guiden kan du pröva med vår AI-läsbarhetskoll, och den bredare bilden av vad AI-sökmotorer premierar finns i guiden om optimering för AI-sökmotorer.

Vanliga frågor

Räcker det att blockera en robot i robots.txt för att texten inte ska kunna användas?

Nej. Filen är en instruktion som robotarna väljer att följa, och fyra av leverantörerna ovan skriver själva att deras användarstartade hämtare kan låta bli. Ett Disallow gäller dessutom framåt. Text som redan samlats in tidigare försvinner inte ur ett datamaterial för att du ändrar filen i dag.

Kan jag synas i vanlig sökning men hållas utanför AI-svaren?

Delvis. Ett Disallow mot Google-Extended stänger Gemini-träningen utan att påverka din plats i sökresultaten, men det rör inte AI-översikterna, som drivs av Googlebot. Vill du hålla texten utanför dem krävs nosnippet, och då tappar du samtidigt textutdraget under din vanliga träff. Hos Microsoft finns ingen robots.txt-väg alls: där är noarchive i metataggen det som håller innehållet utanför Copilots svar, utan att sidan försvinner ur sökresultatet.

Hur ofta behöver listan ses över?

Minst ett par gånger om året, och alltid när en leverantör lanserat en ny tjänst. Namnen tillkommer och byts ut. Metas lista uppdaterades senast i maj 2026 och rymmer i dag fem robotar, varav en, meta-webindexer, är den som Meta säger hjälper bolaget att citera och länka ditt innehåll i Meta AI:s svar. En fil som skrevs för två år sedan känner inte till den.

Senast faktagranskad: 25 augusti 2026