Ordbog Embeddings og vektorer

Embeddings og vektorer

En embedding er en tekst oversat til en lang række tal. Vektorsøgning er teknikken, hvor man finder indhold ved at sammenligne de tal i stedet for at sammenligne ord. Tilsammen er det grunden til, at søgemaskiner og AI-systemer kan forstå, at “espressomaskine til hjemmebrug” og “kaffebrygger til espresso” handler om det samme.

Kernen i tre sætninger

Hver tekst får en position i et rum med mange hundrede eller tusinde dimensioner. Tekster med lignende betydning ender tæt på hinanden i det rum, uanset om de bruger de samme ord. Når nogen søger, beregner systemet afstanden mellem søgningens position og dine teksters positioner.

Tættest på vinder.

Hvordan et betydningsrum fungerer

Lad os droppe matematikken og bruge et kort i stedet.

Forestil dig Danmarkskortet. Aarhus og Randers ligger tæt. Aarhus og Rønne ligger langt fra hinanden. Du behøver ikke kende koordinaterne for at forstå relationen: afstand betyder noget.

Et betydningsrum fungerer ligesådan, blot med betydning i stedet for geografi og med tusindvis af akser i stedet for to. “Rentetilpasningslån” ligger tæt på “F5-lån”. Det ligger langt fra “cykelslange”.

Det klassiske eksempel på, hvad der gør embeddings interessante, er, at relationer også bevares. Afstanden og retningen fra “mand” til “kvinde” svarer omtrent til afstanden og retningen fra “konge” til “dronning”. Fra “Paris” til “Frankrig” svarer til fra “København” til “Danmark”.

Modellen har ikke fået det forklaret. Den har udledt det fra måden, ordene bruges på.

Hvordan afstanden måles

Den mest anvendte metode kaldes cosinuslighed. Den måler vinklen mellem to vektorer, ikke deres længde. Det betyder i praksis, at en kort og en lang tekst om det samme emne kan ligne hinanden meget, selvom mængden af tekst er forskellig.

Andre metoder findes, blandt andet euklidisk afstand og dot product, men cosinuslighed er standarden for tekst.

Du behøver ikke kunne regne på det. Du skal kende én konsekvens: længde alene giver dig ikke lighed. En side på 4.000 ord om alt muligt ligner ikke et præcist spørgsmål bedre end en side på 600 ord om netop det spørgsmål.

Chunking: den detalje, der afgør alt

Embeddings laves ikke af hele websites. De laves af tekststykker, ofte kaldet chunks.

Størrelsen på det stykke er en teknisk beslutning, men den har direkte konsekvens for dit indhold. For hvert stykke skal indeholde én hel idé. Bliver stykket for lille, mister det kontekst. Bliver det for stort, drukner pointen i støj, og vektoren bliver udvandet.

Det giver en praktisk regel, som er let at følge og sjældent bliver formuleret: skriv afsnit, der kan stå alene som et komplet svar. Ét afsnit, én idé, komplet formuleret, uden henvisninger til noget, der stod tidligere på siden.

Prøv selv. Tag et afsnit fra din vigtigste side. Læs det uden resten. Hvis det starter med “Derfor er det også vigtigt at”, har du et problem.

Hvorfor keyword stuffing er endeligt dødt

Fordi vektoren repræsenterer betydning, ikke ordfrekvens.

Nævner du “varmepumpe” 47 gange, flytter det ikke din position i betydningsrummet nævneværdigt. Det, der flytter positionen, er, om teksten dækker de begreber, som hører til emnet: COP-værdi, luft-til-vand, installationskrav, støjniveau, tilskudsordninger, driftsøkonomi.

Mangler de begreber, ligger din tekst i periferien af emnet, uanset hvor mange gange hovedordet står der.

Det er også grunden til, at emneautoritet og indholdsklynger fik så meget vægt. Et system, der arbejder med betydning, kan se om du har flere sammenhængende tekster om samme område, eller om du har én ensom side.

Hvor vektorsøgning fejler

Nu til den del, næsten alle glemmer. Vektorsøgning er ikke overlegen på alt. Den fejler forudsigeligt på nogle typer forespørgsler:

Type forespørgsel Vektorsøgning Almindelig ordmatchning
“hvordan opsiger jeg en lejekontrakt” Stærk Middel
“varenummer 4051TX-9” Svag Stærk
“citat fra paragraf 12 stk. 3” Svag Stærk
“billig sofa til lille stue” Stærk Middel
“Nilfisk C 135.1” Svag Stærk

Årsagen er, at et varenummer ikke har nogen betydning at placere i rummet. Det har kun en form.

Derfor bruger virkelige systemer hybridsøgning: vektorsøgning kombineret med klassisk ordmatchning, ofte med metadatafiltre oveni. Ordmatchning er ikke afløst. Den er blevet den ene halvdel.

For dig som webshopejer betyder det noget helt konkret: skriv varenumre, modelnavne og præcise betegnelser ud i teksten. Ikke kun i et datablad eller et billede. De bliver fundet leksikalsk, ikke semantisk.

Den danske faldgrube

Her er en pointe, der er relevant for et dansk site, og som jeg ikke har set behandlet nogen steder på dansk.

Embeddingmodeller er trænet på tekst. Der findes langt mere engelsk tekst end dansk tekst. Konsekvensen er, at betydningsrummet for dansk er trænet på et tyndere grundlag, især for fagsprog og nichebegreber.

Praktisk oversat: en model er ikke lige så sikker på, at “murermestervilla” og “typehus fra 1930’erne” er relaterede, som den er på de engelske ækvivalenter. Danske synonymer og branchejargon bliver oftere misforstået.

Hvad gør du med det? Du er mere eksplicit, end du ville være på engelsk. Skriv både fagtermen og hverdagsordet. Skriv “rentetilpasningslån (også kaldet F-lån eller flexlån)” i stedet for at antage, at systemet ved det. Definér dine begreber i selve teksten.

Det er også derfor, en fagordbog har værdi ud over det oplagte. Hver definition, du publicerer, er et eksplicit signal om, hvad et begreb betyder på dansk. Det er en del af rationalet bag den ordbog, du læser i nu, som Concept Interest bygger op.

Kan du selv arbejde med embeddings?

Ja, og det er billigere, end de fleste tror.

Du kan hente embeddings for dine egne sider via API’er fra blandt andet OpenAI, Google og en række open source-modeller som Sentence-BERT. Derefter kan du:

  • Måle, hvor tæt to af dine sider ligger på hinanden, og opdage kannibalisering du ikke kunne se med søgeordsdata
  • Måle, hvor tæt en side ligger på det spørgsmål, du gerne vil svare på
  • Klynge dit indhold automatisk og se, om din struktur faktisk hænger sammen
  • Finde de sider, der ligger langt fra alt andet på sitet, og som derfor svækker din emnedækning

Det kræver lidt teknisk hjælp første gang. Men det giver et billede af dit site, som ingen søgeordsrapport kan give.

Så hvad skal du huske?

At søgesystemer i dag matcher på mening. At de gør det på afsnitsniveau. At de stadig har brug for præcise ord til præcise ting. Og at dansk kræver lidt mere eksplicitet end engelsk.

Resten er det samme håndværk som altid: dæk dit emne ordentligt, og skriv så et menneske kan følge dig.

Artiklen er skrevet af SEO-ekspert Thomas Rosenstand

Senest opdateret: 5. august 2026
Tilbage til ordbogen

Fort Lauderdale, Florida: 88 10 57 57 (dansk takst) hverdage fra 14 til 22.

Kolding: 71 74 54 00  hverdage fra 8 til 16.

Send e-mail

Du kan skrive en e-mail, når det passer dig - vi svarer lynhurtigt!

Kom med på vores nyhedsbrev - vi sender SEO tips hver anden mandag!

SEO-LEX 26 Ebog om AI og SEO

Vil du lære SEO - så køb min bog, fyldt med alle mine erfaringer fra over 27 år i branchen. Så god, at den aldrig har været gratis - og så god, at den stadig er den bedste efter hver årlig opdatering.

  • 625 sider SEO e-bog  – 120 minutters videoer
  • Kendt som "Biblen om SEO"
  • Nyeste udgave: 15. december 2025

Nybovænget 31, 9632 Møldrup

Scroll to Top