Blog
Kontakt os

Hvad er en Vector Database?

En vector database er en specialiseret database, der lagrer, indekserer og søger i vektorrepræsentationer af data. Hvor en traditionel database finder rækker, der matcher en eksakt forespørgsel, finder en vector database de datapunkter, der ligner forespørgslen mest. Den beregner afstanden mellem vektorer i et højdimensionelt rum, typisk med hundredvis eller tusindvis af dimensioner.

I praksis kan du tage et stykke tekst, et billede eller en lydfil, konvertere det til en vektor med en embedding-model, og finde alt lignende indhold på millisekunder. Du søger på mening, ikke på nøgleord. En henvendelse om 'min faktura er forkert' rammer relevante svar om fakturafejl, betalingskorrektioner og kreditnotaer, selvom de dokumenter ikke indeholder de præcise ord fra henvendelsen.

For danske virksomheder, der bygger RAG-systemer, AI-drevet søgning eller anbefalinger, er valget af vector database en af de mest afgørende infrastrukturbeslutninger. Det påvirker svartider, præcision, driftsomkostninger og hvor jeres data ligger. Markedet er i kraftig vækst: markedsanalyser vurderer det til omkring 1,7 mia. USD i 2024 med forventning om en mangedobling op gennem årtiet.

Læsetid 4 minOpdateret juni 2026

Sådan fungerer en vector database teknisk

Tre dele får en vector database til at virke: embeddings, et afstandsmål og et indeks.

Embeddings er fundamentet. En embedding-model oversætter tekst, billeder eller lyd til en liste af tal, en vektor, og placerer indhold med samme betydning tæt på hinanden. 'Faktura' og 'regning' havner i nærheden af hinanden, selvom ordene er forskellige. Kvaliteten af jeres søgning afhænger direkte af, hvor god embedding-modellen er.

Afstandsmålet afgør, hvad lighed betyder. Databasen måler det som afstand mellem vektorer, oftest med cosinus-lighed, dot-produkt eller euklidisk afstand. Til tekst bruges cosinus typisk, fordi den ser på retning frem for længde.

Indekset er der, hvor den specialiserede database tjener sit navn. At sammenligne en forespørgsel med hver eneste vektor er præcist, men for langsomt ved millioner af poster. I stedet bruges Approximate Nearest Neighbor, ANN. De to udbredte metoder er HNSW, der bygger en graf af naboer og er hurtig med høj præcision, men bruger meget hukommelse, og IVF, der deler rummet i klynger og kun søger i de nærmeste. Begge handler om samme afvejning: hastighed og hukommelse mod, hvor mange af de rigtige naboer du finder, det man kalder recall.

Oven på det lægger de fleste vector databases metadata-filtre, så semantisk søgning kan kombineres med almindelige filtre: find lignende sager, men kun fra denne kunde og kun fra i år. Kæden er den samme hver gang: del indholdet op i bidder, lav embeddings, indeksér, søg.

Skal I bygge RAG, semantisk søgning eller anbefalinger, er valget af retrieval-arkitektur afgørende. Vi rådgiver om og bygger løsningen, fra pgvector til dedikeret vector database. Kontakt os for en uforpligtende vurdering af jeres projekt.

Hvor bruger danske virksomheder en vector database?

En vector database er sjældent målet i sig selv. Den er motoren under de funktioner, virksomheder faktisk efterspørger.

RAG over egen viden er den mest udbredte brug. Virksomhedens dokumenter, politikker og produktdata gøres søgbare, så en AI-assistent kan svare med grundlag i jeres egne kilder i stedet for at gætte. Vector databasen henter de relevante stumper, og sprogmodellen formulerer svaret.

Semantisk søgning er den næste. En søgefunktion, der forstår hensigt, så kunden eller medarbejderen finder det rigtige uden at ramme de præcise nøgleord. Det hjælper især på tværs af synonymer og fagsprog.

Anbefalinger bygger på samme idé. Produkter, artikler eller sager, der ligner det, brugeren er i gang med, kan findes ved at søge efter de nærmeste vektorer.

Endelig bruges vektorer til klassificering og oprydning: find dubletter i et CRM, gruppér supporthenvendelser efter emne, eller match indkomne fakturaer mod kendte mønstre. Fælles for det hele er, at jo bedre embeddings og jo renere data, jo bedre resultat. Vector databasen er hurtig, men den kan ikke redde et svagt datagrundlag.

Hvornår har du brug for en dedikeret vector database?

Det første spørgsmål er, om I overhovedet har brug for en dedikeret vector database.

Kører I allerede PostgreSQL, kan udvidelsen pgvector give jer vektorsøgning i den database, I har i forvejen. For mange projekter under nogle millioner vektorer er det rigeligt, og I slipper for endnu et system at drifte. Det er ofte det rigtige sted at starte.

Når mængden vokser, eller I har brug for høj samtidighed og lav svartid, giver en specialiseret løsning mening. De mest udbredte er Pinecone, der er managed og hurtig at komme i gang med, Weaviate og Qdrant, der er open source og kan selv-hostes eller købes som service, Milvus, der er bygget til meget store mængder, og Chroma, der er let og populær til prototyper. Forskellen ligger i drift, skalering, filtrering og hvor data må ligge.

Hold øje med to ting. Omkostningerne stiger med antal vektorer og forespørgsler, og managed services afregnes typisk på forbrug, så et stort indeks kan blive dyrt. Og placering af data er et selvstændigt spørgsmål: en self-hosted eller EU-hostet løsning er lettere at forsvare under GDPR end en tjeneste i en anden jurisdiktion. En vector database erstatter i øvrigt ikke jeres almindelige database. Den supplerer den.

Ofte stillede spørgsmål om vector databases

Hvad er forskellen på en vector database og en almindelig database?

En almindelig database finder rækker, der matcher en eksakt forespørgsel. En vector database finder det indhold, der ligner forespørgslen mest, ved at sammenligne vektorer. Den ene søger på præcise værdier, den anden på mening. De fleste virksomheder bruger begge dele side om side.

Har jeg brug for en vector database til RAG?

Du har brug for vektorsøgning, men ikke nødvendigvis et selvstændigt system. Kører I allerede PostgreSQL, kan pgvector ofte klare opgaven for projekter under nogle millioner vektorer. Ved større mængder eller krav om høj samtidighed giver en dedikeret vector database mening.

Hvad er HNSW og IVF?

Det er to måder at indeksere vektorer på, så søgning bliver hurtig. HNSW bygger en graf af naboer og giver høj præcision og hastighed, men bruger meget hukommelse. IVF deler rummet i klynger og er mere hukommelseseffektiv. Begge er Approximate Nearest Neighbor-metoder, der afvejer hastighed mod, hvor mange rigtige naboer de finder.

Hvilke vector databases er de mest udbredte?

Pinecone (managed), Weaviate og Qdrant (open source, kan selv-hostes eller købes som service), Milvus (til meget store mængder) og Chroma (let, til prototyper). Hvis I allerede har PostgreSQL, er pgvector ofte et godt sted at starte.

Hvad koster en vector database?

Det afhænger af model og mængde. pgvector og open source-løsninger er gratis at bruge, men koster drift. Managed services prissættes typisk på forbrug, altså antal lagrede vektorer og forespørgsler, så omkostningen vokser med datamængden. Læg placering af data ind i regnestykket, hvis I har GDPR-krav.