Blog
Kontakt os

Hvad er Context Engineering?

Context engineering er disciplinen at udvælge, strukturere og vedligeholde præcis den information, en sprogmodel har foran sig i sit kontekstvindue, når den løser en opgave: systeminstruktioner, værktøjer, dokumenter, samtalehistorik og hukommelse. Begrebet slog igennem i juni 2025, da Shopifys CEO Tobi Lütke og OpenAI-medstifter Andrej Karpathy på X argumenterede for, at det beskriver arbejdet i industrielle AI-løsninger bedre end prompt engineering. Karpathy kaldte det "the delicate art and science of filling the context window with just the right information".

Tag en supportagent hos en dansk softwarevirksomhed. En kunde spørger, hvorfor fakturaen er steget. God context engineering betyder, at agenten får jeres aktuelle prisliste, kundens abonnementsdata fra CRM-systemet og de tre seneste supportsager medsendt, mens 400 siders forældede manualer holdes ude. Dårlig context engineering betyder, at modellen enten mangler svaret eller drukner i irrelevant tekst og gætter.

For din virksomhed er pointen kontant: AI-agenter fejler sjældent, fordi modellen er for svag. De fejler, fordi konteksten er forkert. Anthropic definerede det i september 2025 som kunsten at kuratere det optimale sæt tokens ved hver eneste inferens. Det afgør svarkvaliteten, tokenregningen og om du kan dokumentere, hvilke data et svar byggede på.

Læsetid 9 minOpdateret juli 2026

Sådan fungerer context engineering teknisk

Kontekstvinduet er modellens arbejdshukommelse. Alt, hvad modellen ved om din konkrete opgave, skal ind gennem det vindue som tokens. I 2026 håndterer Claude Opus 4.8, Claude Sonnet 4.6, GPT-5.5 og Gemini 3.1 Pro alle omkring 1 million tokens, og Metas Llama 4 Scout blev i april 2025 annonceret med op til 10 millioner. Det lyder som rigeligt. Det er det ikke.

Opmærksomhed er et budget. Transformer-arkitekturen lader hvert token forholde sig til alle andre tokens, altså n² parvise relationer. Når konteksten vokser, strækkes modellens opmærksomhed over flere relationer, end den er trænet til at håndtere. Anthropic kalder det et attention budget i sin guide til context engineering fra 29. september 2025: hvert nyt token trækker på det samme begrænsede budget.

Context rot er dokumenteret i målinger. Vektordatabase-firmaet Chroma testede i et studie fra 14. juli 2025 i alt 18 modeller, blandt andet Claude Opus 4, GPT-4.1 og Gemini 2.5 Pro. Resultatet: præcisionen falder, i takt med at input bliver længere, selv på trivielle opgaver. GPT-3.5 Turbo afviste 60,29 procent af opgaverne i et af eksperimenterne. Mest overraskende klarede modellerne sig bedre, når kildeteksten var blandet tilfældigt, end når den var logisk struktureret. Når relevante fakta drukner i støj, stiger risikoen for AI-hallucinationer tilsvarende.

Konteksten kommer fra fire kilder. Systemprompten sætter rolle og regler. Værktøjsdefinitioner fortæller modellen, hvad den kan kalde. Eksterne data er dokumenter, databaser og API-svar. Historik og hukommelse binder samtalen sammen over tid. De fire kilder konkurrerer om det samme budget, og context engineering er i praksis at prioritere mellem dem ved hvert enkelt kald.

Just-in-time retrieval slår forudindlæsning. I stedet for at læsse alle tænkelige data ind fra start henter agenten information, når den skal bruge den, typisk via RAG eller værktøjskald. Anthropics eget udviklerværktøj Claude Code arbejder sådan: en kort projektfil lægges ind fra start, og resten findes undervejs med søgeværktøjer som glob og grep. Agenten gemmer altså en let reference og slår op i kilden, når det er relevant.

Kompaktering forlænger opgavens levetid. Når historikken nærmer sig vinduets grænse, opsummerer systemet forløbet og genstarter med resuméet som fundament. Anthropic anbefaler at optimere for recall først: resuméet skal fange alle beslutninger, åbne spørgsmål og fejl, ellers gentager agenten arbejde, den allerede har udført.

Hukommelse uden for vinduet. Anthropics memory tool, der kom i beta 29. september 2025 sammen med Claude Sonnet 4.5, lader agenten oprette og redigere filer i en hukommelsesmappe i jeres egen infrastruktur, så viden overlever på tværs af sessioner. Samtidig rydder funktionen context editing automatisk gamle værktøjskald ud af vinduet. Kombinationen gav 39 procent bedre resultater på agentiske søgeopgaver i Anthropics interne evaluering, og i en test over 100 samtaleture faldt tokenforbruget med 84 procent. Begge dele findes også på Amazon Bedrock og Google Vertex AI.

Sub-agenter komprimerer arbejdet. I stedet for én agent med et overfyldt vindue kan en koordinerende agent sende specialiserede agenter i byen med hver sin afgrænsede opgave. Hver sub-agent bruger måske titusindvis af tokens på research men returnerer kun et resumé på 1.000 til 2.000 tokens. Koordinatoren arbejder derfor videre på destillatet, ikke på råmaterialet.

Vil du have AI-agenter, der svarer på jeres egne data i stedet for at gætte? Vi hjælper danske B2B-virksomheder med at designe konteksten: udvælge datakilder, bygge MCP-integrationer til CRM og ERP og sætte hukommelse, logning og styring op, så løsningen kan dokumenteres over for ledelse, kunder og tilsyn. Book en snak med os, så gennemgår vi jeres use case og viser, hvor context engineering flytter mest.

Syv teknikker og hvad de betyder i praksis

Systemprompt i den rette højde
Instruktionen skal være specifik nok til at styre adfærd og fleksibel nok til at dække virkeligheden. Anthropics tommelfingerregel: hverken hardcodede hvis-så-regler eller vage formaninger om at være hjælpsom. En agent, der skriver tilbud for jer, skal have tone of voice, godkendelsesgrænser og prisregler på 40 linjer, ikke 400.

Kuraterede værktøjer
Få, selvforklarende værktøjer uden funktionelt overlap. Hvis en AI-agent i bogholderiet kan vælge mellem 30 løst beskrevne endpoints, vælger den forkert. Tre veldefinerede opslag mod jeres økonomisystem, for eksempel faktura, kontoplan og momskode, giver færre fejl og færre spildte tokens end et komplet API-katalog.

Standardiseret dataadgang via MCP
Model Context Protocol er blevet standarden for at koble modeller på systemer. Protokollen blev doneret til Linux Foundation 9. december 2025, tæller over 10.000 offentlige servere og runder 97 millioner månedlige SDK-downloads. For dig betyder det, at den samme connector til CRM eller ERP kan bruges fra Claude, ChatGPT, Microsoft Copilot og Gemini, så I bygger integrationen én gang.

RAG med hård relevansfiltrering
Hent de afsnit, der matcher spørgsmålet, ikke hele dokumentbiblioteket. En HR-afdeling, der lægger personalehåndbogen bag et retrieval-lag, får agenten til at citere det gældende afsnit om barsel i stedet for at opsummere 120 sider. Filtrér på metadata som gyldighedsdato og afdeling, før noget rammer vinduet.

Kompaktering til lange forløb
Månedsafslutning i økonomi kan kræve, at en agent arbejder i hundredvis af trin over flere timer. Uden kompaktering rammer forløbet vinduets loft halvvejs. Med løbende opsummering af afsluttede delopgaver kan agenten fortsætte, uden at beslutningsgrundlaget forsvinder.

Struktureret hukommelse
Lad agenten føre noter uden for vinduet: kundens systemlandskab, aftalte beslutninger, kendte faldgruber. En kundeserviceagent, der har noteret, at kunden kører Business Central og har 12 licenser, behøver ikke spørge igen i næste sag. Anthropics memory tool gør det med filer i jeres egen infrastruktur, så I selv bestemmer opbevaring og sletning.

Evaluering og observability fra dag ét
Mål, hvad konteksten indeholdt, da svaret gik galt. Værktøjer som LangSmith og Langfuse logger hvert kald med fuld kontekst, så du kan se, om fejlen lå i data, prompt eller model. Uden den logning famler du i blinde, og med den har du samtidig dokumentationen klar, når ledelsen eller en kunde spørger, hvorfor systemet svarede, som det gjorde.

Værktøjer, priser og compliance

Markedet for context engineering er vokset hurtigt siden 2025, og ingen enkelt platform dækker hele stakken. Atlans platformsammenligning fra 2026 konkluderer, at produktionsteams typisk kombinerer 3 til 5 værktøjer på tværs af orkestrering, retrieval, hukommelse og observability. Her er de vigtigste med styrker, svagheder og priser.

LangChain og LangGraph
Det mest udbredte open source-framework til at orkestrere agenter og styre, hvad der ryger ind i konteksten ved hvert trin. Cirka 97.000 GitHub-stjerner og et enormt integrationskatalog. Gratis under MIT-licens, mens observability-værktøjet LangSmith starter ved 39 dollars pr. bruger pr. måned. Svagheden er, at konteksten styres af grafens struktur, ikke af en semantisk model af jeres data.

LlamaIndex
Stærkest til dokumentparsing, der bevarer tabeller og struktur, hvilket løfter kvaliteten af retrieval markant. Omkring 44.600 GitHub-stjerner. LlamaCloud har et gratis niveau med 1.000 credits om dagen og koster derefter 1,25 dollars pr. 1.000 credits. Til gengæld er der ingen indbygget hukommelses- eller styringsmodel.

Mem0
Managed hukommelses-API, der kombinerer graf- og vektorsøgning, med cirka 48.000 GitHub-stjerner. Selskabet rejste 24 millioner dollars i serie A i oktober 2025. Prisen går fra et gratis udviklerniveau til Pro på 249 dollars om måneden, men graf-funktionerne ligger netop bag betalingsmuren.

Zep og Letta
Zep bygger en tidsbaseret videngraf, der ved, hvornår et faktum holdt op med at gælde, relevant når kundens kontrakt, priser eller organisation ændrer sig løbende. Prisen ligger omkring 15 dollars pr. million tokens, og efter at den gratis Community Edition lukkede i april 2025, henvender Zep sig reelt kun til enterprise. Letta, open source-projektet bag forskningsarbejdet MemGPT, har den dybeste arkitektur for virtuel kontekststyring: agenten flytter selv information mellem vinduet og ekstern lagring. Gratis, men med en stejlere læringskurve end de kommercielle alternativer.

Modelleverandørernes egne funktioner
Anthropic tilbyder context editing og memory tool direkte i platformen samt via Amazon Bedrock og Google Vertex AI. OpenAI har sit Agents SDK, og Google sælger Vertex AI Agent Builder med tæt BigQuery-integration. Fordelen er mindre limkode og hurtigere start. Ulempen er binding til leverandøren, og for Vertex og Bedrock kan forbrugsafregningen løbe op i produktion.

Hvor skal du starte?
Bygger I på én modelleverandør, er de indbyggede funktioner det billigste udgangspunkt. Skal løsningen være modeluafhængig, er LangGraph plus en hukommelsestjeneste som Mem0 eller Letta den kombination, vi oftest ser fungere. Vær ærlig om driftsomkostningen: open source er gratis i licens, men nogen hos jer skal patche, hoste og overvåge det.

Hvad koster konteksten i drift?
Listepriserne i juli 2026 pr. million input- og output-tokens: Claude Opus 4.8 koster 5 og 25 dollars, Claude Sonnet 4.6 koster 3 og 15 dollars, GPT-5.5 koster 5 og 30 dollars, Gemini 3.1 Pro starter ved 2 og 12 dollars, og DeepSeek V4 Flash ligger helt nede på 0,14 og 0,28 dollars. Morphs prisanalyse fra juni 2026 opgør spændet mellem billigste og dyreste model til 71 gange for det samme vindue på 1 million tokens. Sløset kontekst koster dobbelt: sender du 200.000 unødvendige tokens med i 1.000 daglige kald på en model til 5 dollars pr. million, betaler du 1.000 dollars om dagen for at gøre svarene dårligere. Context caching hjælper på gentaget indhold, hos Anthropic koster cachelæsninger omkring en tiendedel af normal inputpris, men caching fjerner ikke behovet for at rydde op.

GDPR og EU AI Act
GDPR gælder, så snart kundedata ryger i konteksten. Det kræver databehandleraftale med modelleverandøren, EU-hosting hvor muligt, og adgangsstyring i retrieval-laget, så en medarbejder ikke kan bruge en agent til at se løndata, vedkommende ikke selv har adgang til. Dataminimeringsprincippet i artikel 5 peger samme sted hen som god context engineering: send kun det nødvendige. EU AI Act trådte i kraft 1. august 2024 og indfases frem mod 2027, med forpligtelser for udbydere af generelle AI-modeller fra 2. august 2025. Her bliver context engineering et compliance-værktøj, fordi logning af, hvilke kilder der lå i konteksten bag et svar, er fundamentet for den dokumentation, loven forventer. Vil du vide, hvor jeres løsning lander, kan du starte med vores AI Act-tjek.

Sikkerhed og begrænsninger
Indirekte prompt injection er den vigtigste nye risiko: når agenten selv henter dokumenter, mails eller websider ind i konteksten, kan en angriber gemme instruktioner i netop det indhold og forsøge at kapre agenten. Modtrækkene er allow-lists for værktøjer, skrivebeskyttede adgange som udgangspunkt, menneskelig godkendelse af kritiske handlinger og guardrails, der scanner hentet indhold, før det når modellen. Og husk: context rot er håndteret, ikke løst. Selv topmodeller mister præcision, længe før vinduet er fuldt, så start med ét workflow, mål baseline før og efter, og instrumentér tokenforbruget fra første dag. Flere af begreberne her er forklaret i vores AI-ordbog.

Ofte stillede spørgsmål om context engineering