Tekst-til-video (Text-to-Video)
Tekst-til-video er en gren af generativ AI, hvor en model genererer færdige videoklip med synkroniseret lyd ud fra en tekstbeskrivelse. OpenAI lancerede Sora 2 den 30. september 2025, Google fulgte med Veo 3.1, og kinesiske Kuaishou og ByteDance presser priserne med Kling 3.0 og Seedance 2.0. Teknologien er gået fra lydløse, flimrende klip til video med dialog, reallyd og troværdig fysik på under to år.
Et konkret eksempel: Du skriver "en håndværker monterer en varmepumpe på en gul murstensvilla, efterårsvejr, håndholdt kamera, dansk villakvarter". Tre til fem minutter senere har du et klip i 1080p med baggrundslyd og realistisk lys, klar til test i en annonce. Prisen via API starter omkring 0,50 USD for ti sekunder.
For marketing- og kommunikationsafdelinger ændrer det økonomien i videoproduktion. Opgaver der før krævede manuskript, filmhold, location og klipning, kan nu testes som udkast på en eftermiddag. Til korte formater som SoMe-annoncer, produktklip og koncepttest er teknologien allerede i produktion hos bureauer og webshops, mens lange brandfilm stadig kræver rigtige kameraer.
Sådan virker tekst-til-video teknisk
Diffusion i rum og tid. Moderne videomodeller som Sora 2 og Veo 3.1 er diffusionsmodeller bygget på transformer-arkitektur. Modellen komprimerer video til et latent rum og opdeler det i såkaldte spacetime patches, små bidder der dækker både billedflade og tid. Under træning lærer modellen at fjerne støj fra disse bidder, og ved generering bygger den et helt klip op fra støj, styret af din tekstprompt.
Fysik læres fra data. Modellerne er trænet på enorme mængder video med tilhørende tekst og lærer implicit, hvordan verden opfører sig: at glas splintres, at væske løber, og at en bold falder til jorden. Det er derfor OpenAI omtaler Sora 2 som et skridt mod verdensmodeller, og Metas Superintelligence-lab arbejder i samme retning med modeller, der kan ræsonnere og planlægge ud fra visuel information.
Lyd genereres sammen med billedet. Den nyeste generation, Sora 2, Veo 3.1, Kling 3.0 og Seedance 2.0, genererer dialog, effekter og baggrundslyd i samme proces som billederne. Tidligere skulle lyd lægges på i et separat værktøj, hvilket gav forsinkelse og dårlig synkronisering mellem læber og tale. Når én model producerer begge dele, passer lyden til det, der sker i billedet.
Dedikerede videomodeller mod omni-modeller. Sora 2 og Veo 3.1 er specialiserede videomodeller. Google tilbyder samtidig videogenerering direkte i sin multimodale Gemini Omni Flash, hvor 720p-video koster omkring 0,10 USD pr. sekund. Fordelen ved omni-tilgangen er, at samme model kan læse dit brief, se dine produktbilleder og generere klippet uden skift mellem systemer. De dedikerede modeller leverer til gengæld stadig den højeste billedkvalitet.
Referencestyring med billede, video og lyd. Seedance 2.0 fra ByteDance accepterer tekst, billeder, video og lyd som input samtidig. Du kan give modellen en referencevideo, og den overfører bevægelsen til dit eget motiv. Kling 3.0 er omvendt kendt for flydende menneskebevægelser som dans og løb uden deforme lemmer, et klassisk problem i ældre modeller.
Regnekraften bestemmer prisen. Videogenerering er beregningstung inferens på GPU'er, og det afspejles direkte i per-sekund-priserne. Et 15-sekunders klip i 1080p tager typisk tre til fem minutter at generere hos OpenAI, og betalende Pro-kunder får prioritet i køen. Det er også forklaringen på, at 4K koster 50 procent mere end 1080p hos Google.
Kendte tekniske begrænsninger. De fleste modeller genererer 10 til 25 sekunder pr. klip i 720p til 1080p, kun Veo 3.1 Standard leverer 4K. Tekst i billedet, for eksempel skilte og emballage, rammer stadig ofte forkert, og det er svært at holde samme person konsistent på tværs af flere klip. Længere film kræver derfor storyboard-værktøjer, hvor flere klip sys sammen.
Overvejer du AI-video til marketing, produktklip eller intern kommunikation? Vi hjælper dig med at vælge den rigtige model til opgaven, sætte en arbejdsgang op med kvalitetskontrol og sikre, at I opfylder AI-forordningens mærkningskrav inden fristen 2. august 2026. Book en uforpligtende snak med os, så tager vi udgangspunkt i jeres konkrete videobehov.
Hvad du kan bruge tekst-til-video til i praksis
SoMe-annoncer i volumen. Korte annoncer på 8 til 15 sekunder er teknologiens hjemmebane. En webshop kan generere ti varianter af samme produktklip med forskellige vinkler og baggrunde og lade annonceplatformen finde vinderen. Via API koster ti varianter à ti sekunder omkring 10 USD med Sora 2 og under 1 USD med Veo 3.1 Lite.
Billede-til-video af eksisterende materiale. Alle de store modeller kan animere et stillbillede. Et produktfoto fra dit katalog bliver til et klip, hvor kameraet kører rundt om varen, eller hvor produktet bruges i en scene. For en webshop med 800 varenumre er det forskellen på at have video på 20 produkter og på dem alle.
Koncepttest før dyr produktion. Et bureau kan visualisere fem forskellige retninger for en kampagne på en eftermiddag og vise kunden bevægelige skitser i stedet for moodboards. Beslutningen om den dyre optagelse træffes derefter på et testet grundlag. Flere danske bureauer bruger allerede AI-video netop sådan, som prævisualisering frem for færdigt materiale.
Talende personer og dialog. Veo 3.1 og Sora 2 genererer dialog med læbesynkronisering, og Kling 3.0 tilbyder stemmer på kinesisk og engelsk. Dansk tale er stadig det svage punkt: udtalen rammer ofte skævt, så til danske målgrupper bør du bruge undertekster eller lægge en rigtig dansk voiceover på bagefter.
E-læring og intern kommunikation. Onboarding-klip, sikkerhedsinstruktioner og produktdemoer kan produceres uden filmhold og opdateres, når processen ændrer sig. En HR-afdeling kan udskifte et forældet klip om ny ferielovgivning på en time i stedet for at booke ny optagelse.
Redigering med reference. Video-til-video åbner for redigering af eksisterende optagelser: Runways Aleph-model kan ændre vejr, lys eller objekter i et rigtigt klip, og Seedance 2.0 kan overføre bevægelser fra en referencevideo til nyt indhold. Det bruges blandt andet til musikvideoer og e-commerce, hvor samme koreografi skal gentages med nye produkter.
Automatiseret produktion via API. Fordi modellerne har API-adgang, kan videogenerering bygges ind i arbejdsgange. Et produktfeed kan automatisk få genereret klip pr. vare: 1.000 videoer à 8 sekunder på Veo 3.1 Fast koster omkring 800 USD i rå generering. Det kræver til gengæld opsætning af kvalitetskontrol, for ikke alle klip kan bruges i første forsøg.
Markedet i 2026: Sora, Veo, Runway, Kling og Seedance
OpenAI Sora 2
Sora 2 findes som forbruger-app og som API, hvor prisen er 0,10 USD pr. sekund, mens Sora 2 Pro koster 0,30 USD. Styrken er instruktionsfølgning og troværdig fysik, blandt andet korrekt splintring og væskeadfærd, hvilket gør modellen stærk til realistiske scener. Svagheden er formatet: maksimalt 25 sekunder pr. klip, ingen 4K, og gratisadgangen blev fjernet den 10. januar 2026.
Google Veo 3.1
Veo 3.1 sælges i tre API-varianter: Standard til 0,40 USD pr. sekund i 1080p og 0,60 USD i 4K, Fast til 0,10 til 0,12 USD og Lite til 0,05 til 0,08 USD. Som eneste af de store modeller leverer den 4K, og den er integreret i Googles Flow-værktøj og Gemini-abonnementerne. Prisen i topvarianten er til gengæld markedets højeste: et enkelt 4K-minut koster 36 USD.
Runway Gen-4.5
Runway henvender sig til professionelle videofolk med redigeringsværktøjer omkring modellen. Abonnementer går fra 12 USD pr. måned (Standard, 625 credits) til 76 USD (Max, 9.500 credits) ved årsbetaling. Interessant nok sælger Runway også konkurrenternes modeller, både Kling 3.0 og Seedance 2.0 ligger i platformen. Svagheden er credit-systemet, som tunge brugere hurtigt tømmer.
Kling 3.0
Kuaishous Kling 3.0 leverer markedets nok bedste forhold mellem pris og kvalitet: 0,112 USD pr. sekund uden lyd og 0,168 USD med lyd via fal.ai, med klip på 3 til 15 sekunder i 1080p. Modellen er særligt stærk til svære menneskebevægelser som dans og løb. Begrænsningen er lyd på kun kinesisk og engelsk samt tyndere enterprise-support i Europa.
Seedance 2.0
ByteDances Seedance 2.0 er den mest fleksible på input: tekst, billeder, video og lyd kan kombineres i samme prompt, og lyd er inkluderet i prisen på 0,24 til 0,30 USD pr. sekund. Det gør den populær til musikvideoer, karakteranimation og e-commerce. Til gengæld ligger output på flere platforme kun i 720p, og nogle organisationer fravælger ByteDance af datapolitiske årsager.
Meta er på vej ind. Meta lancerede billedmodellen Muse Image den 7. juli 2026 og har annonceret videomodellen Mango, som ifølge TechCrunch var planlagt til første halvår 2026, men endnu ikke er udkommet medio juli. Når Mango lander med distribution via Facebook og Instagram, får de etablerede spillere en konkurrent med direkte adgang til annonceplatformen.
Hvor markedet reelt står. Ingen model vinder på alle parametre. Sora 2 fører på fysik og prompt-forståelse, Veo 3.1 på opløsning og integration, Kling og Seedance på pris, og Runway på arbejdsgangen omkring klippene. Loyaliteten mod en enkelt model er lav, fordi aggregatorer som fal.ai og Runway udstiller dem side om side, så det rationelle valg er at teste to-tre modeller mod din konkrete opgave frem for at binde sig til én leverandør.
Adgang, priser og EU-krav til AI-video
Generativ AI skaber nyt indhold: tekst, billeder, kode. Se hvordan GenAI virker, hvad danske virksomheder bruger det til, og hvor det går galt.
Synthetic media dækker billeder, video, lyd og tekst skabt af AI. Forstå mulighederne, risiciene og hvad det betyder for din virksomhed.
Deepfake-mærkning er pligten til at oplyse, at indhold er AI-genereret eller manipuleret. Forstå kravene i EU AI Act og hvad det betyder for din virksomhed.
EU AI Act er verdens første samlede AI-lov. Forstå de fire risikokategorier, kravene, tidslinjen frem til 2027, og hvad det betyder for jer.
C2PA (Content Credentials) er en åben standard for at dokumentere oprindelse og redigeringshistorik af digitalt indhold. Forstå hvad det betyder for din virksomhed.
AI watermarking indlejrer usynlige signaler i AI-genereret indhold, så oprindelse kan verificeres. Lær teknikker, EU-krav og hvad det betyder for din virksomhed.
AI-indholdsmærkning gør AI-genereret indhold synligt for brugerne. Forstå EU AI Act Article 50 og bliv klar til august 2026.
Ofte stillede spørgsmål om tekst-til-video
Hvad er forskellen på Sora 2 og Veo 3.1?+
Sora 2 er stærkest til fysik og præcis instruktionsfølgning og koster 0,10 USD pr. sekund via API, men leverer maksimalt 25 sekunder pr. klip og ingen 4K. Veo 3.1 leverer 4K i Standard-varianten til 0,60 USD pr. sekund, har en discountvariant (Lite) fra 0,05 USD og er integreret i Googles Flow og Gemini-abonnementer. Test begge mod din konkrete opgave, forskellene er størst på realisme mod opløsning.
Kan tekst-til-video erstatte et filmhold?+
Til korte formater er svaret ofte ja: SoMe-annoncer, produktklip, koncepttest og intern kommunikation produceres allerede med AI. Til brandfilm, lange formater og optagelser med præcis produktgengivelse vinder klassisk produktion stadig, blandt andet fordi klippene er begrænset til 10 til 25 sekunder, og fordi karakterkonsistens på tværs af scener fortsat driller. De fleste virksomheder ender med en kombination.
Hvad koster det at komme i gang med AI-video?+
ChatGPT Plus koster 20 USD pr. måned og giver Sora 2-klip på 15 sekunder, Runway starter ved 12 USD, og Googles AI-abonnementer med Veo 3.1 starter ved 7,99 USD. Vil du integrere via API, betaler du pr. sekund: fra 0,05 USD med Veo 3.1 Lite til 0,30 USD med Sora 2 Pro. Regn med tre til fem genereringer pr. brugbart klip, når du beregner den reelle pris.
Skal AI-genererede videoer mærkes i EU?+
Ja. Fra 2. august 2026 kræver AI-forordningens artikel 50, at AI-genereret video er mærket maskinlæsbart og kan detekteres, og at deepfakes af virkelige personer, steder eller begivenheder tydeligt oplyses som kunstige. Bøderammen er op til 15 mio. EUR eller 3 procent af global årsomsætning, og Digitaliseringsstyrelsen fører tilsyn i Danmark. Systemer, der allerede var på markedet, har frist til 2. december 2026 for den maskinlæsbare del.
Virker tekst-til-video på dansk?+
Du kan skrive prompts på dansk til de fleste modeller, men genereret tale er svagest på dansk. Kling 3.0 tilbyder kun stemmer på kinesisk og engelsk, og selv Veo 3.1 og Sora 2 rammer ofte skæv dansk udtale. Den praktiske løsning er at generere billedsiden med AI og lægge dansk voiceover eller undertekster på bagefter.
Hvor lange videoer kan modellerne lave?+
Et enkelt klip er typisk 10 til 25 sekunder: Sora 2 leverer 15 sekunder på ChatGPT Plus og 25 sekunder på Pro, mens Kling 3.0 og Seedance 2.0 topper ved 15 sekunder. Længere film bygges ved at sy klip sammen, for eksempel med Soras storyboard-tilstand eller Googles Flow, hvor du styrer scene for scene. Generering af et enkelt 1080p-klip tager typisk tre til fem minutter.
Hvilken model er billigst til mange videoer?+
Veo 3.1 Lite er billigst pr. sekund (0,05 til 0,08 USD), efterfulgt af Kling 3.0 til 0,112 USD uden lyd. Som regneeksempel koster 1.000 klip à 8 sekunder omkring 400 til 640 USD på Lite og cirka 800 USD på Veo 3.1 Fast eller Sora 2. Skal output bruges kommercielt i EU, så husk at medregne arbejdsgangen til mærkning og kvalitetskontrol i totalprisen.