Har du brukt KI-verktøy en stund – særlig på API-siden – har du sikkert støtt på begreper som temperatur, top-p, tokens, kontekstvindu, RLHF og en håndfull andre. Mesteparten av dokumentasjonen forklarer dem med en forutsetning om at du allerede kan halve svaret. Denne ordlisten er versjonen jeg skulle ønske jeg hadde hatt da jeg begynte: klare definisjoner på norsk, hvorfor hvert begrep betyr noe, og når du faktisk vil endre det.
Den er delt inn i fem kategorier – velg avsnittet du trenger, eller les det fra start til slutt som en introduksjon.
- 1. Tokens og kontekst — hva KI faktisk leser og skriver
- 2. Samplinginnstillingene — temperatur, top-p, top-k og venner
- 3. Hvordan modeller tenker — arkitektur og inferens
- 4. Trening og justering — hvordan en modell blir nyttig
- 5. Modeller i praksis — RAG, agenter, verktøy, streaming
1. Tokens & kontekst
Før du går løs på innstillingene trenger du vokabularet for hva modellen faktisk bruker og produserer.

Token
Den grunnleggende enheten en språkmodell leser og skriver. Et token er vanligvis en liten tekstbit – noen ganger et helt kort ord («katt»), noen ganger et fragment («-ing», «-sjon»), noen ganger et enkelt tegn eller til og med en byte. Som en tommelfingerregel for norsk tekst er 1 token ≈ 4 tegn ≈ ¾ av et ord, så 1 000 tokens tilsvarer omtrent 750 ord. Priser oppgis nesten alltid per token (inndata og utdata faktureres separat).
Tokenisator
Funksjonen som gjør om tekst til tokens før modellen ser den. Ulike modellfamilier bruker ulike tokenisatorer, og det er derfor det samme avsnittet kan koste litt forskjellige antall tokens på ulike plattformer.
Kontekstvindu (også kalt kontekstlengde)
Det maksimale antallet tokens modellen kan holde «i hodet» på én gang – inkludert ledeteksten din, eventuelle systeminstruksjoner, tidligere samtale og svaret den genererer. Moderne toppmodeller tilbyr kontekstvinduer på 200 000–1 million tokens; eldre eller billigere modeller tilbyr 8 000–32 000. Overskrider du grensen, faller det eldste innholdet ut, eller kallet mislykkes.
Inndata-tokens vs. utdata-tokens
Inndata-tokens er det du sender inn (ledetekst, systemmelding, historikk, vedlagte dokumenter). Utdata-tokens er det modellen genererer tilbake. Utdata-tokens er gjerne 3–5 ganger dyrere enn inndata-tokens fordi generering er vanskeligere enn lesing.
Maks tokens (max_output_tokens)
En grense per forespørsel for hvor mange tokens modellen har lov til å generere før den stopper. Bruk den til å styre kostnad og ventetid. Mange API-er har en standardverdi på noen tusen; hev den for lange svar, senk den for å holde svarene korte.
2. Samplinginnstillingene
Når modellen velger neste token, har den faktisk en sannsynlighetsfordeling over alle mulige neste tokens. Samplinginnstillingene former hvordan den fordelingen blir til et enkelt valg. Dette er spakene de fleste justerer via API.

Temperatur
Styrer den samlede tilfeldigheten. Lav temperatur (0–0,3) gjør at modellen nesten alltid velger det mest sannsynlige neste tokenet – deterministisk, repetitivt, «trygt». Høy temperatur (1,0+) flater ut sannsynlighetsfordelingen, slik at mindre sannsynlige tokens blir levedyktige – mer kreativt, mer overraskende, mer feilutsatt. Et godt utgangspunkt for de fleste chat-brukstilfeller er 0,7. Gå ned til 0,0–0,2 for kode, matematikk eller faktauthenting. Gå opp til 1,0+ for kreativ skriving eller idémyldring.
Top-P (kjernesampling)
I stedet for å vurdere alle tokens, sier top-p: «vurder bare det minste settet av tokens hvis kumulative sannsynlighet er minst P.» Med top-p = 0,9 sampler modellen altså fra de tokenene som til sammen dekker 90 % av sannsynlighetsmassen – den lange halen ignoreres. Det er et smartere og dynamisk alternativ til top-k. Vanlig standardverdi: 0,9 eller 1,0 (av).
Top-K
Vurder bare de K mest sannsynlige neste tokenene, og sample blant disse. Top-k = 1 er grådig dekoding (velg alltid det ene mest sannsynlige tokenet); top-k = 40 beholder de 40 beste kandidatene. Moderne API-er (OpenAI, Anthropic) eksponerer ofte ikke top-k direkte fordi top-p gjerne oppfører seg bedre, men det er standard i åpen kildekode-modeller.
Frekvensstraff
Straffer tokens som allerede er generert i svaret, proporsjonalt med hvor ofte de har dukket opp. Nyttig for å redusere ordrett repetisjon. Typisk område: -2,0 til +2,0; standard er 0.
Tilstedeværelsesstraff
Ligner på frekvensstraff, men binær: straffer tokens som har dukket opp overhodet, uavhengig av antall. Presser modellen til å introdusere nye emner eller ord. Samme område, samme standard.
Stoppsekvenser
Strenger som tvinger modellen til å stoppe genereringen når den produserer dem. Nyttig for strukturerte utdata («stopp når du genererer ###») eller for å holde svar innenfor et bestemt format.
Seed (frøverdi)
Et heltall som låser tilfeldighetsgeneratoren. Samme ledetekst + samme seed + samme modellversjon gir vanligvis samme utdata, noe som er avgjørende for reproduserbarhet, evalueringer og feilsøking. Merk: de fleste leverandører beskriver dette som «best effort» – perfekt determinisme er ikke garantert på tvers av infrastruktur.
Rask sammenligning: temperatur vs. top-p vs. top-k
De tre samplinginnstillingene side om side
| Innstilling | Hva den gjør | Typisk område | Høyere verdi | Lavere verdi |
|---|---|---|---|---|
| Temperatur | Skjerper eller flater ut hele sannsynlighetskurven | 0,0 – 2,0 (standard ~0,7) | Mer kreativt, mer tilfeldig | Mer deterministisk, mer repetitivt |
| Top-P | Beholder bare tokens som dekker P% av sannsynlighetsmassen | 0,0 – 1,0 (standard 0,9 – 1,0) | Mer variasjon i ordvalg | Strammere, tryggere utdata |
| Top-K | Beholder bare de K mest sannsynlige tokenene | 1 – ∞ (ofte av i moderne API-er) | Mer variasjon | Strammere; K=1 = grådig |
Vanlig felle: å justere alle tre på én gang. Velg én – vanligvis temperatur for kreativitetskontroll, eller top-p for mangfoldsjustering – og la de andre stå på standardverdiene. Å stable straffer oppå lav temperatur er opphavet til de fleste rapporter om «merkelig utdata».
3. Hvordan modeller tenker
Du trenger ikke å være maskineringeniør for å bruke KI-verktøy, men noen arkitekturbegreper dukker stadig opp i produktsammenligninger.
Parametere
Tallene inne i modellen som justeres under trening. En «70B-modell» har 70 milliarder av dem. Flere parametere betyr generelt smartere og dyrere, men forholdet har blitt mindre lineært etter hvert som arkitekturene har forbedret seg – en godt trent, mindre modell kan utkonkurrere en større, men eldre modell.
Embedding
En vektor (en liste med tall) som representerer betydningen av en tekstbit i et høydimensjonalt rom. Tekster med lignende betydning havner nær hverandre. Embeddings driver semantisk søk, RAG, deduplicering, klassifisering og anbefalinger. Det er noe annet enn en chat-modell – embedding-modeller er mindre og spesialiserte.
Oppmerksomhet (attention)
Mekanismen som lar en modell avgjøre, når den genererer hvert nytt token, hvilke tidligere tokens den skal «se mest på». Det er kjerneinnnovasjonen i transformere. Du vil sjelden berøre den direkte, men det er grunnen til at kontekstvinduer betyr så mye.
Transformer
Den nevrale nettverksarkitekturen bak praktisk talt alle moderne store språkmodeller siden 2017. Når noen sier «en LLM», mener de nesten alltid en transformer.
Mixture of Experts (MoE)
En arkitektur der modellen er delt opp i mange «ekspert»-delnettverk, og bare en brøkdel av dem aktiveres for hvert token. Det betyr at en modell kan ha f.eks. 400 milliarder parametere totalt, men bare bruke 30 milliarder per token – og dermed få storemodell-kunnskap til småmodell-hastighet. Flere toppmodeller bruker MoE under panseret.
Resonnerende modell
En modell trent til å bruke ekstra beregningskraft på å «tenke» – generere interne resonnementstrinn – før den gir det endelige svaret. Dette forbedrer ytelsen på matematikk, koding og komplekse resonnementoppgaver dramatisk, men øker ventetid og token-kostnad. Resonnerende modeller er den dominerende toppkategorien i 2026.
Tankekjede (Chain-of-thought, CoT)
Enten en ledetekstteknikk («tenk steg for steg») eller en innebygd atferd i resonnerende modeller, der modellen genererer mellomliggende resonnement før det endelige svaret. Resonnementstrinnene er noen ganger skjult for brukeren; med resonnerende modeller betaler du vanligvis for dem som utdata-tokens uansett.
Kvantisering
Å redusere den numeriske presisjonen til en modells parametere (f.eks. fra 16-bits flyt til 4-bits heltall) for å krympe den og øke hastigheten, vanligvis med en liten kvalitetskostnad. Vanlig i åpen kildekode-verdenen; mindre synlig ved bruk av lukkede API-modeller.
4. Trening & justering
Hvordan en enorm mengde tekst blir til en modell som høflig svarer på spørsmålene dine.
Fortrening
Den første og dyreste treningsfasen, der modellen lærer generelt språk og verdenskunnskap ved å forutsi neste token gjennom enorme tekstmengder. Det er her mesteparten av «intelligensen» kommer fra.
Finjustering
En andre treningsfase som tilpasser en fortrent modell til en smalere oppgave eller stil, ved hjelp av et mye mindre datasett. Brukes til domenespesialisering (medisinsk, juridisk, koding) eller for å tilpasse tone og atferd til en bestemt merkevare.
RLHF (Reinforcement Learning from Human Feedback)
Justeringsteknikken som forvandlet rå språkmodeller til nyttige assistenter. Mennesker rangerer modellens utdata; en belønningsmodell trenes på disse vurderingene; deretter finjusteres språkmodellen med forsterkningslæring for å produsere utdata belønningsmodellen foretrekker. RLHF er det som gjør at ChatGPT og Claude avslår skadelige forespørsler, følger instruksjoner høflig og holder seg til temaet. RLAIF (med KI-tilbakemelding) er en beslektet teknikk som nå brukes i stor skala.
Systemprompt
Den overordnede instruksjonen som setter modellens rolle, tone, begrensninger og persona for hele samtalen. Behandles med høyere prioritet enn brukermeldinger av de fleste leverandører. Her forteller du modellen hva den er, før noen spesifikk oppgave.
Hallusinasjon
Når modellen produserer et selvsikkert-klingende svar som er faktafeil eller oppdiktet. Skyldes en blanding av hull i treningsdataene, modellens tendens til å generere plausibel-klingende tekst i stedet for å verifisere, og overdrevent selvsikkert språk. Tiltak: lavere temperatur, RAG (gi den ekte kilder), eksplisitte instruksjoner om å si «jeg vet ikke», og å verifisere alt som er viktig.
Promptteknikk
Praksisen med å skrive ledetekster som pålitelig gir det utdataet du ønsker. Inkluderer ting som rollesetting («du er en...»), eksempler med få skudd (few-shot), tankekjede-utløsere og strukturerte utdata-instruksjoner. Etter hvert som modellene har blitt flinkere til å følge instruksjoner, har promptteknikk gått fra obskure triks til klar skriving.
5. Modeller i praksis
Begrepene du vil høre i produkt- og ingeniørdiskusjoner, ikke i treningsdiskusjoner.
Inferens
Handlingen å kjøre en trent modell – dvs. generere utdata for en gitt inndata. Atskilt fra trening. Inferenskostnad er det API-priser er basert på, og inferenslatens er det brukerne faktisk kjenner på.
RAG (Retrieval-Augmented Generation)
Før modellen svarer, henter den relevante dokumenter fra en separat kunnskapsbase (vanligvis via embedding-likhetsøk) og putter dem inn i ledeteksten som kontekst. RAG lar en liten eller generisk modell svare nøyaktig om dine private dokumenter, aktuelle hendelser eller alt utenfor treningsdataene. Det dominerende mønsteret for «KI som vet om mine ting».
Verktøybruk / funksjonskall
Å la modellen kalle opp eksterne funksjoner eller API-er som en del av svaret – f.eks. «slå opp været», «spør en database», «send en e-post». Modellen sender ut en strukturert forespørsel, koden din utfører den, du mater resultatet tilbake. Det er dette som gjør en LLM til noe som kan handle, ikke bare snakke.
Agent
En løkke der en modell bruker verktøy og tar egne beslutninger over flere steg for å nå et mål – for eksempel surfe på nettet, redigere filer eller kjøre en flerstegs-arbeidsflyt. Moderne agenter er i bunn og grunn «resonnerende modell + verktøy + iterasjonsløkke». Et vagt begrep som dekker alt fra en kundestøtte-bot til en autonom kodingsassistent.
Multimodal
En modell som håndterer mer enn bare tekst – oftest bilder og tekst sammen (visjon), i økende grad også lyd og video. «Multimodal» refererer vanligvis til én enkelt modell som nativt forstår flere modaliteter, ikke en pipeline av separate modeller.
Visjon (eller VLM – Vision-Language Model)
Et spesifikt tilfelle av multimodalt: modellen kan ta bilder som inndata ved siden av tekst. Brukes til OCR, diagramforståelse, skjermbildefeilsøking, dokumentanalyse og alt der «vis, ikke fortell» er viktig.
Streaming
Modellen sender svaret token for token mens det genereres, i stedet for å vente til hele svaret er ferdig. Avgjørende for chat-opplevelsen – brukerne ser svaret utfolde seg i stedet for å stirre på en lasteindikator. Implementert som server-sendte hendelser i de fleste API-er.
Tid til første token (TTFT)
Hvor lang tid det tar fra du sender en forespørsel til du mottar det første tokenet i svaret. Latensen brukeren faktisk kjenner. Resonnerende modeller har høyere TTFT fordi de tenker før de snakker; ikke-resonnerende modeller streamer det første tokenet i brøkdeler av et sekund.
Tokens per sekund
Gjennomstrømning etter at genereringen har startet. En moderne, rask modell kan produsere 80–200+ tokens per sekund; resonnerende modeller kjører ofte saktere fordi de genererer (og betaler for) skjulte resonneringstokens.
Det korteste juksearket mulig
Hvis du ikke husker noe annet:
- Token = ¾ av et ord. Pris er per token.
- Kontekstvindu = hvor mye tekst modellen kan se på én gang.
- Temperatur = kreativitetsspaken. Lav for fakta/kode, høy for ideer.
- Top-P = et smartere, moderne alternativ til top-k. La den stå på standard med mindre du har en grunn til å endre.
- Systemprompt = personaen og reglene for hele samtalen.
- RAG = slik gjør du en modell kunnskapsrik om dine private ting.
- Resonnerende modell = tregere, dyrere, mye smartere på vanskelige problemer.
- Hallusinasjon = et selvsikkert feil svar. Verifiser alltid.
Det er det meste av det du møter til daglig. Resten av denne ordlisten er her for når ett av disse begrepene dukker opp i en dokumentasjon, en tweet eller et modellkort og du trenger et raskt ankerpunkt.
