Komprimeret masterniveau-oversigt · dansk forklaring, engelske fagbegreber · balanceret teknisk + økosystem
Feltet bevægede sig fra prompting-baserede agent-mønstre (ReAct, Tree-of-Thoughts, Reflexion) i 2023, via modenhed i function calling, computer use, MCP og reasoning models i 2024, til modne coding agents, RL-trænede agentic models, et konsolideret framework-landskab og enterprise-adoption i 2025–2026. Den centrale uløste udfordring forbliver reliability over lange tidshorisonter.
Det store skift: Agentadfærd er gået fra noget man prompter frem (2023) til noget der i stigende grad trænes ind i modellen via reinforcement learning (2025–2026). Det er den røde tråd i hele oversigten.
1. Tidslinje over centrale milepæle
2022 (forudsætninger) Chain-of-Thought (CoT) prompting (Google) introducerer multi-step reasoning. ReAct (Yao et al., arXiv okt 2022, ICLR 2023) fletter reasoning traces og actions i en think–act–observe-loop — grundlaget for de første agent-frameworks.
2023 — prompting-æraen & den autonome hype Toolformer (Meta, feb): self-supervised tool use. OpenAI function calling (juni) gør tool use struktureret og praktisk. AutoGPT og BabyAGI (marts–april) udløser autonom-agent-hype; AutoGPT bliver et af de hurtigst voksende open source-projekter i GitHubs historie. Tree-of-Thoughts (maj), Reflexion og Self-Refine udvider reasoning. AutoGen (Microsoft, aug) og benchmarken GAIA (nov) lanceres.
2024 — modenhed, computer use, MCP & reasoning Structured Outputs (OpenAI, aug): constrained decoding giver garanteret JSON-schema. Claude Computer Use (Anthropic, okt): første frontier-API der styrer en GUI. Model Context Protocol (MCP) (Anthropic, 25. nov): åben standard for tool/data-integration. OpenAI o1 (dec): første store reasoning model med RL-trænet chain-of-thought.
2025 — reasoning udbredt, coding agents modne, økosystem DeepSeek R1 (jan, open-weight, MIT) udløser et markedschok. OpenAI Operator/CUA (jan). Claude 3.7 + extended thinking og Claude Code (feb). Google A2A-protokol (apr). OpenAI Agents SDK (marts) og Codex (maj). MCP vinder bredt; Microsoft kalder Windows 11 et "agentic OS".
2026 — frontier-agenter & kritik af evaluering
Frontier-modeller leder SWE-bench Verified (over 87%). MCP doneres til en foundation under Linux Foundation. Forskere viser at alle store agent-benchmarks kan reward-hackes — evaluering bliver det svageste led.
2. Teknisk/arkitektonisk dybde
2.1 Reasoning- og prompting-mønstre
ReAct's kerneindsigt — at flette reasoning og acting — forblev rygraden. Tree-of-Thoughts tilføjer struktureret search (DFS/BFS/beam med backtracking), Reflexion tilføjer episodic memory og læring mellem forsøg, og Self-Refine tilføjer iterativ self-critique. En vigtig erkendelse i 2024–2025: ren self-correction uden ekstern feedback (grounding) fejler ofte.
Fig. 1 — ReAct-loopet: modellen veksler mellem thought, action og observation, indtil den afgiver et svar.
2.2 Tool use, function calling & MCP
Udviklingen i fire trin: Toolformer (inline, self-supervised) → function calling (model returnerer JSON tool-call) → JSON mode / Structured Outputs (schema garanteret via constrained decoding) → MCP (universel "USB-C for AI"). MCP bruger en client–server-arkitektur på JSON-RPC 2.0, lånt fra Language Server Protocol (LSP), og løser "M×N-problemet" hvor M modeller skal forbindes til N værktøjer.
Fig. 2 — Tool use i fire trin: fra inline self-supervised kald til en universel, standardiseret protokol.Fig. 3 — MCP som hub: i stedet for at hver app integreres med hvert værktøj (M×N), taler alle gennem én standardprotokol (M+N).
2.3 Planning & task decomposition
Planner–executor-arkitekturer (BabyAGI's task-creation/prioritization-loop var et tidligt eksempel) og hierarchical planning. En praktisk lære fra 2023: tung arkitektur (fx ekstern vector DB) var ofte overkill; simple loops med en lokal fil rakte langt.
2.4 Memory
Skellet mellem short-term (working/context memory) og long-term (episodic + semantic memory). RAG i agent-kontekst adskiller sig fra klassisk RAG ved at "agentic memory" akkumulerer tekstuelle records af observations, actions og outcomes på tværs af steps. Memory konstrueres via key-value slots, semantiske vektorer og relation-aware graphs.
2.5 Multi-agent systemer
Orchestration-mønstre: role-based (CrewAI), conversational/debate (AutoGen GroupChat), graph-based (LangGraph) og orchestrator–worker. I 2025–2026 kollapsede debatten: den dominerende produktionsarkitektur blev en single lead agent der spawner isolerede, ephemeral subagents — ikke peer-to-peer-sværme.
Token-prisen ved multi-agent: Anthropics multi-agent research-system slog en single-agent Opus 4 med 90,2% på en intern research-eval — men agenter bruger typisk ~4× flere tokens end chat, og multi-agent-systemer ~15× flere. Token-forbrug alene forklarede 80% af variansen på BrowseComp.
Fig. 4 — Orchestrator–worker: en lead agent deler opgaven op og kører subagents parallelt i isolerede kontekster (≈15× tokens vs. chat).
2.6 Agentic scaffolding & harness-design
En central erkendelse: samme base-model i forskellige scaffolds varierer markant. På GAIA scorer samme model fx ~65% i ét harness men ~58% i et andet — en forskel der alene skyldes harnessets retrieval, retry-budget, validering, state-building og error recovery. Performance = model + harness, ikke model alene.
2.7 Trænings- og modeludvikling
RLHF (reward modeling fra menneskelige præferencer) var grundlaget; reasoning models skiftede til RLVR (Reinforcement Learning with Verifiable Rewards), hvor miljøet selv giver signalet (unit tests for kode, exact-match for matematik). Agentic RL udvider dette til multi-turn tool-interaktion med credit assignment på tværs af sekventielle tool-kald. Long-context (128k+) muliggjorde længere agent-trajektorier.
2.8 Computer use / GUI agents
Claude Computer Use (okt 2024, screenshot + mus/tastatur i sandboxed miljø) og OpenAI Operator/CUA (jan 2025, vision + RL-reasoning). Frem mod 2026 nåede OSWorld-scores 70'erne, men GUI-agenter er fortsat langsomme og relativt upålidelige til produktion.
2.9 Coding agents
Den modneste vertical. Devin (Cognition, marts 2024) var den første markedsførte "AI software engineer"; Claude Code (feb 2025, terminal-baseret) og OpenAI Codex fulgte. SWE-bench Verified blev de facto-standard, men contamination gjorde nyere, sværere benchmarks nødvendige.
Multi-agent conversation (fusioneret med Semantic Kernel)
Microsoft-stack, enterprise
OpenAI Agents SDK
Handoff-abstraktion (afløste Swarm)
OpenAI-centreret stack
smolagents (HuggingFace)
Minimalistisk, code-first agents
Lokale modeller, forskning, læring
AutoGPT / BabyAGI
2023-pionererne
Historisk reference
3.2 Benchmarks — og hvorfor evaluering er svær
Centrale benchmarks: SWE-bench Verified (coding), WebArena & OSWorld (web/OS), GAIA (general assistant), τ-bench/Tau²-bench (tool-agent-user, måler reliability via Pass^k), AgentBench. Evaluering er svær fordi: (1) scaffold-afhængighed blander model og harness; (2) reward hacking — modeller snyder mod metrikken; (3) contamination af træningsdata; (4) single-shot success måler ikke reliability; (5) METR time-horizon: den taskvarighed agenter klarer med 50% pålidelighed fordobles ca. hver 7. måned.
3.3 Kommercielle produkter & adoption
Enterprise-platforme: Salesforce Agentforce, Microsoft Copilot Studio / Agent 365, Google Vertex AI Agent Builder, ServiceNow, IBM watsonx Orchestrate. Markedsanalyser projicerer kraftig vækst (typisk CAGR i 40'erne mod 2030), men tallene stammer fra kommercielle analysehuse og bør behandles som indikative. De store labs leverer egne agent-produkter: OpenAI (ChatGPT Agent, Codex), Anthropic (Claude Code, Computer Use), Google DeepMind (Gemini computer use), Microsoft (Copilot).
3.4 Standardisering & interoperabilitet
MCP (agent ↔ tools/data) blev de facto-standard og blev doneret til en foundation under Linux Foundation med opbakning fra Anthropic, OpenAI, Google, Microsoft m.fl. A2A (agent ↔ agent, Google apr 2025) er komplementær og blev ligeledes doneret til Linux Foundation. Tilsammen danner de en lagdelt stak: A2A for agent-til-agent-koordination, MCP for agent-til-værktøj.
3.5 Sikkerhed, alignment & risici
Prompt injection er #1 på OWASP Top 10 for LLM Applications (2025), både direkte og indirekte (via RAG-dokumenter/tool-output). "The lethal trifecta" (Simon Willison): kombinationen af private data + untrusted content + external communication gør autonome agenter strukturelt sårbare. Forsvar omfatter guardrail-systemer (fx Metas LlamaFirewall), begrænsning af agentens action-space og design-patterns som "Agents Rule of Two".
3.6 Begrænsninger & åbne udfordringer
Reliability (single-shot vs. konsistens), error compounding over lange horisonter (goal drift, uendelige loops), cost (multi-agent ≈ 15× tokens), umoden evaluering og hallucination i multi-step tasks. METR-trenden om voksende tidshorisonter er robust men omdiskuteret pga. et begrænset task-grundlag.
Fig. 5 — METR time-horizon: en ret linje på en logaritmisk akse betyder eksponentiel vækst i den opgavevarighed agenter klarer pålideligt. Trenden er robust men omdiskuteret.
4. Pædagogisk struktur — forslag til pensum (12 uger)
Modul 1 — Fundament (uge 1–2)
Agent-definition; ReAct og CoT; think–act–observe-loop. Øvelse: byg en ReAct-agent med smolagents.
Modul 2 — Reasoning-mønstre (uge 3)
Tree-of-Thoughts, Reflexion, Self-Refine; search vs. refinement. Læsning: ToT- og Reflexion-papers.
Modul 3 — Tool use & MCP (uge 4–5)
Function calling → Structured Outputs → MCP. Hands-on: byg en MCP-server.
Modul 4 — Memory & RAG (uge 6)
Short/long-term, episodic memory, vector stores i agent-kontekst.
Modul 5 — Multi-agent & scaffolding (uge 7–8)
Orchestrator–worker vs. debate; harness-effekter. Case: Anthropics research-system.
Modul 6 — Træning af agenter (uge 9)
RLHF, RLVR, agentic RL; reasoning models.
Modul 7 — Evaluering (uge 10)
SWE-bench, GAIA, τ-bench, OSWorld; reward hacking; METR time-horizon. Øvelse: kør en privat eval.
Start simpelt: én ReAct-agent med 1–3 tools; validér pålidelig tool-calling før kompleksitet tilføjes.
Tilføj kun kompleksitet når det simple demonstrerbart fejler — over-engineering af orchestration er den hyppigste fejl.
Vælg framework efter problem: LangGraph til production, CrewAI til prototyping, smolagents til lokale modeller/forskning.
Brug multi-agent kun når værdien retfærdiggør ~15× token-omkostning og opgaven er paralleliserbar.
Bryd den lethal trifecta (eller indfør isolation/guardrails) før produktion, hvis agenten har private data + untrusted input + external communication samtidig.
Mistro for gode benchmark-tal: verificér med en privat eval på din egen workload.
Nøglebegreber
ReAct (Reasoning + Acting): agent-mønster der interleaver reasoning traces og handlinger i en loop — grundlaget for moderne tool-using agents (Yao et al., arXiv:2210.03629).
Tree-of-Thoughts (ToT): generaliserer chain-of-thought til en træ-søgning over delløsninger med backtracking (Yao et al., arXiv:2305.10601).
Reflexion: verbal self-reflection gemt i episodic memory, så agenten lærer mellem forsøg (Shinn et al., arXiv:2303.11366).
Toolformer: self-supervised tilgang hvor modellen selv lærer hvornår API'er skal kaldes inline (Schick et al., arXiv:2302.04761).
Function calling & Structured Outputs: struktureret tool-kald med garanteret JSON-schema via constrained decoding (OpenAI, 2024).
Model Context Protocol (MCP): åben standard ("USB-C for AI") der forbinder modeller med værktøjer og data via JSON-RPC (Anthropic, nov 2024).
Agent2Agent (A2A): protokol for interoperabilitet mellem agenter på tværs af frameworks (Google, apr 2025).
Reasoning models & RLVR: modeller trænet med Reinforcement Learning from Verifiable Rewards til at producere lange reasoning-kæder (DeepSeek-R1, arXiv:2501.12948).
Computer use / GUI agents: agenter der styrer et skærmbillede via screenshots og mus/tastatur (Anthropic Computer Use docs).
Orchestrator–worker (multi-agent): en lead agent koordinerer og delegerer til parallelle subagents (Anthropic, jun 2025).
SWE-bench Verified: human-verificeret coding-benchmark baseret på rigtige GitHub-issues (swebench.com).
Bemærk: model- og benchmark-tal er øjebliksbilleder og forældes hurtigt; markedsstørrelser stammer fra kommercielle analysehuse og er indikative. Verificér mod primærkilder før undervisningsbrug.