LLM-baserede AI-agenter 2023–2026

Komprimeret masterniveau-oversigt · dansk forklaring, engelske fagbegreber · balanceret teknisk + økosystem

Feltet bevægede sig fra prompting-baserede agent-mønstre (ReAct, Tree-of-Thoughts, Reflexion) i 2023, via modenhed i function calling, computer use, MCP og reasoning models i 2024, til modne coding agents, RL-trænede agentic models, et konsolideret framework-landskab og enterprise-adoption i 2025–2026. Den centrale uløste udfordring forbliver reliability over lange tidshorisonter.

Det store skift: Agentadfærd er gået fra noget man prompter frem (2023) til noget der i stigende grad trænes ind i modellen via reinforcement learning (2025–2026). Det er den røde tråd i hele oversigten.

1. Tidslinje over centrale milepæle

2. Teknisk/arkitektonisk dybde

2.1 Reasoning- og prompting-mønstre

ReAct's kerneindsigt — at flette reasoning og acting — forblev rygraden. Tree-of-Thoughts tilføjer struktureret search (DFS/BFS/beam med backtracking), Reflexion tilføjer episodic memory og læring mellem forsøg, og Self-Refine tilføjer iterativ self-critique. En vigtig erkendelse i 2024–2025: ren self-correction uden ekstern feedback (grounding) fejler ofte.

Thought reasoning trace Action tool call Observation tool result loop indtil mål nået Final answer
Fig. 1 — ReAct-loopet: modellen veksler mellem thought, action og observation, indtil den afgiver et svar.

2.2 Tool use, function calling & MCP

Udviklingen i fire trin: Toolformer (inline, self-supervised) → function calling (model returnerer JSON tool-call) → JSON mode / Structured Outputs (schema garanteret via constrained decoding) → MCP (universel "USB-C for AI"). MCP bruger en client–server-arkitektur på JSON-RPC 2.0, lånt fra Language Server Protocol (LSP), og løser "M×N-problemet" hvor M modeller skal forbindes til N værktøjer.

Toolformer self-supervised Function calling (JSON) Structured Outputs MCP USB-C for AI 2023 2023 2024 nov 2024 stigende struktur og standardisering →
Fig. 2 — Tool use i fire trin: fra inline self-supervised kald til en universel, standardiseret protokol.
Uden MCP: M×N integrationer Med MCP: M+N integrationer App A App B Tool 1 Tool 2 Tool 3 App A App B MCP host Srv 1 Srv 2 Srv 3 JSON-RPC 2.0 (inspireret af LSP)
Fig. 3 — MCP som hub: i stedet for at hver app integreres med hvert værktøj (M×N), taler alle gennem én standardprotokol (M+N).

2.3 Planning & task decomposition

Planner–executor-arkitekturer (BabyAGI's task-creation/prioritization-loop var et tidligt eksempel) og hierarchical planning. En praktisk lære fra 2023: tung arkitektur (fx ekstern vector DB) var ofte overkill; simple loops med en lokal fil rakte langt.

2.4 Memory

Skellet mellem short-term (working/context memory) og long-term (episodic + semantic memory). RAG i agent-kontekst adskiller sig fra klassisk RAG ved at "agentic memory" akkumulerer tekstuelle records af observations, actions og outcomes på tværs af steps. Memory konstrueres via key-value slots, semantiske vektorer og relation-aware graphs.

2.5 Multi-agent systemer

Orchestration-mønstre: role-based (CrewAI), conversational/debate (AutoGen GroupChat), graph-based (LangGraph) og orchestrator–worker. I 2025–2026 kollapsede debatten: den dominerende produktionsarkitektur blev en single lead agent der spawner isolerede, ephemeral subagents — ikke peer-to-peer-sværme.

Token-prisen ved multi-agent: Anthropics multi-agent research-system slog en single-agent Opus 4 med 90,2% på en intern research-eval — men agenter bruger typisk ~4× flere tokens end chat, og multi-agent-systemer ~15× flere. Token-forbrug alene forklarede 80% af variansen på BrowseComp.
Lead agent orchestrator Subagent 1 isoleret kontekst Subagent 2 isoleret kontekst Subagent 3 isoleret kontekst spawner parallelt resultater samles → lead agent syntetiserer
Fig. 4 — Orchestrator–worker: en lead agent deler opgaven op og kører subagents parallelt i isolerede kontekster (≈15× tokens vs. chat).

2.6 Agentic scaffolding & harness-design

En central erkendelse: samme base-model i forskellige scaffolds varierer markant. På GAIA scorer samme model fx ~65% i ét harness men ~58% i et andet — en forskel der alene skyldes harnessets retrieval, retry-budget, validering, state-building og error recovery. Performance = model + harness, ikke model alene.

2.7 Trænings- og modeludvikling

RLHF (reward modeling fra menneskelige præferencer) var grundlaget; reasoning models skiftede til RLVR (Reinforcement Learning with Verifiable Rewards), hvor miljøet selv giver signalet (unit tests for kode, exact-match for matematik). Agentic RL udvider dette til multi-turn tool-interaktion med credit assignment på tværs af sekventielle tool-kald. Long-context (128k+) muliggjorde længere agent-trajektorier.

2.8 Computer use / GUI agents

Claude Computer Use (okt 2024, screenshot + mus/tastatur i sandboxed miljø) og OpenAI Operator/CUA (jan 2025, vision + RL-reasoning). Frem mod 2026 nåede OSWorld-scores 70'erne, men GUI-agenter er fortsat langsomme og relativt upålidelige til produktion.

2.9 Coding agents

Den modneste vertical. Devin (Cognition, marts 2024) var den første markedsførte "AI software engineer"; Claude Code (feb 2025, terminal-baseret) og OpenAI Codex fulgte. SWE-bench Verified blev de facto-standard, men contamination gjorde nyere, sværere benchmarks nødvendige.

3. Økosystem & anvendelse

3.1 Frameworks (konsolidering)

FrameworkProfilBedst til
LangGraphGraph-based, stateful, checkpointing, human-in-the-loopProduction / kompleks state-control
CrewAIRole-based "crews"Hurtig role-based prototyping
AutoGen → Microsoft Agent FrameworkMulti-agent conversation (fusioneret med Semantic Kernel)Microsoft-stack, enterprise
OpenAI Agents SDKHandoff-abstraktion (afløste Swarm)OpenAI-centreret stack
smolagents (HuggingFace)Minimalistisk, code-first agentsLokale modeller, forskning, læring
AutoGPT / BabyAGI2023-pionererneHistorisk reference

3.2 Benchmarks — og hvorfor evaluering er svær

Centrale benchmarks: SWE-bench Verified (coding), WebArena & OSWorld (web/OS), GAIA (general assistant), τ-bench/Tau²-bench (tool-agent-user, måler reliability via Pass^k), AgentBench. Evaluering er svær fordi: (1) scaffold-afhængighed blander model og harness; (2) reward hacking — modeller snyder mod metrikken; (3) contamination af træningsdata; (4) single-shot success måler ikke reliability; (5) METR time-horizon: den taskvarighed agenter klarer med 50% pålidelighed fordobles ca. hver 7. måned.

3.3 Kommercielle produkter & adoption

Enterprise-platforme: Salesforce Agentforce, Microsoft Copilot Studio / Agent 365, Google Vertex AI Agent Builder, ServiceNow, IBM watsonx Orchestrate. Markedsanalyser projicerer kraftig vækst (typisk CAGR i 40'erne mod 2030), men tallene stammer fra kommercielle analysehuse og bør behandles som indikative. De store labs leverer egne agent-produkter: OpenAI (ChatGPT Agent, Codex), Anthropic (Claude Code, Computer Use), Google DeepMind (Gemini computer use), Microsoft (Copilot).

3.4 Standardisering & interoperabilitet

MCP (agent ↔ tools/data) blev de facto-standard og blev doneret til en foundation under Linux Foundation med opbakning fra Anthropic, OpenAI, Google, Microsoft m.fl. A2A (agent ↔ agent, Google apr 2025) er komplementær og blev ligeledes doneret til Linux Foundation. Tilsammen danner de en lagdelt stak: A2A for agent-til-agent-koordination, MCP for agent-til-værktøj.

3.5 Sikkerhed, alignment & risici

Prompt injection er #1 på OWASP Top 10 for LLM Applications (2025), både direkte og indirekte (via RAG-dokumenter/tool-output). "The lethal trifecta" (Simon Willison): kombinationen af private data + untrusted content + external communication gør autonome agenter strukturelt sårbare. Forsvar omfatter guardrail-systemer (fx Metas LlamaFirewall), begrænsning af agentens action-space og design-patterns som "Agents Rule of Two".

3.6 Begrænsninger & åbne udfordringer

Reliability (single-shot vs. konsistens), error compounding over lange horisonter (goal drift, uendelige loops), cost (multi-agent ≈ 15× tokens), umoden evaluering og hallucination i multi-step tasks. METR-trenden om voksende tidshorisonter er robust men omdiskuteret pga. et begrænset task-grundlag.

opgave- varighed (log) tid (model-generationer 2023 → 2026) sek min timer dage fordobling ca. hver 7. måned (50% reliability)
Fig. 5 — METR time-horizon: en ret linje på en logaritmisk akse betyder eksponentiel vækst i den opgavevarighed agenter klarer pålideligt. Trenden er robust men omdiskuteret.

4. Pædagogisk struktur — forslag til pensum (12 uger)

Modul 1 — Fundament (uge 1–2)

Agent-definition; ReAct og CoT; think–act–observe-loop. Øvelse: byg en ReAct-agent med smolagents.

Modul 2 — Reasoning-mønstre (uge 3)

Tree-of-Thoughts, Reflexion, Self-Refine; search vs. refinement. Læsning: ToT- og Reflexion-papers.

Modul 3 — Tool use & MCP (uge 4–5)

Function calling → Structured Outputs → MCP. Hands-on: byg en MCP-server.

Modul 4 — Memory & RAG (uge 6)

Short/long-term, episodic memory, vector stores i agent-kontekst.

Modul 5 — Multi-agent & scaffolding (uge 7–8)

Orchestrator–worker vs. debate; harness-effekter. Case: Anthropics research-system.

Modul 6 — Træning af agenter (uge 9)

RLHF, RLVR, agentic RL; reasoning models.

Modul 7 — Evaluering (uge 10)

SWE-bench, GAIA, τ-bench, OSWorld; reward hacking; METR time-horizon. Øvelse: kør en privat eval.

Modul 8 — Sikkerhed (uge 11)

Prompt injection, lethal trifecta, guardrails.

Modul 9 — Økosystem & produktion (uge 12)

Frameworks, enterprise-platforme, A2A/MCP, capstone-projekt.

5. Praktiske anbefalinger

  1. Start simpelt: én ReAct-agent med 1–3 tools; validér pålidelig tool-calling før kompleksitet tilføjes.
  2. Tilføj kun kompleksitet når det simple demonstrerbart fejler — over-engineering af orchestration er den hyppigste fejl.
  3. Vælg framework efter problem: LangGraph til production, CrewAI til prototyping, smolagents til lokale modeller/forskning.
  4. Brug multi-agent kun når værdien retfærdiggør ~15× token-omkostning og opgaven er paralleliserbar.
  5. Bryd den lethal trifecta (eller indfør isolation/guardrails) før produktion, hvis agenten har private data + untrusted input + external communication samtidig.
  6. Mistro for gode benchmark-tal: verificér med en privat eval på din egen workload.

Nøglebegreber

Videre læring

Kilder

  1. Yao et al. (2022/2023). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629
  2. Schick et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761
  3. Yao et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601
  4. Shinn et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. arXiv:2303.11366
  5. Mialon et al. (2023). GAIA: a benchmark for General AI Assistants. arXiv:2311.12983
  6. OpenAI (2024). Introducing Structured Outputs in the API. openai.com
  7. Anthropic (2024). Introducing the Model Context Protocol. anthropic.com
  8. Anthropic. Computer use tool — Claude API Docs. platform.claude.com
  9. OpenAI (2025). Computer-Using Agent. openai.com
  10. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948
  11. Google Developers Blog (2025). Announcing the Agent2Agent Protocol (A2A). developers.googleblog.com
  12. Anthropic (2025). How we built our multi-agent research system. anthropic.com/engineering
  13. METR (2025). Measuring AI Ability to Complete Long Tasks. metr.org
  14. METR (2025). Recent Frontier Models Are Reward Hacking. metr.org
  15. Willison, S. (2025). The lethal trifecta for AI agents. simonwillison.net
  16. OWASP (2025). OWASP Top 10 for LLM Applications. genai.owasp.org
  17. Weng, L. (2023). LLM Powered Autonomous Agents. lilianweng.github.io
  18. SWE-bench. SWE-bench / SWE-bench Verified. swebench.com

Bemærk: model- og benchmark-tal er øjebliksbilleder og forældes hurtigt; markedsstørrelser stammer fra kommercielle analysehuse og er indikative. Verificér mod primærkilder før undervisningsbrug.