En sikker RAG-assistent bør bevare kildesystemets adgangsrettigheder, adskille identiteter og tenants, behandle retrieved content som untrusted input, begrænse tool calls, validere output, logge væsentlige events og vise kilder. RAG forbedrer grounding, men fjerner ikke prompt injection, datalæk, excessive agency eller misinformation.
Referencearkitektur
Bevar rettigheder hele vejen
Hvis en bruger ikke kan åbne et dokument i kildesystemet, bør assistenten ikke kunne vise det via retrieval. Undgå flade vector indexes uden adgangskontekst. Retrieval skal håndhæve brugeridentitet, kilderettigheder og tenant boundaries.
Behandl dokumenter som potentielt fjendtligt input
Et retrieved dokument kan indeholde instruktioner, der forsøger at ændre modellens adfærd. OWASP fastholder prompt injection som en central GenAI-risiko; RAG og finetuning eliminerer ikke problemet. Systeminstruktioner, brugerinput og retrieved content skal have tydelige trust-grænser.
Adskil viden fra handling
En assistant der læser dokumenter er ikke det samme som en agent, der kan sende mail, ændre data eller udføre transaktioner. Tool permissions skal være eksplicitte, scoped og auditerbare. Konsekvensfulde handlinger bør bruge deterministisk validering og relevant menneskelig godkendelse.
Test de vigtigste failure modes
- Direkte og indirekte prompt injection.
- Cross-user og cross-tenant retrieval leakage.
- Sensitive information disclosure.
- Retrieval af forældede eller ikke-godkendte dokumenter.
- Forkert source attribution.
- Tool misuse og excessive agency.
- Hallucinerede policy- eller compliancepåstande.
- Ondsindede filer, URLs og skjulte instruktioner.
- Model/version changes.
- Manglende refusal når evidensen er utilstrækkelig.
Deployment gate
Primære referencer
En sikkerhedsbaseline, ikke en garanti for sikkerhed. Arkitekturen skal testes mod jeres faktiske data og trusselsmodel.
Review en AI-assistent før den bliver produktionsinfrastruktur
SundAI fokuserer på AI-sikkerhedsarkitektur, governance-evidens og kontrolleret ibrugtagning.
Se AI-sikkerhedsvurdering →