AI-säkerhetUppdaterad 4 sep 202611 min

Säker RAG och AI-assistenter: en 2026-säkerhetsbaseline

Retrieval-augmented generation gör AI mer användbar men skapar nya trust boundaries mellan källsystem, vector stores, retrieval, modellkontext, tool calls och handlingar.

Kort svar

En säker RAG-assistent bör bevara källsystemets åtkomstbehörigheter, separera identiteter och tenants, behandla retrieved content som untrusted input, begränsa tool calls, validera output, logga viktiga events och visa källor. RAG förbättrar grounding men eliminerar inte prompt injection, dataläckage, excessive agency eller misinformation.

Identitet före retrievalModellen får inte hämta material användaren saknar behörighet till.
Dokument är untrustedRetrieved text kan innehålla skadliga instruktioner.
Agency behöver gränserLäsåtkomst och handlingsbehörighet bör separeras och vara least-privileged.

Referensarkitektur

LagerPrimär riskBaseline-kontroll
Användare & identitetAccount compromise eller för bred åtkomstSSO/MFA, roller, session controls, group-aware retrieval
Connectors & ingestionKänsligt eller skadligt innehållGodkända källor, proveniensmetadata, scanning, klassificering
Vector / retrievalCross-tenant eller permission leakageTenant isolation, ACL-filter, skyddade embeddings, deletion lifecycle
ModellkontextPrompt injectionTrust separation, policy hierarchy och kontrollerad kontext
Tools / agentsExcessive agencyAllowlists, least privilege och approval för viktiga handlingar
OutputDataläckage och misinformationKällhänvisning, validering, policy filters och human review
MonitoringOsynligt missbruk eller driftAudit logs, telemetri, utvärdering och incident workflow

Bevara behörigheter hela vägen

Om en användare inte kan öppna ett dokument i källsystemet bör assistenten inte kunna visa det via retrieval. Undvik platta vector indexes utan åtkomstkontext. Retrieval ska upprätthålla användaridentitet, källbehörigheter och tenant boundaries.

Behandla dokument som potentiellt fientlig input

Ett retrieved dokument kan innehålla instruktioner som försöker ändra modellens beteende. OWASP fortsätter att identifiera prompt injection som en central GenAI-risk; RAG och finetuning eliminerar inte problemet. Systeminstruktioner, användarinput och retrieved content ska ha tydliga trust-gränser.

Separera kunskap från handling

En assistant som läser dokument är inte samma sak som en agent som kan skicka e-post, ändra data eller genomföra transaktioner. Tool permissions ska vara explicita, scoped och revisionsbara. Konsekvensfulla handlingar bör använda deterministisk validering och relevant mänskligt godkännande.

Testa viktigaste failure modes

Deployment gate

GateFråga
DataÄr källor godkända, klassificerade och permission-aware?
IdentitetKan systemet upprätthålla användar-, grupp- och tenant-gränser?
InjectionHar direkt och indirekt prompt injection testats?
ToolsÄr agenthandlingar allowlisted, least-privileged och godkända vid behov?
EvidensKan output spåras till källor, modell/version och handlingar?
DriftÄr monitoring, incident response, rollback och change control definierade?

Primära referenser

En säkerhetsbaseline, inte en garanti för säkerhet. Arkitekturen måste testas mot faktiska data och hotmodell.

Granska en AI-assistent innan den blir produktionsinfrastruktur

SundAI fokuserar på AI-säkerhetsarkitektur, governance-evidens och kontrollerat införande.

Se AI-säkerhetsbedömning →
← Alla insikterNästa: Shadow AI →