En säker RAG-assistent bör bevara källsystemets åtkomstbehörigheter, separera identiteter och tenants, behandla retrieved content som untrusted input, begränsa tool calls, validera output, logga viktiga events och visa källor. RAG förbättrar grounding men eliminerar inte prompt injection, dataläckage, excessive agency eller misinformation.
Referensarkitektur
Bevara behörigheter hela vägen
Om en användare inte kan öppna ett dokument i källsystemet bör assistenten inte kunna visa det via retrieval. Undvik platta vector indexes utan åtkomstkontext. Retrieval ska upprätthålla användaridentitet, källbehörigheter och tenant boundaries.
Behandla dokument som potentiellt fientlig input
Ett retrieved dokument kan innehålla instruktioner som försöker ändra modellens beteende. OWASP fortsätter att identifiera prompt injection som en central GenAI-risk; RAG och finetuning eliminerar inte problemet. Systeminstruktioner, användarinput och retrieved content ska ha tydliga trust-gränser.
Separera kunskap från handling
En assistant som läser dokument är inte samma sak som en agent som kan skicka e-post, ändra data eller genomföra transaktioner. Tool permissions ska vara explicita, scoped och revisionsbara. Konsekvensfulla handlingar bör använda deterministisk validering och relevant mänskligt godkännande.
Testa viktigaste failure modes
- Direkt och indirekt prompt injection.
- Cross-user och cross-tenant retrieval leakage.
- Sensitive information disclosure.
- Retrieval av föråldrade eller icke-godkända dokument.
- Felaktig source attribution.
- Tool misuse och excessive agency.
- Hallucinerade policy- eller compliancepåståenden.
- Skadliga filer, URL:er och dolda instruktioner.
- Model/version changes.
- Utebliven refusal när evidens saknas.
Deployment gate
Primära referenser
En säkerhetsbaseline, inte en garanti för säkerhet. Arkitekturen måste testas mot faktiska data och hotmodell.
Granska en AI-assistent innan den blir produktionsinfrastruktur
SundAI fokuserar på AI-säkerhetsarkitektur, governance-evidens och kontrollerat införande.
Se AI-säkerhetsbedömning →