Le RAG (Retrieval Augmented Generation) consiste à coupler un LLM avec une base documentaire interne, pour qu’il réponde sur la base de vos documents plutôt que sur ses connaissances générales. Appliqué à la conformité, c’est l’usage qui produit le retour sur investissement le plus mesurable. Voici une architecture concrète, les coûts, et les pièges qu’on a rencontrés sur 6 déploiements.
Pourquoi RAG pour la conformité
Le domaine de la conformité est documentaire par nature : 200+ pages d’ISO 27001, 80+ pages de NIS2, 110+ pages de DORA, des dizaines de pages d’arrêtés, de RTS, de guidelines… Un RAG bien construit permet de :
- Répondre à « que dit DORA sur les tests TLPT ? » en citant l’article exact, en 5 secondes
- Trouver les correspondances entre référentiels sans les mémoriser
- Onboarder un nouveau consultant en lui donnant un assistant qui « connaît » le corpus
- Auditer une politique en confrontant directement aux exigences sourcées
Architecture de référence
Stratégie de chunking critique
Le chunking — découpage des documents en blocs avant indexation — est le paramètre qui impacte le plus la qualité finale. Recommandations issues de nos déploiements :
| Paramètre | Valeur recommandée | Pourquoi |
|---|---|---|
| Taille de chunk | 600-1000 tokens | Trop petit = perte de contexte ; trop grand = bruit |
| Overlap | 15-20 % | Capture les frontières (fin/début de §) |
| Découpage | Par section / sous-titre quand possible | Respecte la structure logique |
| Métadonnées | Toujours : nom doc, section, page | Source-tracking obligatoire |
| Tables | Extraction spécifique (Camelot, Unstructured) | Les tables PDF se massacrent au chunking naïf |
Stack technique et coûts
| Composant | Option self-hosted | Option SaaS | Coût mensuel typique |
|---|---|---|---|
| Vector DB | Qdrant, pgvector, Weaviate | Pinecone, Qdrant Cloud | 0 à 200 € |
| Embeddings | BGE-large (HuggingFace) | OpenAI text-embedding-3 | 5-30 € (corpus 100 k chunks) |
| LLM | Llama 3.1, Mistral, Qwen | GPT-4o, Claude, Mistral Large | 80-400 € (500 req/jour) |
| Reranker (optionnel) | BGE-reranker | Cohere Rerank | 0-80 € |
| Orchestration | LangChain, LlamaIndex | n/a | 0 (open source) |
Setup minimal viable pour une équipe GRC de 5 personnes : pgvector + OpenAI embeddings + Claude Sonnet/Mistral Large. Compter environ 250-400 €/mois pour un usage intensif, plus 3-5 jours-ingénieur de mise en place.
5 pièges à éviter
1. Pas de re-ranking
La similarité vectorielle seule est imprécise. Sur du référentiel normatif, 4 sur 5 fois le top-1 vectoriel n’est pas le meilleur chunk. Toujours rerank.
2. Pas de citations dans la réponse
Un RAG conformité sans citations sourcées n’a aucune valeur d’audit. Toujours imposer dans le prompt système : « cite la source pour chaque affirmation ».
3. Documents non versionnés
Si on indexe ISO 27001:2013 et ISO 27001:2022 dans le même index sans tag de version, le modèle mélange. Tagger chaque chunk avec version + date.
4. Évaluation absente
Sans jeu de test (50-200 questions avec réponses validées par expert), impossible de mesurer si une modification améliore ou dégrade. Construire le golden dataset dès le début.
5. Confondre RAG et fine-tuning
Le fine-tuning est nécessaire dans < 5 % des cas. Pour la conformité, RAG suffit presque toujours et est 100x moins cher à maintenir.
Un RAG conformité bien fait remplace 60 à 80 % des recherches documentaires manuelles d’un consultant GRC. À 250 €/mois, c’est le ratio prix/utilité le plus élevé qu’on ait vu apparaître sur le marché GRC depuis 5 ans.
Démarrer
Prototype en 1 semaine avec LangChain + pgvector + OpenAI : 3 jours d’ingestion documentaire, 2 jours de prompting, 2 jours d’évaluation. Le pilote tient en 1500 lignes de code. Au-delà, c’est de l’industrialisation (RBAC, audit log, intégration SSO).