Le RAG (Retrieval Augmented Generation) consiste à coupler un LLM avec une base documentaire interne, pour qu’il réponde sur la base de vos documents plutôt que sur ses connaissances générales. Appliqué à la conformité, c’est l’usage qui produit le retour sur investissement le plus mesurable. Voici une architecture concrète, les coûts, et les pièges qu’on a rencontrés sur 6 déploiements.

Pourquoi RAG pour la conformité

Le domaine de la conformité est documentaire par nature : 200+ pages d’ISO 27001, 80+ pages de NIS2, 110+ pages de DORA, des dizaines de pages d’arrêtés, de RTS, de guidelines… Un RAG bien construit permet de :

  • Répondre à « que dit DORA sur les tests TLPT ? » en citant l’article exact, en 5 secondes
  • Trouver les correspondances entre référentiels sans les mémoriser
  • Onboarder un nouveau consultant en lui donnant un assistant qui « connaît » le corpus
  • Auditer une politique en confrontant directement aux exigences sourcées

Architecture de référence

Architecture RAG appliquée à la conformité PIPELINE D’INDEXATION (offline, ~1x par mois) Documents PDF, DOCX, MD Parsing + Chunking 800 tokens / overlap Embedding text-embed-3-large Vector DB Qdrant / pgvector PIPELINE D’INFÉRENCE (online, par requête) Question utilisateur Embed Q. vecteur Top-k retrieval 5-10 chunks Rerank cohere / bge LLM GPT-4o / Mistral Réponse avec citations sourcées : « DORA exige des tests TLPT triennaux pour les entités significatives (art. 26 §1) — source : DORA.pdf, p. 47 »
Figure 1 — Pipeline RAG en deux temps : indexation offline + inférence online.

Stratégie de chunking critique

Le chunking — découpage des documents en blocs avant indexation — est le paramètre qui impacte le plus la qualité finale. Recommandations issues de nos déploiements :

Paramètre Valeur recommandée Pourquoi
Taille de chunk 600-1000 tokens Trop petit = perte de contexte ; trop grand = bruit
Overlap 15-20 % Capture les frontières (fin/début de §)
Découpage Par section / sous-titre quand possible Respecte la structure logique
Métadonnées Toujours : nom doc, section, page Source-tracking obligatoire
Tables Extraction spécifique (Camelot, Unstructured) Les tables PDF se massacrent au chunking naïf

Stack technique et coûts

Composant Option self-hosted Option SaaS Coût mensuel typique
Vector DB Qdrant, pgvector, Weaviate Pinecone, Qdrant Cloud 0 à 200 €
Embeddings BGE-large (HuggingFace) OpenAI text-embedding-3 5-30 € (corpus 100 k chunks)
LLM Llama 3.1, Mistral, Qwen GPT-4o, Claude, Mistral Large 80-400 € (500 req/jour)
Reranker (optionnel) BGE-reranker Cohere Rerank 0-80 €
Orchestration LangChain, LlamaIndex n/a 0 (open source)

Setup minimal viable pour une équipe GRC de 5 personnes : pgvector + OpenAI embeddings + Claude Sonnet/Mistral Large. Compter environ 250-400 €/mois pour un usage intensif, plus 3-5 jours-ingénieur de mise en place.

5 pièges à éviter

1. Pas de re-ranking

La similarité vectorielle seule est imprécise. Sur du référentiel normatif, 4 sur 5 fois le top-1 vectoriel n’est pas le meilleur chunk. Toujours rerank.

2. Pas de citations dans la réponse

Un RAG conformité sans citations sourcées n’a aucune valeur d’audit. Toujours imposer dans le prompt système : « cite la source pour chaque affirmation ».

3. Documents non versionnés

Si on indexe ISO 27001:2013 et ISO 27001:2022 dans le même index sans tag de version, le modèle mélange. Tagger chaque chunk avec version + date.

4. Évaluation absente

Sans jeu de test (50-200 questions avec réponses validées par expert), impossible de mesurer si une modification améliore ou dégrade. Construire le golden dataset dès le début.

5. Confondre RAG et fine-tuning

Le fine-tuning est nécessaire dans < 5 % des cas. Pour la conformité, RAG suffit presque toujours et est 100x moins cher à maintenir.

Métrique-clé : sur nos déploiements, un RAG conformité bien tuné atteint 85-92 % de précision factuelle sur un jeu de test de 150 questions. En dessous de 80 %, il ne faut pas le déployer en production.

Un RAG conformité bien fait remplace 60 à 80 % des recherches documentaires manuelles d’un consultant GRC. À 250 €/mois, c’est le ratio prix/utilité le plus élevé qu’on ait vu apparaître sur le marché GRC depuis 5 ans.

Démarrer

Prototype en 1 semaine avec LangChain + pgvector + OpenAI : 3 jours d’ingestion documentaire, 2 jours de prompting, 2 jours d’évaluation. Le pilote tient en 1500 lignes de code. Au-delà, c’est de l’industrialisation (RBAC, audit log, intégration SSO).