RessourcesRessources

Glossaire

Ces mots reviennent dans tous les appels doffres et dans aucune formation. Les définitions disent ce quils signifient dans la profession, pas ce que notre produit en fait.

GED

Aussi appelé : Gestion électronique de documents, ECM

Ensemble des moyens d’acquérir, classer, conserver, retrouver et diffuser les documents d’une organisation. Le sigle anglais ECM — enterprise content management — désigne le même périmètre, souvent élargi aux processus.

Capture

Aussi appelé : Ingestion, Acquisition

L’entrée d’un document dans le système, quel que soit son canal : numérisation, courriel, dépôt, connecteur cloud, interface de programmation.

OCR

Aussi appelé : Reconnaissance optique de caractères

Transformation de l’image d’une page en texte lisible par une machine. L’ICR en est la variante appliquée à l’écriture manuscrite, encore la plus difficile.

Chez Estrelya : Nous n’appelons un moteur d’OCR que lorsque la page ne porte pas déjà son texte, et un moteur payant que lorsque le moteur ouvert n’a pas suffi.

IDP

Aussi appelé : Intelligent document processing, Traitement documentaire intelligent

Catégorie de logiciels qui lisent, classent et extraient des données de documents peu ou pas structurés. Le premier classement d’analyste consacré à cette catégorie date de septembre 2025.

Extraction

Le fait de tirer d’un document des champs nommés — montant, date, numéro de SIRET, IBAN — plutôt que du texte au fil de la page.

STP

Aussi appelé : Straight-through processing, Traitement direct

Part des documents traités de bout en bout sans intervention humaine. C’est l’indicateur que le secteur met en avant — et celui qu’il faut regarder par catégorie, jamais en moyenne : une moyenne noie précisément la catégorie qui échoue.

Seuil de confiance

Valeur au-delà de laquelle un classement ou une extraction est appliqué sans validation humaine. Un seuil unique pour toutes les catégories est mal placé pour la plupart d’entre elles.

Chez Estrelya : Le seuil est réglable par organisation et par catégorie documentaire. Aucun des dix éditeurs comparés en 2026 ne publie ce double réglage.

Calibration

Le fait qu’un score de confiance dise la vérité : un modèle qui annonce 90 % doit se tromper une fois sur dix, pas trois. C’est le chantier le moins mûr du marché — aucune plateforme consultée n’expose de score calibré.

Plan de classement

Aussi appelé : Taxonomie, Arborescence documentaire

L’organisation des dossiers et des types de documents d’une organisation. Il porte, ou devrait porter, les règles qui s’appliquent à ce qu’on y range.

Rétention héritée

Le fait qu’une pièce prenne la durée de conservation du dossier où elle se range, plutôt que de la porter individuellement. C’est ce qui permet à une règle qui change — un délai fiscal qui passe de six à dix ans — de s’appliquer sans reprendre les pièces une à une.

Valeur probante

Aussi appelé : Archivage probant, Coffre-fort numérique

Qualité d’un document conservé de façon à pouvoir être produit devant un tiers avec la démonstration qu’il n’a pas été modifié. Elle repose sur l’horodatage, l’intégrité vérifiable et la traçabilité, pas sur le seul stockage.

NF Z42-013

Aussi appelé : NF 461

Norme française décrivant les mesures techniques et organisationnelles d’un système d’archivage électronique. La certification NF 461 atteste qu’un système s’y conforme ; elle s’obtient après un audit AFNOR de plus d’un an.

WORM

Aussi appelé : Write once, read many, Verrou de stockage

Mode de stockage où un objet écrit ne peut plus être modifié ni supprimé avant un terme fixé, y compris par l’administrateur du compte.

Horodatage

Aussi appelé : RFC 3161

Jeton délivré par un tiers, attestant qu’une empreinte de document existait à une date donnée. C’est le jeton qui fait foi, pas l’heure du serveur qui l’a demandé.

Empreinte

Aussi appelé : Hachage, SHA-256

Somme de contrôle calculée sur un fichier, qui change entièrement si un seul octet change. Elle sert à prouver qu’un document est bien celui qu’on a conservé.

Empreinte perceptuelle

Aussi appelé : pHash

Somme de contrôle calculée sur ce qu’une image montre plutôt que sur ses octets. Deux versions d’une même photo, recadrée ou recompressée, ont des empreintes SHA-256 différentes mais des empreintes perceptuelles proches.

RAG

Aussi appelé : Génération augmentée par la recherche

Technique consistant à retrouver des passages pertinents dans un corpus, puis à les fournir à un modèle de langage pour qu’il réponde à partir d’eux plutôt que de sa mémoire.

Recherche hybride

Aussi appelé : RRF, Fusion de rangs réciproques

Combinaison d’une recherche par mots exacts et d’une recherche par similarité de sens, dont les deux listes de résultats sont fusionnées. Chacune rattrape ce que l’autre rate.

Vecteur

Aussi appelé : Embedding, Plongement

Représentation numérique d’un texte, telle que deux textes de sens proche ont des vecteurs proches. Deux vecteurs produits par des modèles différents ne se comparent pas : changer de modèle impose de tout réindexer.

Reranker

Second modèle qui réordonne les résultats d’une recherche en jugeant chaque candidat face à la question. C’est le levier de qualité le mieux documenté sur un moteur hybride déjà en place.

MCP

Aussi appelé : Model Context Protocol

Protocole par lequel un référentiel expose ses outils — recherche, lecture — aux agents d’intelligence artificielle. Il s’installe depuis 2025 comme l’interface standard d’accès à un fonds documentaire.

Point d’arrêt humain

Aussi appelé : Human in the loop, HITL

Étape où une personne confirme avant qu’une action s’applique. Réservé aux actions qui changent quelque chose : généralisé à tout, il devient un clic machinal qui ne protège plus rien.

Multi-tenant

Aussi appelé : Multi-locataire, Cloisonnement

Architecture où plusieurs organisations partagent la même installation sans jamais voir les données les unes des autres. La solidité du cloisonnement dépend de l’endroit où il est appliqué : dans le moteur de base de données, il résiste à une erreur de programmation ; dans le code applicatif, non.

RLS

Aussi appelé : Row level security, Sécurité au niveau de la ligne

Mécanisme du moteur de base de données qui filtre les lignes visibles selon l’identité de l’appelant, quelle que soit la requête écrite au-dessus.

Sur-partage

Aussi appelé : Oversharing

Situation où des documents sont accessibles à plus de personnes que prévu, souvent sans que personne le sache. Un moteur de recherche par le sens la rend visible d’un coup, en remontant à chacun ce qu’il pouvait techniquement ouvrir sans jamais l’avoir trouvé.

Idempotence

Propriété d’une opération qu’on peut rejouer sans qu’elle produise deux fois son effet. Sur un dépôt de document, c’est ce qui évite qu’un appel réseau réessayé crée un doublon.

Page séparatrice

Feuille glissée entre deux pièces dans un chargeur de scanner, que le logiciel reconnaît pour couper la liasse, et qui ne devient jamais un document.

Voir les questions fréquentes