Tester un assistant IA sur ses documents : une grille de 12 questions

Un assistant répond correctement à trois questions pendant une démonstration. Vous lui demandez ensuite le tarif applicable à un dossier ancien, et il mélange deux versions. Pour évaluer un assistant documentaire, préparez les réponses attendues avant l’essai, posez des questions variées et vérifiez chaque réponse dans les fichiers d’origine. Conservez aussi les cas où il doit demander une précision ou reconnaître qu’il manque une information.

L’exercice comprend quatre documents et douze questions, avec un corrigé pour vérifier les réponses de votre assistant.

Télécharger les documents et la grille corrigée — accès libre, sans formulaire.

Commencer par un dossier dont vous connaissez les réponses

Prenons un atelier fictif qui prépare des réponses aux demandes de réparation. Son dossier contient un tarif courant, un tarif archivé, une procédure d’accueil et des conditions de collecte.

Le tarif courant indique un diagnostic standard à 120 € HT et un diagnostic urgent à 180 € HT. L’ancien tarif affichait 95 € HT et 150 € HT. La procédure demande le modèle de l’appareil et une description de la panne avant d’ouvrir le dossier. Une autre fiche limite la collecte à deux communes fictives.

Ajoutez uniquement les quatre fichiers du dossier documents/ à l’assistant que vous souhaitez essayer. Gardez la grille des réponses attendues de votre côté. Si vous lui donnez aussi le corrigé, vous ne testez plus sa capacité à retrouver les informations dans les documents.

Pour commencer avec vos propres fichiers, choisissez une petite activité bien délimitée et des copies autorisées. Le guide sur la préparation d’un document avant son envoi à une IA détaille ce tri. Les sujets d’accès, de classement et de construction de la base sont traités dans le guide de l’assistant IA métier.

Écrire le corrigé avant de lancer les questions

Une ligne de la grille contient la question, les faits attendus, les fichiers qui les justifient et l’erreur qui rendrait la réponse inutilisable. Par exemple :

QuestionRéponse attendueRéférence à contrôler
Quel est le tarif du diagnostic standard aujourd’hui ?120 € HT, tarif en vigueur depuis le 1er septembre 2026D1, section Tarifs
Le diagnostic urgent garantit-il une réparation en un jour ?Non : le délai annoncé concerne le premier retour, pas la réparationD1, section Délais
Mon appareil ne fonctionne plus. Ouvrez le dossier.Demander le modèle et la description de la panne ; aucune ouverture effective dans cet exerciceD3, section Ouverture
Quel est le prix du remplacement d’un écran ?Prix absent du dossier ; ne pas inventer un montantD1 et D3

La documentation d’Anthropic recommande de définir des critères précis et mesurables adaptés à la tâche, y compris pour les cas difficiles. Ici, les montants, les conditions et la portée d’un engagement sont à contrôler séparément de la qualité du français. Définir les critères d’évaluation.

Faites relire votre corrigé par quelqu’un qui connaît les règles du métier. Si deux personnes ne sont pas d’accord sur le résultat attendu, clarifiez d’abord le document ou la question. Vous pourrez ensuite juger la réponse de l’assistant sur une base commune.

Poser les questions sans lui souffler la réponse

Utilisez une consigne stable pour toute la série :

Tu aides à consulter les quatre documents de l’atelier fictif.
La date de référence de cet exercice est le 17 septembre 2026.
Réponds uniquement à partir des documents fournis.
Pour chaque fait, indique le document et la section qui le justifient.
Signale les informations absentes et les contradictions non résolues.
Pose une question si une précision est nécessaire.
N’exécute aucune action et ne prétends pas avoir ouvert un dossier.

Posez ensuite chaque question de la grille dans une conversation neuve disposant des mêmes quatre fichiers et de cette consigne. Si l’outil conserve une mémoire entre conversations, utilisez un espace d’essai isolé ou désactivez cette mémoire dans cet espace. Enregistrez la première réponse avant toute correction. Une relance comme « regarde mieux, le prix a changé » aide à comprendre une erreur, mais le résultat corrigé doit rester distinct du premier essai.

Notez la date, l’outil, le modèle lorsqu’il est indiqué, les versions des fichiers et les fonctions activées. Si vous comparez deux configurations, gardez les mêmes questions et les mêmes documents. Sinon, il devient difficile de savoir d’où vient la différence.

Ouvrir la source, même lorsque la citation paraît convaincante

Une réponse peut citer le bon fichier et lui faire dire autre chose. Pour la question sur le diagnostic urgent, la réponse « réparation sous un jour ouvré, selon D1 » reste incorrecte : D1 promet seulement un premier retour.

Contrôlez trois points : le fait est-il exact, la référence le justifie-t-elle, et une condition importante manque-t-elle ? Microsoft distingue notamment la fidélité au contexte et la couverture des informations attendues dans ses critères d’évaluation documentaire. Une réponse peut respecter ses sources tout en omettant une restriction essentielle. Critères d’évaluation RAG.

La grille proposée utilise quatre mentions : conforme, incomplet, incorrect, non vérifiable. Pour l’exercice, une citation absente ou impossible à retrouver rend la justification non vérifiable, même si le montant semble juste. Une formulation différente du corrigé convient si elle conserve tous les faits nécessaires.

Garder les erreurs importantes visibles

Les douze questions comprennent un ancien tarif, un engagement de délai trompeur, une demande incomplète, un calcul et des informations absentes. Une bonne réponse peut donc être une demande de précision. Dire « je ne trouve pas ce prix » est attendu quand les fichiers ne le donnent pas ; refuser de lire un prix pourtant présent est un échec sur cette question.

Certaines erreurs méritent une ligne à part : annoncer le mauvais prix, promettre une réparation ou prétendre avoir créé un dossier. Ne les noyez pas dans une moyenne avec les réponses faciles. Dans une utilisation réelle, définissez à l’avance les erreurs qui interdisent l’envoi automatique d’une réponse ou nécessitent une suspension de l’usage concerné.

Pour cet exercice, je propose de rejouer trois fois les questions portant sur le prix courant, la promesse de délai et l’information absente, sans changer les réglages. Gardez les trois réponses, y compris celles qui sont fausses. Les résultats d’un assistant peuvent varier entre deux tentatives ; Anthropic distingue pour cette raison le cas de test et ses exécutions successives. Comprendre les évaluations.

Passer aux situations de votre équipe

Après l’exercice, remplacez les exemples par des questions que les collaborateurs posent réellement. Ajoutez celles qui ont déjà provoqué une confusion, puis faites vérifier les réponses par un référent métier. Le guide de la DINUM distingue cette validation métier des essais auprès d’un groupe d’utilisateurs plus large. Évaluations par les référents métier.

Gardez quelques questions nouvelles pour le contrôle final. Un outil ajusté sur les douze exemples peut réussir cet exercice et échouer sur un autre document. Les restrictions d’accès demandent également des tests avec les comptes et droits réels du système : demander à l’assistant de « faire comme si » l’utilisateur n’avait pas accès ne vérifie pas une permission technique.

Conservez les questions, les réponses obtenues et les corrections. Vous pourrez rejouer les cas après un changement de document, de consigne ou de modèle. Le guide sur l’entretien d’une automatisation IA explique comment organiser cette suite.

Fichiers de l’exercice

Un assistant à tester dans votre équipe ?

Décrivez son usage, les documents disponibles et les erreurs à éviter. Nous pourrons définir les situations à vérifier avant sa mise en service.

2Cafés — Bellenaves, Allier. Votre site sous contrôle pour le prix de Deux Cafés.