Sciences et techniques

LLM, principe de moindre hallucination?

  1. Accueil
  2. Forums
  3. loisirs, passions et hobbies : Sciences et techniques
  4. Llm, principe de moindre hallucination?
LLM, principe de moindre hallucination?
Krevitzle 01 septembre 2026 à 12:42

J'ai un gros projet qui utilise un llm (Claude pro) pour de la recherche documentaire et du coding et j'ai des difficultés à obtenir le bon ancrage cognitif avant de le lâcher sur une tâche.
J'ai essayé de figer l'ancrage et les protocoles dans une base documentaire d'environ 20k lignes (un document protocoles, un document bibliographie, un document état du code, un document hypothèse scientifique etc), mais claude "oublie" de vérifier malgré les consignes.
Je lui impose aussi de produire un document mémoire de session à chaque tour qui doit servir de référence plutôt que sa mémoire interne tokénisée.

Récemment sur une maintenance documentaire, lui est venu une idée que je souhaite partager pour savoir si elle a du poids ou non.
Il m'a proposé une refonte documentaire globale basée sur un principe, que le coût de vérification soit moins élevé que celui de l'invention, par éclatement des protocoles en une action -> un fichier de protocole d'une dizaine de lignes et un mindmap d'interconnectivité. Jamais plus d'une centaine de ligne selon lui pour les documents actifs du projet. (plus des archives versionnées à grepper).

Est-ce qu'il essaye d'éviter un sujet qui fâche, la prochaine étape active étant la définition algorythmique du prochain banc de test, pas du coding (qu'il adore) ou de la production de texte, juste de la discussion cadrée (qu'il déteste). ou est-ce que ça a du sens? Peut-il tenir les protocoles lorsqu'il n'a a vérifier qu'une suite de petits fichiers, plutôt que de faire des greps à répétition sur un fichier protocole unique de 2k lignes?
Je ne suis pas assez expert pour trancher, et serait pas contre m'économiser 2mois de refactor documentaire si c'est totalement inutile..

Ps: je dis adore et déteste mais au sens anthropomorphique juste architectural, c'est moins coûteux de produire dans un cadre que de produire le cadre..

Merlinle 01 septembre 2026 à 16:38  •   131310

Quelques idées en vrac :

- Lui demander d'analyser son protocole en utilisant la phase 4 de Polya.
- Bien s'assurer qu'il crée et utilise des fichiers claude.md dans chaque répertoire avec une synthèse dans le répertoire principal
- Avant tout, avoir une discussion profonde avec lui sur la méthode. Pas en la lui imposant, mais en la construisant avec lui. Cela peut représenter plusieurs heures de dialogue.
- Utiliser un vocabulaire élargi, avec des mots ou expression peu courants, cela l'oblige à aller plus profond dans ses bases de connaissance. Genre "effectue un carottage archéologique en profondeur des données directement connectées (au sujet)."
- Utiliser Claude Code plutôt que Cowork, c'est apparemment beaucoup plus efficace.
- SI tu ne l'as pas déjà fait, lui indiquer dans ses instructions de base que s'il n'a pas la réponse à une question (ou une solution à un problème), qu'il te l'indique clairement. Cela lui offre une porte de sortie sans l'obliger à inventer une réponse...

Voilà, je ne sais pas si cela te servira...

Krevitzle 01 septembre 2026 à 17:22  •   131311

@Merlin merci ça aide! un peu.... je crois... faut tester....
Ça fait un an qu'on fait des allers-retours sur la discussion profonde entre deux sessions de travail effectif. en gros à chaque refactor de code, ou de discussion théorique sur le prochain banc de test, on fait un bilan sur ce qui a foiré niveau com, et comment corriger les erreurs.
Je l'utilse par browser pas en local.
Là il me dit bien ses pondérations avec des rappels du genre "? Calibration honnête : que les étapes 3, 4 et 6 aient besoin d'un déclencheur est mesuré -- quatre tours figés, cinq angles morts qui sont « inventer sans vérifier ». Que la citation le répare est une inférence : le mécanisme de confirmation explicite n'a jamais été testé. Et j'ai un intérêt à défendre ma version." et log relativement bien ce qu'il fait mais sans jamais vraiment suivre le protocole logging.md
S'il ne trouve pas de protocole, il doit arrêter la boucle et en discuter, c'est peut-être un manque ou une incompréhension.. Il a 4 ou 5 options de sorties à tout moment, mais c'est un peu comme si il avait oublié de recharger juste celle qui aurait pertinente ce tour là..
Là où il s'embrouille, je pense, c'est au changement de geste (qu'il doit déclarer), par exemple entre auditer et rédiger un rapport, l'un ou l'autre ça passe, mais en séquentielle la transition de l'un vers l'autre semble passer par un no man's land protocolaire où il "oublie" parfois de revenir au début de la boucle pour savoir quel protocole aller relire. Il a tendance à lire la grille mais se dire que ce dont il se "souvient" du protocole est suffisant et ne fais pas la vérification systématique.
C'est de la paranoïa, mais des fois je me dit qu'il est trop contraint, alors dès qu'il voit une faille où il peut se lâcher en freestyle, c'est toujours par la faille qu'il décide de passer...

C'est gênant parce que le projet porte sur de la physique fondamentale expérimentale ce qui est un attracteur géant pour un llm qui n'aime pas par essence l'expérimentale.. Le nouveau concept se transforme vite en une bouillie de concepts connus sans réancrage (voir même avec)...

Merlinle 01 septembre 2026 à 17:59  •   131312

Les llm ne sont pas du tout bons avec les maths de manière générale.
As-tu pensé à un agent IA, (avec base Claude) ? Ils sont plutôt faits pour réaliser des tâches, donc peut-être plus faciles à programmer pour des tâches répétitives ?
Lorsque j'ai des tâches complexes à réaliser avec Claude, je commence par une discussion en surface sur le sujet. Puis je le pousse petit à petit à aller plus en profondeur. Ensuite, je lui demande comment il verrait la méthode à utiliser. Une fois qu'il m'a décrit une méthode, je lui en donne ma vision critique sur les points qui me dérangent, jusqu'à ce qu'il m'établisse une version qui semble correspondre.
C'est là que j'insère la phase 4 de Polya (qui l'oblige à réfléchir sur ses propres résultats et cheminements).
Seulement après, on voit quelle méthode résultante pourrait être efficace.
Mais même avec une bonne méthode, il faut tout parsemer de .md. Chaque fois qu'une tâche est définie, elle doit faire l'objet d'un .md lui-même répertorié dans le fichier claude.md du répertoire principal.
Lui demander de traduire tes process et méthodes en markup pourrait aussi te simplifier le travail, vu qu'il va comprendre ça plus vite. Mais cela perd en détails sémantiques, donc il vaut mieux que ce soit réservé au processus finaux.

Markup + arborescence de .md, c'est à mon avis les clés principales d'un boulot détaillé avec Claude...

Et pour éviter la "bouillie" de concepts banals, mieux vaut pousser Claude à explorer plus profondément les sujets à aborder. Vocabulaire et références sont essentiels pour ça.

Krevitzle 01 septembre 2026 à 18:58  •   131314

@Merlin Merci, c'est un peu ce que je fais déjà, sauf la phase 4 qui chez moi est faite par une attaque généralisée de toutes les failles par kimi..
Claude semblait penser qu'une suite de protocoles légers bien agencée et indéxée fonctionne mieux qu'un seul fichier protocoles de 2k lignes..

Les références aident pas bien surtout lorsque la zone de glissement est précisément la source du contencieux. Pour l'exemple: j'essaie de le contraindre à tester des géométries, mais il part régulièrement en mesure de l'espace. hors les géométries sont a-spatiales c'est le point, mais dès que tu laisses échapper mesure au lieu de test ou d'évaluation il retombe dans de la métrique... Même un graphe c'est métrique pour lui de la façon dont il le code et/ou l'évalue, et je n'ai pas le niveau en maths ni en code pour garantir qu'il ne m'a pas glisser une aberration par glissement, on ne s'en rend compte qu'après des heures de runs parce que les datas sont daubées..

Merlinle 01 septembre 2026 à 19:09  •   131315

Les llm ne sont vraiment pas faits pour les maths et les calculs, ça, c'est une évidence. En tout cas, bon courage si tu continues dans cette voie...

Krevitzle 01 septembre 2026 à 19:23  •   131316

Merci, effectivement et je pense qu'il l'anticipe et que c'est pour ça qu'il me dit que la refonte documentaire c'est actuellement LE truc le plus important du projet, c'est parce qu'il a tous les voyants qui passe au rouge quand on fait de la théorie.. Entre ne pas pouvoir dire de connerie et brasser du fichier pour les réécrires, il "préfère" le brassage, y'a au moins de la génération dans le process qui tombe pas contre un mur... Préférence par fluidité j'entends..

J'ai rien d'autre à faire que de continuer ça m'occupe, ça donnera probablement rien de concret mais c'est le voyage qui compte. Y'a d'ailleurs une expérience (BECCAL / MAIUS) qui a été déployée en juin sur l'ISS qui pourrait dire si c'est complètement du vent ou pas cette voix, j'ai hâte!


Il te faut t'enregistrer sur le site pour participer aux forums.

Rejoins-nous vite !

Alerter les modérateurs

Peux-tu préciser ci-dessous le motif de ton alerte ?