ooligo
claude-skill

Derive a negotiation playbook from executed agreements

Difficulty
avancé
Setup time
4-8 hours
For
legal-ops-manager · in-house-counsel
Legal Ops

Stack

Un skill Claude qui lit un dossier de contrats signés et en déduit le playbook de négociation que ces contrats soutiennent réellement : la position standard par clause avec l’arithmétique qui la fonde, l’éventail complet des points où vous concluez effectivement, la pire clause que vous ayez jamais signée, et un rapport de couverture qui nomme chaque champ que le corpus ne peut pas fournir. Le bundle se trouve dans apps/web/public/artifacts/playbook-from-precedent-claude-skill/ et contient SKILL.md plus trois fichiers de référence, dont l’un se remplit avant la première exécution.

Le skill est en lecture seule. Il propose des positions accompagnées de leurs preuves et n’en approuve aucune, parce qu’une position de playbook est une délégation de pouvoir de signature et appartient à une personne nommément désignée.

Le vide qu’il comble

Les playbooks s’écrivent de mémoire. Une personne expérimentée se rappelle où l’entreprise atterrit d’habitude, l’écrit dans un document Word, et ce document devient le standard — ce qui fonctionne jusqu’à son départ, ou jusqu’au moment où le souvenir se révèle décrire trois transactions de 2023. La correction évidente consiste à déduire le playbook des contrats, et cette correction évidente comporte un défaut facile à manquer et coûteux à publier.

Un dossier de contrats signés est un échantillon censuré. Il contient toutes les négociations qui se sont terminées par une signature et aucune de celles qui se sont terminées par un retrait. Cette propriété n’est pas un problème de qualité de données qu’on pourrait nettoyer ; c’est ce que le dossier est. Et elle frappe précisément le champ pour lequel un playbook existe. Le point de rupture est par définition la position qui ne produit aucun contrat signé, donc c’est la seule chose que le corpus est garanti de ne pas contenir. Tout outil qui lit des contrats signés et énonce une ligne rouge avec assurance l’a inventée.

Ce que le corpus soutient, en revanche, c’est la borne qui court dans l’autre sens. La clause la plus défavorable du dossier est une borne supérieure de votre tolérance démontrée : vous ne vous êtes pas retiré là, puisqu’il y a une signature dessus. La phase 5 l’émet sous worst_signed avec un identifiant de contrat et une date, et refuse d’émettre walk_away du tout. La phase 7 applique ensuite le test à l’envers — si quelqu’un affirme une ligne rouge à 12 mois d’honoraires alors que le corpus contient une indemnisation PI non plafonnée déjà signée, cette contradiction est signalée avec le contrat et la date. Cela compte commercialement, pas éditorialement : une contrepartie qui détient votre contrat antérieur peut le produire, et une ligne que vous avez déjà franchie n’est pas une ligne.

Quand l’utiliser

Quand un playbook est en cours de rédaction ou de réécriture et que ceux qui le rédigent travaillent de mémoire. Quand un playbook existant est audité face à la pratique et que la question porte sur l’endroit où le standard écrit et la réalité signée ont divergé. Quand le pouvoir de signature passe à une équipe métier et que les seuils d’escalade doivent résister à la contestation. Quand un déploiement CLM a besoin de positions initiales et que l’extraction de l’éditeur a produit des fréquences de clauses sans aucune segmentation derrière.

Quand NE PAS l’utiliser

  • Moins d’environ 25 contrats signés sur votre propre papier pour ce type d’accord. En dessous, l’arithmétique de la phase 4 ne peut pas séparer une position d’une coïncidence, et l’exécution renvoie un rapport de couverture presque vide. Lisez les contrats.
  • Vous avez besoin du point de rupture. Le corpus ne peut pas en produire un, pour la raison ci-dessus. Si c’est le livrable, ce n’est pas le bon outil.
  • Le corpus est majoritairement du papier de la contrepartie et personne ne peut étiqueter lequel est lequel. La phase 1 refuse plutôt que de produire une réponse plausible.
  • Vous voulez des positions approuvées, pas rédigées. La sortie est une proposition sourcée. Approuver est une décision juridique.
  • Personne ne remplira le manifeste. references/1-corpus-manifest.md est ce qui rend toute segmentation possible. Sans lui, l’exécution ne dispose que d’un seul tas indifférencié et rapporte une position mêlée issue de négociations sans rapport entre elles.

Ce que le skill fait réellement

Sept phases, ordre fixe, avec des refus durs dans deux d’entre elles.

La phase 1 rattache chaque contrat à sa ligne de manifeste et refuse si plus de 10 % du corpus n’a pas de paper_of_origin. Elle ne devine pas ce champ à partir du document. Ce refus existe parce que la défaillance caractéristique ici est silencieuse : une clause apparaît dans 78 % des contrats signés, est notée comme standard de l’entreprise, et résulte en réalité du fait que 78 % de ces contrats ont été signés sur le formulaire d’en face. Une fréquence mesurée sur du papier mélangé est une mesure des préférences de rédaction de vos contreparties, publiée sous votre nom.

Les phases 2 et 3 séparent l’extraction de la normalisation — d’abord la citation textuelle avec un renvoi de page, ensuite la valeur comparable dans une unité déclarée. Une passe unique confond « la clause dit X » et « X équivaut à Y dans nos unités », et une fois ces deux choses fusionnées, les erreurs de normalisation se cachent dans des citations que personne ne relit. Un emplacement de clause sans correspondance s’affiche comme absent, c’est-à-dire une valeur qui participe à la statistique, et non un échec d’analyse qu’on écarte.

La phase 4 est là où siège le seuil. Les cellules sont (clause, paper_of_origin, agreement_type, counterparty_tier), et la valeur modale est rapportée avec l’intervalle de score de Wilson sur sa proportion, pas avec le pourcentage brut. Un candidat obtient l’étiquette standard seulement quand la borne inférieure à 95 % dépasse 0,60. Cette règle est ce qui fait tenir les petits échantillons, et l’arithmétique mérite d’être vue : une clause présente dans 8 contrats sur 10 vaut 80 % au comptage et porte un intervalle à 95 % d’environ 49 % à 94 %, qui recouvre à la fois « la plupart du temps » et « à peine plus de la moitié » et ne peut donc pas être appelé standard. Ces mêmes 80 % à 20 sur 25 ont une borne inférieure proche de 61 % et passent. Environ 25 occurrences sur le même papier par clause constitue le plancher pratique ; les cellules plus courtes s’affichent en insufficient-evidence avec la taille d’échantillon qu’il leur faudrait, jamais comme une position atténuée.

La phase 6 conditionne l’échelle de repli à deux exigences — l’historique des redlines est fourni, et la distribution est réellement multimodale plutôt qu’un seul groupe avec du bruit. Le texte signé enregistre où vous avez atterri, pas ce que vous avez demandé au départ ; déduire une échelle fallback_1 / fallback_2 de PDF finaux affirme donc une intention que les preuves ne portent pas. Quand les exigences ne sont pas remplies, la sortie indique observed_range sous ce nom, et un champ obligatoire fallback_ladder_reason empêche que « nous n’avions pas d’historique de versions » devienne indiscernable de « il n’y a pas d’échelle ici ».

La phase 7 découpe chaque cellule sur une fenêtre de récence de 24 mois et rapporte les cellules divergentes comme deux positions datées plutôt que d’en faire la moyenne, parce qu’un plafond de responsabilité de 2022 moyenné avec un de 2026 ne décrit ni l’un ni l’autre. Le rapport s’écrit dans references/3-coverage-report-template.md, qui ouvre sur les lignes non déductibles et à preuves insuffisantes et place les positions déduites en dernier, puisque ce sont elles qui demandent le moins de relecture.

Coût et débit

La dépense de modèle n’est pas la contrainte. Un MSA de 15 pages tourne autour de 8 000 à 12 000 tokens — une estimation, pas un chiffre mesuré —, donc un corpus de 60 contrats se situe de l’ordre de 600 000 tokens d’entrée. Au tarif publié par Anthropic pour Claude Opus 5 de 5 USD par million de tokens d’entrée, cela fait environ 3 USD d’entrée plus la sortie d’extraction, ce qui maintient la passe complète sous les 10 USD.

Le coût humain est le chiffre qui compte. Remplir le manifeste prend 1 à 3 minutes par contrat si les métadonnées sont déjà dans un CLM, et 5 à 10 s’il faut ouvrir chaque fichier ; un corpus de 60 contrats représente donc une demi-journée d’ingestion avant la première exécution. Ajoutez environ 2 à 4 heures de relecture du rapport de couverture, principalement sur les sections contradiction et dérive. Le manifeste persiste, donc la deuxième exécution est un diff et coûte une fraction de la première. Une reprise trimestrielle est la cadence sur laquelle il vaut la peine de s’engager — l’enquête de DocJuris auprès d’environ 300 directions juridiques, publiée en octobre 2024, a constaté que même au stade le plus mature la défaillance récurrente est la propriété du sujet, la première version du playbook ne s’améliorant jamais.

Modes de défaillance

  • La confusion sur le papier d’origine. Une fréquence construite sur du papier mélangé se lit comme votre standard et constitue celui de vos contreparties. Garde-fou : la phase 1 refuse au-delà de 10 % de champs manquants, et paper_of_origin est une dimension de cellule plutôt qu’un filtre, de sorte qu’une position dérivée du papier de la contrepartie ne peut jamais fusionner silencieusement avec celle du papier propre.
  • Fausse confiance à petit n. Huit occurrences sur dix paraissent décisives et ne le sont pas. Garde-fou : l’étiquette standard exige une borne inférieure de Wilson à 95 % supérieure à 0,60, et les cellules qui échouent rapportent n_required au lieu d’une position nuancée.
  • Inventer le point de rupture. Le champ le plus précieux d’un playbook est celui que le corpus ne peut pas fournir, ce qui est exactement la pression qui en produit un fabriqué. Garde-fou : walk_away est un enum à valeur unique dans references/2-clause-position-schema.md — aucun chemin de code n’en déduit un.
  • Une ligne rouge que votre propre dossier a déjà franchie. Garde-fou : la phase 7 teste à l’envers tout point de rupture affirmé face à worst_signed et signale les contradictions avec l’identifiant et la date du contrat.
  • Le rapport de force lu comme une préférence. Les positions paraissent plus faibles sur le segment enterprise parce que c’est là que vous avez cédé, pas parce que le standard y serait différent. Garde-fou : counterparty_tier est une dimension de cellule, et quand les segments divergent de façon substantielle la position mêlée est supprimée et la suppression est nommée dans le rapport.
  • Tenir l’exactitude de l’extraction pour acquise. L’identification de clauses n’est pas un problème résolu — CUAD, le jeu de référence annoté par des experts comptant plus de 13 000 étiquettes sur 510 contrats commerciaux et 41 types de clauses, existe parce que la performance des modèles sur exactement cette tâche a une marge de progression. Garde-fou : chaque valeur normalisée conserve sa citation source et son renvoi de page, de sorte que la deuxième passe est auditable face à la première sans rouvrir le PDF.

vs les alternatives

vs DraftWise Playbook Studio. La réponse directe sur étagère, lancée le 25 février 2026, et l’affirmation de l’éditeur est qu’elle comprime la création d’un playbook de plus de six heures manuelles à cinq minutes en extrayant les positions de l’historique des transactions. Si vous êtes déjà sur DraftWise, utilisez-le — il est intégré à la rédaction, ce que ce bundle n’est pas. Ce que son matériel de lancement n’énonce pas, c’est une taille minimale de corpus, une exigence de segmentation, ou ce qu’il fait quand les preuves sont minces, et ces trois points constituent toute la substance du problème. Faites tourner ce skill sur le même corpus comme contrôle des positions, pas comme remplacement du produit.

vs Spellbook Benchmarks. Le travail State of Contracts 2026 de Spellbook publie plus de 270 repères de clauses sur 13 types de contrats, tirés de centaines de milliers de contrats dans 30 pays, sur un modèle de données donnant-donnant. Cela répond à une autre question — où se situe le marché — et c’est le meilleur instrument pour démontrer que la demande d’une contrepartie sort du marché. Il ne peut pas vous dire où vous vous situez, et l’écart entre les deux est souvent le constat le plus utile disponible. Utilisez les deux ; n’en substituez pas un à l’autre.

vs la bibliothèque de clauses de votre CLM. Ironclad comme Juro font remonter les fréquences de clauses de votre référentiel, et si vous avez déjà le référentiel c’est le point de départ le moins cher. Ce qu’ils ne donnent généralement pas, c’est la segmentation par papier d’origine, la borne de confiance qui sépare une position d’une coïncidence, et le refus explicite d’énoncer un point de rupture. Ces trois choses sont ce que ce bundle ajoute par-dessus.

vs l’écrire de mémoire dans un document Word. La comparaison honnête, puisque c’est ce que font la plupart des équipes, et cela convient à dix contrats qu’une seule personne a tous lus. Au-delà, la défaillance n’est pas que la mémoire se trompe, mais que rien ne distingue les positions bien étayées de celles qui sont remémorées, si bien que le document entier porte la même autorité. La valeur du rapport de couverture tient à ce qu’il se note lui-même.

Voir aussi : clause-extraction-claude-skill pour la couche d’extraction sur laquelle ceci s’appuie, clause-library-design pour structurer la bibliothèque où les positions atterrissent, et contract-redline-claude-skill pour appliquer le playbook une fois qu’il existe.

Files in this artifact

Download all (.zip)