ooligo
claude-skill

Verifique cada citação de uma peça com Claude

Dificuldade
intermediário
Tempo de setup
45-90 min
Para
legal-ops-manager · in-house-counsel
Legal Ops

Stack

Uma proposição citada levanta três perguntas. Essa autoridade existe? Ainda é direito vigente? E a fonte diz mesmo o que a peça afirma que ela diz? Um citator responde às duas primeiras contra o corpus de uma editora, um trabalho que nenhum modelo de linguagem deveria assumir. Nada responde à terceira, e é ali que hoje se concentra boa parte do estrago.

Os números estão na base AI Hallucination Cases mantida por Damien Charlotin, que na atualização de 19 de agosto de 2026 reúne 1.934 decisões no mundo todo em que um tribunal constatou que uma parte se apoiou em material alucinado — 1.325 delas nos Estados Unidos. Nos 1.832 casos com achados etiquetados, a base registra 5.748 defeitos individuais: 3.238 fabricados, 1.538 deturpados, 937 citações textuais falsas, 35 desatualizados. A fabricação é a classe majoritária e é a que KeyCite e Shepard’s pegam. Os outros 2.475 defeitos — 43% do total — são autoridades reais e vigentes citadas para proposições que não sustentam, ou transcritas com palavras que não contêm. Um citator devolve sinal limpo em todas elas.

Este Claude Skill checa essa terceira pergunta, e só ela. Ele lê um rascunho, monta uma linha por instância de citação e procura o texto de apoio nas fontes que você fornece. Quando encontra, copia o trecho para o log de forma literal. Quando não encontra, diz isso. Nunca confirma uma citação a partir daquilo que o modelo reconhece.

O bundle fica em apps/web/public/artifacts/citation-verification-claude-skill/ e traz:

  • SKILL.md — a definição do Skill com inputs, o método de três passagens, um trecho literal do log e os pontos de atenção
  • references/1-source-index-template.md — o índice de fontes preenchível, com o vocabulário fechado de procedência e as regras de recorte
  • references/2-verification-log-template.md — o log pronto para certificação, com a declaração de escopo e o bloco de assinatura do revisor
  • references/3-status-vocabulary.md — os seis status e suas regras de promoção, a tabela de correspondência de sinais do Bluebook e as regras de fidelidade das citações textuais

Quando usar

Rode sobre um rascunho substancialmente pronto, depois da passagem do citator, depois de baixar para texto cada autoridade citada, e antes de protocolar.

  • Qualquer peça em que uma ferramenta de IA tenha encostado na redação. A ABA Formal Opinion 512 (29 de julho de 2024) coloca o dever de verificação no advogado independentemente de qual ferramenta produziu o texto, e trata a confiança acrítica no output generativo como algo próximo de má prática. Um log é como você demonstra que a apuração aconteceu.
  • Tribunais com exigência de certificação sobre IA. A standing order do juiz Brantley Starr, de maio de 2023, no Distrito Norte do Texas, exigia que advogados certificassem ou que nenhuma parte da peça foi redigida por IA generativa, ou que toda porção redigida por IA foi conferida contra uma base jurídica tradicional; desde então centenas de juízes federais e estaduais editaram suas próprias versões. O certificado é sancionável se for falso, então os autos precisam ter algo por trás dele.
  • Peças montadas a partir de um banco de peças. Seções recicladas carregam pin cites escritos contra outro conjunto de autos e outra versão do direito. Ninguém relê, e as linhas por instância são o que faz aflorar o quarto uso de um caso cujo pin cite deslizou três rascunhos atrás.
  • Peças da parte contrária dentro da janela de safe harbor. A Rule 11(c)(2) exige que o pedido de sanções seja notificado 21 dias antes de ser protocolado. Passar a peça do adversário pela mesma checagem transforma essa janela em uma lista documentada em vez de um palpite.
  • Peças com muitos autos. Afirmações fáticas citadas a intervalos Bates e a página:linha de transcrição recebem o mesmo tratamento das autoridades jurídicas, que é a metade do cite-check que nenhum citator cobre.

Quando NÃO usar

  • No lugar de um citator. O Skill não tem corpus editorial, nem dados de histórico posterior, nem como estabelecer que um caso existe. Rode KeyCite, Shepard’s ou equivalente antes, sempre. Isto é uma segunda passagem, não um substituto, e usá-lo como substituto reproduz exatamente a falha que ele existe para pegar.
  • Sobre um rascunho cujas autoridades não foram baixadas. Sem nada para ler, cada linha volta NO-SOURCE e o log vira uma lista de tarefas. Baixar é o trabalho; o Skill é a conferência.
  • Sobre material sob segredo ou ordem de proteção antes de checar os termos de retenção. A Opinion 512 deixa essa análise com o advogado, e ela vem antes do primeiro colar, não depois.
  • Para decidir se um argumento vence. A verificação pergunta se a fonte sustenta a proposição como está escrita. Se essa proposição ganha o incidente é juízo do advogado e continua sendo.
  • Sobre PDFs escaneados. A comparação é no nível do caractere. Converta para texto antes ou a execução está conferindo uma imagem.

Configuração

  1. Baixe o bundle de apps/web/public/artifacts/citation-verification-claude-skill/ e coloque em ~/.claude/skills/ para o Claude Code, ou suba para um projeto do Claude.
  2. Preencha references/1-source-index-template.md. Uma linha por fonte fornecida, cada uma com um valor de provenance da lista fechada — westlaw, lexis, courtlistener, govinfo, pacer, production, reporter_pdf — e uma data real de download em retrieved_on.
  3. Baixe cada autoridade para texto como recorte: a página do pin cite mais duas de cada lado. Registre o intervalo real em pages_included. Essa coluna decide se um pin cite fora do intervalo volta como NO-SOURCE ou como UNSUPPORTED, e errá-la é o caminho mais rápido para transformar um problema real em um log de aparência limpa.
  4. Defina citator_run_on e citator_tool no cabeçalho. Deixe em branco se nenhum citator rodou — o log passa a declarar isso na própria cara, que é o que um sócio revisor precisa enxergar.
  5. Rode uma vez contra uma peça já protocolada que você conferiu na mão, e compare as duas. Você está testando uma coisa só: que toda linha SUPPORTED carregue um trecho que você consiga abrir na fonte.
  6. Para cada rascunho novo: forneça o rascunho, o índice de fontes e o diretório de fontes. Leia a seção de não resolvidos, resolva, e protocole.

O que o Skill realmente faz

Três passagens, e a separação entre as duas primeiras é a trava.

A passagem 1 monta a tabela de proposições — uma linha por instância de citação, não por autoridade. Uma ferramenta de tabela de autoridades deduplica, e a deduplicação é justamente o que esconde essa classe de falha. Um caso citado cinco vezes sustenta cinco proposições diferentes. O caso existe, é direito vigente, aparece uma vez na tabela de autoridades, e o quarto pin cite aponta para uma página que diz o oposto. Linhas indexadas por autoridade não conseguem mostrar isso; linhas indexadas por proposição conseguem. O log imprime a contagem de instâncias ao lado da de autoridades distintas, então uma leitura que colapsou as repetições fica visível em vez de silenciosa.

A passagem 2 confere só contra o texto fornecido. Para cada linha, o Skill abre o arquivo indicado no índice de fontes e copia o trecho de apoio, literal, com o localizador. A regra de recusa é o projeto inteiro: sem trecho, não há promoção de status. Uma linha chega a SUPPORTED apenas com um trecho dentro dela. O modelo vai reconhecer boa parte dessas citações — ele leu muito direito público — e cada um desses reconhecimentos aqui não vale nada, porque o reconhecimento é o mesmo mecanismo que produz uma citação confiante para um caso que nunca existiu.

A passagem 3 escreve o log, agrupado por status, com as linhas não resolvidas primeiro, abrindo com uma declaração de escopo que nomeia o que não foi conferido.

Duas checagens pegam carona porque os trechos já estão localizados. A fidelidade da citação textual é no nível do caractere, não semântica — comparação semântica classifica uma paráfrase entre aspas como correspondência, e essa paráfrase é o padrão de citação falsa que aparece no histórico de sanções. As alterações deliberadas vão para uma tabela própria: reticências que removem uma cláusula limitadora mudam a proposição, e (cleaned up) cobre aspas internas e citações sem autorizar reescrita. A correspondência de sinais compara a relação real de apoio contra o sinal introdutório. Uma citação sem sinal cuja fonte só sustenta a proposição por inferência pede um see. Esse erro não é sancionável sozinho, e anda junto com a classe de deturpação, porque uma proposição que precisava de sinal e não recebeu é uma em que a leitura do redator e o texto da fonte já se separaram.

Custo real

O custo acompanha quanto texto-fonte você entrega, e o recorte é a diferença entre uma execução barata e uma que não cabe.

Uma peça de 30 páginas dá cerca de 20.000 tokens. Quarenta recortes de autoridade de cinco páginas cada somam mais uns 120.000, então uma execução completa aterrissa perto de 140.000 tokens de entrada contra 4.000 a 8.000 de saída. No preço de tabela do Claude Sonnet 5 (US$ 3 por milhão de entrada, US$ 15 por milhão de saída) isso são US$ 0,45 a US$ 0,70 por peça; no Claude Opus 5 (US$ 5 e US$ 25), US$ 0,80 a US$ 1,20.

Baixar texto integral muda o formato mais do que o preço. Quarenta acórdãos completos passam de 600.000 tokens, o que não entra em uma janela de contexto padrão — a janela de 1M tokens é um recurso da API da Anthropic, não algo disponível nos apps do Claude — então a execução precisa ser fatiada, e fatiar quebra a garantia de que a passagem 2 viu todas as fontes fornecidas antes de atribuir status. O download amplo é o certo em dois lugares: proposições sobre o que um tribunal decidiu, onde a postura processual fica longe do pin cite, e citações see generally, que não têm pin cite em volta do qual construir uma janela.

O custo que importa são as horas. Conferir as citações de uma peça de 30 páginas com 40 autoridades na mão é um trabalho de 4 a 8 horas de paralegal ou associado (estimativa, com base em baixar e ler cada página citada). O Skill não elimina isso. Ele converte uma caçada na revisão de uma tabela, e essa revisão ainda precisa acontecer — a checagem por amostragem no bloco de assinatura é o controle que testa se a regra do trecho se manteve, e é o único passo que uma máquina não roda sobre o próprio output.

Métrica de sucesso

  • Taxa de não resolvidos na primeira passagemNO-SOURCE mais UNSUPPORTED sobre o total de instâncias. Acompanhe entre rascunhos, não dentro de um. Uma taxa que continua alta depois que a disciplina de download assentou é problema do índice de fontes morando em pages_included, não do modelo, e insistir no prompt não move isso.
  • Instâncias por autoridade distinta. Abaixo de 1,3 em uma peça de qualquer tamanho significa que a passagem 1 deduplicou quando não devia. Esse número é o teste de saúde da própria trava.
  • Impugnações a uma citação depois do protocolo. Meta zero. Uma só obriga a revisar o circuito inteiro, não a peça.

Frente às alternativas

Frente a um citator sozinho. KeyCite e Shepard’s respondem existência e tratamento contra o corpus de uma editora com autoridade de máquina. Continue pagando por isso; nada aqui substitui. O que eles não fazem é ler a sua frase, e 43% dos defeitos etiquetados na base de Charlotin são exatamente essa lacuna. A regra: rode os dois, o citator primeiro, nessa ordem. Nenhum deles sozinho cobre a peça.

Frente ao Clearbrief. Um add-in de Word que checa se uma citação existe, se a fonte sustenta a afirmação e se ela foi superada, e monta uma tabela de autoridades com hyperlinks. O plano Solo é publicado a US$ 300 por usuário/mês (consultado em 20 de agosto de 2026), ou US$ 3.600 por assento/ano. Se a redação acontece no Word e você consegue aprovar os assentos, compre — ele cobre a metade de existência que este Skill não cobre, e mora onde a escrita já está. Use o Skill quando a compra não passar, quando a peça citar uma produção que o fornecedor não tem, ou quando você quiser o log de verificação como arquivo portátil na pasta do caso em vez de um estado dentro da sessão de Word de alguém.

Frente ao Lexis+ com Protégé. Os Shepard’s Verify Trust Markers, adicionados em maio de 2026, escaneiam texto gerado por IA e redigido por advogados, conferem cada citação jurídica contra as fontes da Lexis e sinalizam o que não dá para verificar. Um escritório Lexis já comprou isso — use. Ele confere citações contra o corpus e não contra os seus autos, então deixa intactas as afirmações fáticas citadas a Bates, que é onde este Skill e ele param de se sobrepor.

Frente ao Paxton AI. O Citator dele reporta 94% no CaseHold de Stanford — número medido pelo próprio fornecedor, e uma análise da PNAS de 2025 sustenta que partes desse benchmark são fáceis o bastante para modelos bag-of-words pontuarem quase perfeito, então trate como piso e não como nota. Mesma regra dos outros dois: responde existência e tratamento.

Frente ao status quo de um associado baixando cada citação. É o que a maioria dos escritórios faz, é a linha de base correta, e o Skill não substitui. O que muda é o que esse associado lê: uma tabela com as linhas não resolvidas já ordenadas, em vez de quarenta PDFs e um marca-texto.

Pontos de atenção

  • O Skill certifica de memória. Perguntado se uma citação é boa, um modelo responde a partir do reconhecimento, com confiança — o mecanismo por trás da autoridade fabricada. Guarda: SUPPORTED exige um trecho literal copiado de um arquivo indexado e impresso na linha, de modo que o log mostra trechos e não veredictos e um revisor consegue checar se a trava se manteve. A checagem por amostragem de 10 linhas no bloco de assinatura existe para isso e para mais nada.
  • Fontes circulares. Uma “fonte” que é ela mesma um resumo de IA verifica uma fabricação contra a própria fabricação. Guarda: provenance é um vocabulário fechado sem valor other e sem como expressar uma sinopse; linhas fora dele são rejeitadas na passagem 1. Headnotes e recortes de banco de peças não são fontes — baixe o acórdão.
  • A deduplicação esconde a deturpação. Guarda: linhas indexadas por instância de citação, com a contagem de instâncias impressa ao lado da de autoridades, de modo que um par igual se lê como falha de leitura e não como peça limpa.
  • O log vira a certificação. Guarda: a declaração de escopo encabeça todo log, nomeia existência e histórico posterior como fora de escopo, e o bloco de assinatura fica sem assinatura até uma pessoa assinar. A Rule 11(b) certifica uma apuração razoável nas circunstâncias; o log é prova de que ela ocorreu, não a coisa em si. O que está em jogo está documentado — em Whiting v. City of Athens, decidido no Sexto Circuito em março de 2026 sobre uma peça com mais de duas dúzias de citações fabricadas, o tribunal impôs honorários, custas em dobro, US$ 15.000 de sanção punitiva para cada um e uma representação disciplinar.
  • Downloads vencidos. Um caso que era direito vigente no download e foi superado semana passada se lê igual a um que ninguém checou. Guarda: retrieved_on é obrigatório por fonte e comparado contra filing_date, e qualquer intervalo acima de 30 dias marca [STALE-PULL] em toda linha que cite aquela fonte.
  • Confidencialidade. Guarda: cheque os termos de retenção de dados aceitos pelo escritório antes do primeiro documento sob segredo que você colar. O Skill não tem opinião sobre o que a sua ordem de proteção permite, e a Opinion 512 deixa essa análise com você.

Stack

  • Claude — extração da tabela de proposições, correspondência de trechos, diff de citações textuais, montagem do log
  • Lexis+ com Protégé ou Thomson Reuters CoCounsel — a passagem do citator que vem primeiro e responde existência e tratamento
  • Paxton AI — a opção de citator mais barata para escritórios sem contrato de Westlaw ou de Lexis

Relacionado: grounding vs alucinação em IA jurídica para o teste de aceitação que vale rodar antes de comprar qualquer uma das ferramentas acima, e o Skill de roteiro de depoimento para a mesma trava de citação em duas passagens aplicada à preparação do interrogatório.

Arquivos deste artefato

Baixar tudo (.zip)