
Professores de direito preferiram as respostas geradas por inteligência artificial em vez das respostas escritas por colegas professores, de acordo com um estudo recente liderado pela Universidade de Stanford que examinou como os grandes modelos de linguagem se comportam em tarefas de raciocínio jurídico.
No estudo, 16 professores de 14 faculdades de direito dos EUA – incluindo Stanford, Yale, New York University, University of Chicago, Georgetown, UCLA e University of Virginia – criaram 40 questões de direito contratual abrangendo doutrina jurídica, jurisprudência, casos hipotéticos e questões de política. Os pesquisadores viram isso como uma forma ideal de testar as capacidades da IA moderna.
“Grandes modelos de linguagem (LLMs) são cada vez mais promovidos como tutores educacionais, mas a maioria das avaliações foca em domínios com uma única verdade fundamental”, escreveram os pesquisadores. “Muitas disciplinas, no entanto, dependem de julgamento: raciocínio, ponderação da ambiguidade e alcance de conclusões defensáveis. O direito oferece um teste rigoroso.”
Em 2.918 comparações cegas, os professores selecionaram a resposta que prefeririam dar a um aluno. O Gemini 2.5 Pro do Google venceu 75,92% de seus confrontos contra instrutores humanos, enquanto o NotebookLM da gigante da tecnologia venceu 74,75% das vezes, dando preferência aos resultados gerados por IA em aproximadamente três quartos das respostas.
De acordo com os pesquisadores, para determinar se os resultados refletiam um consenso profissional mais amplo, os pesquisadores analisaram com que frequência os professores concordavam ao avaliar os mesmos pares de respostas.
“A concordância observada excedeu o nível esperado se os julgamentos fossem inteiramente idiossincráticos, indicando que o sucesso dos LLMs reflete o alinhamento com os critérios disciplinares comuns”, escreveram eles.
O estudo descobriu que os modelos de IA também superaram os instrutores humanos em várias categorias, incluindo questões de recuperação relacionadas a casos, códigos ou doutrinas, hipotéticos e discussões de política.
“Para investigar se alguma vantagem dos LLMs poderia ser impulsionada pelo estilo de escrita superficial, em vez do conteúdo substantivo, nós projetamos adicionalmente um conjunto de características léxico-sintáticas – comprimento da resposta, organização estrutural, nuances de raciocínio, âncoras legais, tom de confiança, clareza e suporte pedagógico – e testamos o quanto do padrão de preferência eles poderiam explicar”, disse o estudo.
As respostas geradas por IA também foram sinalizadas como prejudiciais com menos frequência do que as escritas por professores, com o Gemini registrando uma taxa de nocividade de 3,41% e o NotebookLM de 3,64%, em comparação com 12,06% para instrutores humanos. Em uma análise separada de modelos adicionais, o Claude Opus 4.7 da Anthropic ficou em primeiro lugar, seguido pelo ChatGPT 5.4 da OpenAI e pelo Gemini 2.5 Pro, enquanto todos os modelos de IA avaliados superaram os instrutores humanos em média.
Os pesquisadores alertaram que o estudo não mediu se as respostas correspondiam às preferências de ensino individuais de cada professor, deixando aberta a possibilidade de que as respostas geradas por IA fossem vistas como geralmente aceitáveis, em vez de adaptadas à abordagem de um instrutor específico.
“Embora as respostas dos LLMs sejam geralmente preferidas às dos instrutores humanos, nosso ambiente de avaliação não nos permite medir diretamente a extensão em que as preferências do instrutor são satisfeitas”, disse o estudo. “É pelo menos teoricamente possível que os LLMs, embora geralmente entreguem respostas mais fortes, ainda gerem respostas que são meramente consideradas ‘boas o suficiente’.”
O estudo surge em um momento em que tribunais, escritórios de advocacia e faculdades de direito lidam cada vez mais com a forma como a inteligência artificial deve ser usada na profissão jurídica.
Em março, o Tribunal Superior de Los Angeles começou a testar ferramentas de IA para ajudar os juízes a gerenciar o aumento do número de processos, enquanto as faculdades de direito estão adicionando programas de treinamento em IA.
“Os benefícios potenciais dessas novas tecnologias como um multiplicador de força na prática do direito simplesmente não podem ser ignorados”, disse anteriormente o Decano da Faculdade de Direito do Mississippi College, John P. Anderson, ao Decrypt. “Seja qual for o plano de nossos alunos – serem litigantes ou advogados transacionais –, seus futuros empregadores esperarão familiaridade com essas ferramentas de IA. Queremos que os escritórios que contratam nossos alunos tenham certeza de que todo graduado da MC Law é competente em tecnologias de IA.”
Ao mesmo tempo, no entanto, escritórios de advocacia continuam a enfrentar casos prejudicados por alucinações e outros erros gerados por IA. Em abril, o escritório de advocacia Sullivan & Cromwell admitiu a um tribunal de falências dos EUA que um recente processo em um caso de grande repercussão continha citações falsas geradas por IA.





