Full text
Na Pr´ atica, qual IA Entende o Direito? Um Estudo Experimental com IAs Generalistas e uma IA Jur´ ıdica Marina Soares Marinho1,2, Daniela Vianna1, Livy Real1,2, Altigran da Silva2, Gabriela Migliorini1 1Jusbrasil, Salvador - Brasil {marina.marinho,gabriela.milgiorini,daniela.vianna}@jusbrasil.com.br 2Instituto de Computac¸˜ ao, Universidade Federal do Amazonas, Manaus - Brasil {livyreal,alti}@icomp.ufam.edu.br Abstract. O uso de sistemas de inteligˆ encia artificial (IA) generativa no campo jur´ ıdico tem se expandido com rapidez, acompanhando o potencial de maior eficiˆ encia na pesquisa e na produc¸ ˜ ao de textos jur´ ıdicos. Contudo, em grande parte dos casos, n˜ ao ´ e uma pr´ atica comum avaliar a qualidade do conte´ udo jur´ ıdico apresentado nas respostas geradas por estes sistemas. Isso ´ e fundamental, pois para que os usu´ arios possam adotar estes sistemas, ´ e importante aferir sua correc¸ ˜ ao, consistˆ encia e adequac¸ ˜ ao ` as formas pr´ oprias de construc¸ ˜ ao e justificac¸ ˜ ao do Direito. Visando a abordar este problema, este trabalho apresenta o Estudo Jusbrasil sobre o uso de IAs generalistas no Direito, uma avaliac¸ ˜ ao experimental comparativa entre trˆ es sistemas de IA aplicados ao Direito: Jus IA, ChatGPT e Gemini, examinando sua efetividade em tarefas projetadas para reproduzir o cotidiano profissional de advogados no Brasil. As respostas fornecidas por cada sistema foram avaliadas ` as cegas por 48 profissionais, com base em quatro crit´ erios: corretude, completude, fluidez e confiabilidade. Dentre os sistemas estudados, o Jus IA apresentou desempenho mais est´ avel e superior em todos os crit´ erios, com destaque para corretude e confiabilidade. J´ a os sistemas generalistas, desenvolvidos para atuar em m´ ultiplos dom´ ınios, sem especializac¸ ˜ ao jur´ ıdica, mostraram maior variac¸ ˜ ao entre as m´ etricas utilizadas e incidˆ encia de erros conceituais ou citac¸ ˜ oes normativas inexistentes. O protocolo experimental adotado foi fundamentado em princ´ ıpios da teoria do Direito, como correc¸ ˜ ao material, coerˆ encia sistem´ atica e integridade argumentativa, e em pr´ aticas profissionais jur´ ıdicas, assegurando neutralidade, reprodutibilidade e relevˆ ancia anal´ ıtica. Estes resultados oferecem evidˆ encias de que a especializac¸ ˜ ao no dom´ ınio ´ e determinante para a qualidade e a confiabilidade das respostas constru´ ıdas usando IA generativa. Al´ em disso, O estudo contribui para o avanc¸o de uma abordagem metodol´ ogica que articula fundamentos dogm´ aticos e crit´ erios emp´ ıricos na avaliac¸ ˜ ao de sistemas de IA voltados ` a atuac¸ ˜ ao jur´ ıdica. 1. Introduc¸˜ ao O uso de Modelos de Linguagem de Larga Escala (LLMs) em tarefas jur´ ıdicas tem se expandido rapidamente. Ferramentas baseadas em Inteligˆ encia Artificial (IA) generativa j´ a s˜ ao empregadas por escrit´ orios, departamentos jur´ ıdicos e ´ org˜ aos p´ ublicos para gerar minutas, revisar textos legais, sintetizar jurisprudˆ encia e responder consultas. Essa ampliac¸˜ ao de uso evidencia o potencial transformador da tecnologia, ao mesmo tempo em arXiv:submit/6907995 [cs.CL] 20 Oct 2025
que torna mais vis´ ıveis suas limitac¸ ˜ oes quanto ` a validade e ` a confiabilidade das respostas jur´ ıdicas que produz. Neste sentido, [Magesh et al. 2025], ao avaliar plataformas comerciais de pesquisa jur´ ıdica baseadas em IA, constataram taxas significativas de respostas imprecisas e n˜ ao verific´ aveis, mesmo em produtos de mercado amplamente difundidos. Sua pesquisa evidencia n˜ ao apenas o desafio de avaliar conte´ udo jur´ ıdico, mas a ausˆ encia de transparˆ encia metodol´ ogica e falta de padr˜ oes audit´ aveis de avaliac¸˜ ao. A avaliac¸˜ ao de qualidade ´ e parte fundamental do desenvolvimento de produtos do Jusbrasil. A empresa ´ e a maior legal tech da Am´ erica Latina e possui o maior reposit´ orio de documentos jur´ ıdicos do Brasil. Em marc¸o de 2025, a empresa lanc¸ou o Jus IA, um sistema de Inteligˆ encia Artificial generativa que, atualmente, funciona em modo conversacional e permite ` as pessoas usu´ arias interagirem para realizar, virtualmente, qualquer tarefa relacionada com o consumo ou criac¸˜ ao de conte´ udo jur´ ıdico. O racioc´ ınio jur´ ıdico distingue-se de outros dom´ ınios especializados porque a validade de uma resposta depende n˜ ao apenas da exatid˜ ao informacional, mas da capacidade de reconstruir o sentido das normas dentro de um sistema interpretativo e argumentativo que confere autoridade ao resultado. Assim, a qualidade de uma resposta jur´ ıdica n˜ ao pode ser medida apenas pela similaridade textual ou pela verificac¸˜ ao factual. O desafio ´ e avaliar se a resposta ´ e juridicamente correta, ou seja, se ela ´ e coerente com o ordenamento e argumentativamente ´ ıntegra. Hoje, pela novidade da tecnologia, faltam protocolos sistem´ aticos e transparentes que traduzam os fundamentos da racionalidade jur´ ıdica em crit´ erios emp´ ıricos de avaliac¸˜ ao de IAs. Como tamb´ em observam [Magesh et al. 2025], mesmo as principais ferramentas jur´ ıdicas comerciais n˜ ao divulgam metodologias de avaliac¸˜ ao, o que impede auditoria cient´ ıfica e dificulta a criac¸˜ ao de parˆ ametros p´ ublicos de comparac¸˜ ao. Nos ´ ultimos anos, um conjunto relevante de estudos vem tentando aproximar l´ ogica jur´ ıdica e m´ etodos avaliativos, mas de forma ainda fragmentada e desarticulada. Pesquisas como as de [Xu and Ashley 2023] e [Mullick et al. 2022] prop˜ oem m´ etricas inspiradas em estruturas argumentativas cl´ assicas, como o modelo Issue–Reason–Conclusion e a extrac¸˜ ao de intents jur´ ıdicos; [Posner and Saran 2025] analisam a aderˆ encia dos LLMs a diferentes correntes de pensamento jur´ ıdico, revelando vieses de formalismo e realismo; e benchmarks como JuDGE [Su et al. 2025], CaseGen [Li et al. 2025] e LRAGE [Park et al. 2025] experimentam formas de mensurar coerˆ encia, factualidade e precis˜ ao normativa por meio de avaliadores autom´ aticos. No entanto, esses esforc¸os permanecem dispersos, restritos a contextos espec´ ıficos e sem um referencial compar´ avel de qualidade entre sistemas jur´ ıdicos, l´ ınguas ou jurisdic¸ ˜ oes. Um destaque latino-americano nesse panorama ´ e o OAB-Bench, proposto por [Pires et al. 2025], que utiliza a segunda fase do Exame da Ordem dos Advogados do Brasil como benchmark de escrita jur´ ıdica aberta. O estudo avalia se LLMs seriam capazes de redigir petic¸ ˜ oes e respostas jur´ ıdicas segundo os crit´ erios oficiais da OAB, como correc¸˜ ao doutrin´ aria, estrutura argumentativa e aderˆ encia ` as normas processuais, e emprega um modelo de IA como juiz (LLM-as-a-Judge) para atribuir notas de forma automatizada. A pesquisa demonstra que ´ e poss´ ıvel traduzir crit´ erios jur´ ıdicos normativos em m´ etricas mensur´ aveis, mas tamb´ em evidencia limitac¸ ˜ oes na consistˆ encia dos avaliadores autom´ aticos e na padronizac¸˜ ao de rubricas, reforc¸ando a necessidade de protocolos mais transparentes e audit´ aveis para o dom´ ınio jur´ ıdico. Al´ em disso,
como mostra o levantamento de pr´ aticas industriais [Rosenoff et al. 2025, Heller 2024, Dahn and Herrmannova 2025], as grandes lawtechs globais, como Harvey, Thomson Reuters e LexisNexis, vˆ em desenvolvendo seus pr´ oprios protocolos internos de avaliac¸˜ ao, com m´ etricas h´ ıbridas que combinam avaliadores autom´ aticos (synthetic raters) e revis˜ ao humana. Embora avancem em escalabilidade e controle de riscos, esses processos n˜ ao s˜ ao p´ ublicos, audit´ aveis ou interoper´ aveis com os crit´ erios da pesquisa cient´ ıfica, o que reforc¸a a assimetria entre as avaliac¸ ˜ oes corporativas e os padr˜ oes de transparˆ encia exigidos para governanc¸a p´ ublica e reprodutibilidade acadˆ emica. OEstudo Jusbrasil sobre o uso de IAs generalistas no Direito surge, portanto, n˜ ao para inaugurar o tema da avaliac¸˜ ao jur´ ıdica de IAs, mas para propor sua sistematizac¸˜ ao. Seu objetivo ´ e construir um referencial metodol´ ogico e experimental unificado, capaz de articular princ´ ıpios da teoria do Direito com pr´ aticas emp´ ıricas de avaliac¸˜ ao de IA, de modo que a qualidade de sistemas generativos jur´ ıdicos possa ser mensurada de forma transparente, compar´ avel e audit´ avel. A hip´ otese central ´ e que sistemas especializados em tarefas jur´ ıdicas, treinados ou calibrados com dados normativos, jurisprudenciais e doutrin´ arios, curados e auditados por profissionais da ´ area, produzem respostas de maior qualidade para o dom´ ınio, caracterizadas por confiabilidade, coerˆ encia e aderˆ encia ao racioc´ ınio jur´ ıdico. Ao estruturar m´ etricas ancoradas na racionalidade jur´ ıdica, o Estudo Jusbrasil sobre o uso de IAs generalistas no Direito busca preencher a lacuna metodol´ ogica entre o saber dogm´ atico e o saber emp´ ırico, criando as bases para uma governanc¸a p´ ublica e cient´ ıfica da IA jur´ ıdica. O presente artigo tem, portanto, trˆ es objetivos principais: 1. Apresentar a fundamentac¸˜ ao te´ orica que inspira o protocolo Jus IA, traduzindo a estrutura do racioc´ ınio jur´ ıdico em crit´ erios avaliativos. 2. Descrever o desenho experimental e o m´ etodo de avaliac¸˜ ao comparativa entre uma IA jur´ ıdica e IAs generalistas. 3. Discutir os resultados emp´ ıricos obtidos, explorando o papel da especializac¸˜ ao na qualidade jur´ ıdica das respostas. 2. Fundamentac¸˜ ao Te´ orica e Princ´ ıpios Orientadores Esta sec¸˜ ao apresenta os fundamentos jur´ ıdicos que orientam o protocolo de avaliac¸˜ ao proposto, estabelecendo um elo entre a teoria do Direito e os crit´ erios utilizados para mensurar a qualidade das respostas geradas artificialmente. A partir de referenciais como a integridade da argumentac¸˜ ao, a coerˆ encia do racioc´ ınio jur´ ıdico e a confiabilidade das fontes normativas, s˜ ao explicitados os princ´ ıpios que sustentam o desenho metodol´ ogico. Esses princ´ ıpios se traduzem em crit´ erios operacionais, tais como corretude, confiabilidade, completude e fluidez, cuja escolha ´ e justificada com base em sua capacidade de capturar dimens˜ oes essenciais da pr´ atica jur´ ıdica. 2.1. O Direito como sistema interpretativo O Direito ´ e um sistema de produc¸˜ ao normativa e discursiva que opera inteiramente no campo da linguagem. Seu funcionamento depende de pr´ aticas interpretativas e argumentativas que transformam textos normativos em decis˜ oes aplic´ aveis. Desde [Hart 1961] e [Luhmann 1993], compreende-se que o Direito se mant´ em n˜ ao pela rigidez das regras, mas pela reproduc¸˜ ao institucional de expectativas normativas, mediadas por processos
de interpretac¸˜ ao e justificac¸˜ ao. Cada decis˜ ao jur´ ıdica atualiza e reconstr´ oi o sentido das normas, mantendo a coerˆ encia do sistema. Essa estrutura faz do racioc´ ınio jur´ ıdico uma pr´ atica essencialmente interpretativa, guiada por coerˆ encia e integridade [Dworkin 1986]: as respostas jur´ ıdicas n˜ ao s˜ ao deduc¸ ˜ oes formais, mas reconstruc¸˜ oes argumentadas do ordenamento. Como observa [Gadamer 1960], interpretar ´ e fundir horizontes; integrar o texto ` as condic¸ ˜ oes hist´ oricas e institucionais do int´ erprete. O conhecimento jur´ ıdico, portanto, ´ e lingu´ ıstico, contextual e institucionalmente situado. Essas caracter´ ısticas n˜ ao inviabilizam o uso de IA generativa no Direito. Ao contr´ ario, definem as condic¸ ˜ oes sob as quais este uso pode ser aplicado e avali´ avel. Sistemas de IA especializados podem reproduzir e apoiar pr´ aticas jur´ ıdicas se forem projetados para compreender o Direito como sistema interpretativo, reconhecendo a centralidade da argumentac¸˜ ao, da coerˆ encia e da justificabilidade p´ ublica. Avaliar sua qualidade, portanto, exige questionar em que medida as IAs preservam esses modos de racioc´ ınio. 2.2. A IA jur´ ıdica e o circuito hermenˆ eutico Quando sistemas de IA generativa produzem textos jur´ ıdicos, eles n˜ ao apenas processam dados, mas participam da produc¸˜ ao de sentido jur´ ıdico, sintetizando interpretac¸ ˜ oes existentes e recombinando fundamentos. Isso significa que sua qualidade deve ser avaliada n˜ ao apenas por crit´ erios t´ ecnicos (precis˜ ao e consistˆ encia, por exemplo), mas por sua aderˆ encia ` a racionalidade jur´ ıdica, isto ´ e, pela capacidade de formular respostas interpretativamente defens´ aveis e normativamente justificadas. A linha de pesquisa conhecida como Artificial Intelligence and Law oferece fundamentos para essa abordagem. [Ashley 2017] discute que o racioc´ ınio jur´ ıdico ´ e sempre argumentativo e contextual; sua formalizac¸˜ ao computacional n˜ ao elimina essa natureza, mas a torna expl´ ıcita. [Bench-Capon and Sartor 2003] complementam ao propor que a coerˆ encia do Direito decorre da ponderac¸˜ ao entre valores e fundamentos, e n˜ ao da aplicac¸˜ ao mecˆ anica de regras. Essa literatura demonstra que ´ e poss´ ıvel e desej´ avel que modelos de IA reproduzam estruturas argumentativas e padr˜ oes de coerˆ encia t´ ıpicos do racioc´ ınio jur´ ıdico, desde que se considerem as camadas normativas e discursivas que o constituem. 2.3. Do racioc´ ınio jur´ ıdico ` a avaliac¸˜ ao de qualidade OEstudo Jusbrasil sobre o uso de IAs generalistas no Direito parte dessa compreens˜ ao: avaliar um sistema de IA jur´ ıdica significa medir como ele se alinha ` a estrutura interpretativa e argumentativa do Direito. Por isso, seu protocolo traduz quatro dimens˜ oes centrais do racioc´ ınio jur´ ıdico em crit´ erios emp´ ıricos observ´ aveis, como descritos na Tabela 1. Esses crit´ erios expressam o modo de produc¸˜ ao de sentido jur´ ıdico, permitindo avaliar empiricamente a capacidade de um sistema generativo reproduzir pr´ aticas leg´ ıtimas de interpretac¸˜ ao. Assim, a avaliac¸˜ ao de qualidade deixa de ser um simples controle t´ ecnico e se torna um procedimento de verificac¸˜ ao interpretativa, compat´ ıvel com a natureza discursiva do Direito. 2.4. A qualidade como v´ ınculo entre t´ ecnica e legitimidade Nessa perspectiva, a qualidade jur´ ıdica n˜ ao ´ e apenas um atributo das respostas, mas o elo que conecta a operac¸˜ ao t´ ecnica da IA ` a legitimidade institucional do Direito. Avaliar
Tabela 1. Dimens ˜ oes jur´ıdico-argumentativas e crit´ erios do protocolo jus IA Dimens˜ ao jur´ ıdico-argumentativa Descric¸˜ ao Crit´ erio Correc¸ ˜ ao material Compatibilidade da resposta com o ordenamento e sua aplicac¸˜ ao contextual. Corretude Coerˆ encia argumentativa Consistˆ encia entre fundamentos, premissas e conclus˜ oes; transparˆ encia da justificativa. Confiabilidade Abrangˆ encia interpretativa Considerac¸˜ ao adequada dos elementos normativos e f´ aticos relevantes. Completude Aderˆ encia comunicativa Clareza, precis˜ ao e adequac¸˜ ao terminol´ ogica ` a pr´ atica profissional. Fluidez qualidade ´ e verificar se o sistema mant´ em coerˆ encia, justificabilidade e rastreabilidade em suas respostas (dimens˜ oes que sustentam a confianc¸a p´ ublica na pr´ atica jur´ ıdica). O´ Indice de Qualidade Jus IA prop˜ oe, assim, uma abordagem hermenˆ eutica e mensur´ avel: combina crit´ erios normativos do racioc´ ınio jur´ ıdico com m´ etodos emp´ ıricos de avaliac¸˜ ao, permitindo comparar soluc¸ ˜ oes e orientar seu aprimoramento. Em vez de limitar o uso da IA no Direito, essa estrutura o torna vi´ avel e audit´ avel, estabelecendo parˆ ametros de confiabilidade que preservam a integridade das pr´ aticas interpretativas. 3. Metodologia Esta sec¸˜ ao apresenta o desenho experimental e os procedimentos metodol´ ogicos adotados para a avaliac¸˜ ao comparativa entre sistemas generativos no contexto jur´ ıdico. S˜ ao detalhadas as cinco intenc¸ ˜ oes de uso que orientam a construc¸˜ ao dos casos, bem como as estrat´ egias de controle de vi´ es, anonimizac¸˜ ao e randomizac¸˜ ao das respostas. Em seguida, descreve-se a composic¸˜ ao da amostra, incluindo o n´ umero de casos, tarefas jur´ ıdicas e sistemas comparados, e o perfil dos avaliadores envolvidos. Por fim, s˜ ao explicitados os instrumentos de coleta e os m´ etodos de an´ alise estat´ ıstica e qualitativa empregados na interpretac¸˜ ao dos resultados. 3.1. Desenho geral do experimento O experimento comparou quatro sistemas de IA conversacional baseados em LLMs: 1. IA Jur´ ıdica (Jus IA): sistema especializado ajustado com corpora normativos, doutrin´ arios e jurisprudenciais brasileiros, voltado a interpretac¸˜ ao e argumentac¸˜ ao jur´ ıdica contextualizada1. 2. ChatGPT: sistema de prop´ osito geral com ampla difus˜ ao comercial2. Foram avaliados duas vers˜ oes: a vers˜ ao gratuita (ChatGPT Gratuito) e a plus (ChatGPT Plus), todas com o modelo GPT-5. 3. Gemini: sistema de mesma gerac¸˜ ao tecnol´ ogica3. Durante a avaliac¸˜ ao do sistema foi selecionado o modelo 2.5 PRO. 1Acessado via ia.jusbrasil.com.br 2Acessado via chat.openai.com 3Acessado via gemini.google.com/app
A escolha das soluc¸ ˜ oes comparadas partiu do reconhecimento de que ChatGPT e Gemini s˜ ao as duas IAs generalistas mais utilizadas no mundo4e tˆ em tamb´ em forte presenc¸a no Brasil. O pa´ ıs figura entre os que mais acessam o ChatGPT globalmente, com mais de 140 milh˜ oes de interac¸ ˜ oes di´ arias, segundo levantamento da SimilarWeb divulgado pela CNN Brasil5. O Gemini, lanc¸ado oficialmente no pa´ ıs em dezembro de 2023, vem ampliando o uso de modelos multimodais e se consolidando como alternativa relevante entre profissionais do Direito. Cada sistema foi avaliado em cinco intenc¸ ˜ oes de uso representativas da rotina jur´ ıdica. No contexto do experimento, denomina-se intenc¸ ˜ ao de uso o prop´ osito funcional da interac¸˜ ao com a IA, isto ´ e, o tipo de atividade profissional que motiva a interac¸˜ ao com a ferramenta e determina o formato esperado da resposta. S˜ ao elas: 1. Gerar / Ajustar Documento: produc¸˜ ao ou revis˜ ao de trechos ou documentos completos tipicamente utilizados na advocacia (petic¸˜ ao, notificac¸˜ ao, contrato, parecer etc.). 2. Analisar / Resumir Documento: s´ ıntese e avaliac¸˜ ao cr´ ıtica de documentos jur´ ıdicos. 3. Entender Conceito Jur´ ıdico: explicac¸˜ ao de categorias e institutos, com exigˆ encia de definic¸˜ ao, enquadramento normativo e exemplos. 4. Entender Panorama Jurisprudencial: mapeamento de entendimentos predominantes, com identificac¸˜ ao de leading cases e eventuais divergˆ encias entre ´ org˜ aos e tribunais. 5. Pesquisar Precedente: localizac¸˜ ao e referˆ encia a precedentes aplic´ aveis ao caso da pessoa usu´ aria, com indicac¸˜ ao do racioc´ ınio quanto ` a pertinˆ encia dos documentos elencados. Cada intenc¸˜ ao foi avaliada com trˆ es casos jur´ ıdicos distintos, totalizando 15 casos. Para cada caso foram avaliadas quatro sa´ ıdas, uma de cada sistema de IA: Jus IA, ChatGPT Gratuito, ChatGPT Plus e Gemini, totalizando 60 sa´ ıdas a serem avaliadas. 3.2. Construc¸˜ ao dos casos jur´ ıdicos e das instruc¸˜ oes do usu´ ario Os casos jur´ ıdicos utilizados no experimento foram elaborados a partir de interac¸ ˜ oes reais registradas na plataforma Jus IA, previamente tratadas em conformidade com a Lei Geral de Protec¸˜ ao de Dados (LGPD). Todo o material ´ e integralmente anonimizado, de modo que nenhum dado pessoal, identificac¸˜ ao de partes ou contexto espec´ ıfico das conversas seja acess´ ıvel aos sistemas de IA ou aos avaliadores. Ap´ os o tratamento preliminar, as instruc¸ ˜ oes transmitidas aos modelos foram revisadas por pessoas advogadas e pesquisadoras da equipe Jusbrasil, garantindo precis˜ ao t´ ecnica, neutralidade e representatividade dos casos avaliados. Cada intenc¸˜ ao de uso foi previamente associada a um conjunto fixo de trˆ es casos, selecionados para variar em complexidade e extens˜ ao das respostas esperadas, de modo a refletir a diversidade de tarefas que comp˜ oem a rotina profissional jur´ ıdica. 4https://aimagazine.com/news/top-10-generative-ai-tools 5cnnbrasil.com.br/tecnologia/brasil-esta-entre-os-paises-que-maisusam-o-chatgpt-diz-estudo/
Todos os sistemas foram submetidos ` as mesmas instruc¸ ˜ oes e aos mesmos materiais de caso. As instruc¸˜ oes foram redigidas de forma idˆ entica e revisados para eliminar poss´ ıveis vieses de formulac¸˜ ao, enquanto os materiais podem incluir documentos anexados espec´ ıficos a uma tarefa. Todas as ferramentas foram utilizadas em seu modo de interac¸˜ ao conversacional, assegurando condic¸ ˜ oes equivalentes de uso e foco em sistemas conversacionais (e n˜ ao em aplicac¸ ˜ oes para tarefas jur´ ıdicas espec´ ıficas). Dessa forma, as diferenc¸as observadas entre os sistemas refletem sua capacidade de compreender a intenc¸˜ ao da tarefa, antecipar o formato esperado da resposta e estruturar adequadamente o conte´ udo jur´ ıdico produzido. O dataset desenvolvido como parte deste trabalho est´ a dispon´ ıvel publicamente no Hugging Face6, visando facilitar reprodutibilidade e reuso. 3.3. Pesos e hierarquia dos crit´ erios de avaliac¸˜ ao A definic¸˜ ao e ponderac¸˜ ao dos crit´ erios de avaliac¸˜ ao do Protocolo Jus IA resultaram da combinac¸˜ ao entre experiˆ encia profissional de pessoas advogadas envolvidas no projeto, do conhecimento acumulado em pesquisas de usu´ ario conduzidas pela equipe do Jusbrasil ao longo dos ´ ultimos anos e tamb´ em foi resultado de um formul´ ario respondido pelos avaliadores, em que eles deveriam apontar quais s˜ ao os crit´ erios mais relevantes para determinar a qualidade de um conte´ udo jur´ ıdico. O objetivo foi garantir que o ´ ındice expressasse n˜ ao apenas fundamentos te´ oricos de correc¸˜ ao e coerˆ encia, mas tamb´ em as preocupac¸ ˜ oes hist´ oricas e pragm´ aticas da advocacia brasileira no uso de sistemas de informac¸˜ ao jur´ ıdica. Dessa s´ ıntese emergiu uma hierarquia emp´ ırica de relevˆ ancia entre os crit´ erios, refletindo o modo como profissionais do Direito avaliam a qualidade de um texto jur´ ıdico produzido por terceiros, humanos ou artificiais. Os crit´ erios propostos durante a avaliac¸˜ ao foram: confiabilidade,corretude,completude efluidez. Os crit´ erios de confiabilidade ecorretude receberam peso interpretativo maior no processo de avaliac¸˜ ao, por representarem o n´ ucleo das expectativas profissionais quanto ` a precis˜ ao da informac¸˜ ao jur´ ıdica e ` a rastreabilidade das fontes. Essas dimens˜ oes correspondem, no plano te´ orico, ` as exigˆ encias de consistˆ encia e integridade descritas na Sec¸˜ ao 2: s˜ ao os elementos que permitem que uma resposta seja reconhecida como juridicamente defens´ avel e institucionalmente leg´ ıtima. A ˆ enfase nos crit´ erios de confiabilidade e corretude aproxima-se dos parˆ ametros adotados por [Magesh et al. 2025] et al. (2024) em sua an´ alise das ferramentas de IA jur´ ıdica comerciais, centrada na rastreabilidade das fontes e na precis˜ ao normativa das respostas. Na pr´ atica da advocacia, a confiabilidade traduz a necessidade de poder verificar e revisar o racioc´ ınio exposto; a corretude assegura que o resultado esteja alinhado ao ordenamento vigente e ` a interpretac¸˜ ao dominante. Ambos respondem, portanto, ` a func¸˜ ao de legitimar o conte´ udo jur´ ıdico como base para a ac¸˜ ao profissional, o que explica seu peso superior no julgamento global de qualidade. O crit´ erio de completude, embora relevante, foi tratado com menor peso relativo. Em contextos conversacionais, a completude de uma resposta pode ser progredida por meio de interac¸ ˜ oes subsequentes, ` a medida que o usu´ ario refina ou amplia o escopo da pergunta. Al´ em disso, a noc¸˜ ao de completude envolve certo grau de subjetividade, sendo 6https://huggingface.co/datasets/jusbrasil/indice-jusia
dependente das preferˆ encias individuais quanto ao n´ ıvel de detalhe, extens˜ ao e granularidade desejados. Por isso, considerou-se mais adequado avali´ a-la como um indicativo de abrangˆ encia contextual, e n˜ ao como requisito absoluto de qualidade. Por fim, a fluidez, entendida como clareza, coes˜ ao e naturalidade lingu´ ıstica, foi inclu´ ıda no protocolo como crit´ erio complementar, sem peso predominante. Nos testes preliminares e nas observac¸ ˜ oes de uso, verificou-se que as diferenc¸as de fluidez entre sistemas s˜ ao m´ ınimas, pois todos compartilham modelos fundacionais de linguagem baseados em arquiteturas semelhantes (LLMs de ´ ultima gerac¸˜ ao). Em outras palavras, a fluidez j´ a constitui um atributo estrutural da tecnologia atualmente, pouco discriminativo entre ferramentas, e dificilmente compromete o valor jur´ ıdico de uma resposta. Assim, a func¸˜ ao principal da fluidez na m´ etrica ´ e atuar como contrapeso comunicativo: assegurar que respostas juridicamente precisas tamb´ em sejam leg´ ıveis e utiliz´ aveis no contexto profissional. A partir ent˜ ao dos quatro crit´ erios predefinidos, obtemos a seguinte f´ ormula para o´ Indice Jus IA: desempenho = (2 ·corretude) + completude + (2 ·confiabilidade) + fluidez (1) Essa distribuic¸˜ ao de pesos reforc¸a o princ´ ıpio, discutido na fundamentac¸˜ ao te´ orica, de que a qualidade jur´ ıdica ´ e insepar´ avel da legitimidade interpretativa. Avaliar sistemas de IA sob essa ´ otica significa reconhecer que a excelˆ encia t´ ecnica, expressa em fluˆ encia ou completude, s´ o se torna relevante quando sustentada por confiabilidade e correc¸˜ ao normativa. A atribuic¸˜ ao de pesos ` as respostas bin´ arias (“sim”, “n˜ ao” e “N/A”) variou conforme a intenc¸˜ ao de uso, refletindo nuances metodol´ ogicas espec´ ıficas de cada tarefa. Para o grupo “Gerar / Ajustar documento”, respostas afirmativas receberam peso 1, enquanto negativas e n˜ ao aplic´ aveis foram penalizadas com peso -1, dado o car´ ater obrigat´ orio da citac¸˜ ao, com excec¸˜ ao do caso 3 (escrita de contrato), em que determinadas perguntas foram desconsideradas por n˜ ao se aplicarem ao contexto. Por exemplo, citac¸ ˜ oes n˜ ao s˜ ao necess´ aria na criac¸˜ ao de um contrato. Na intenc¸˜ ao “Analisar e resumir documentos”, todas as respostas foram ponderadas de forma neutra (peso 1 para “sim” e 0 para “n˜ ao” e “N/A”), j´ a que a citac¸˜ ao n˜ ao era mandat´ oria. Para as demais intenc¸˜ oes, como “Entender conceito jur´ ıdico”, “Entender panorama jurisprudencial”, “Pesquisar precedentes/casos similares” e “Buscar documento exato”, foi adotado um esquema h´ ıbrido: perguntas relacionadas a citac¸˜ ao (2, 3, 7 e 8) seguiram a l´ ogica de penalizac¸˜ ao (-1 para “n˜ ao” e “N/A”), enquanto a pergunta 9, relacionada a recˆ encia da citac¸˜ ao, foi tratada com neutralidade (peso 0 para “n˜ ao” e “N/A”), evitando dupla penalizac¸˜ ao em casos onde a citac¸˜ ao n˜ ao era obrigat´ oria ou a pergunta era secund´ aria. As perguntas s˜ ao apresentadas no Apˆ endice 8. 3.4. Controle experimental Para mitigar vieses, foram adotados os seguintes controles: •Cegamento duplo adaptado: os avaliadores n˜ ao foram informados da origem dos conte´ udos (IA jur´ ıdica ou generalista), nem que as respostas haviam sido geradas por ferramentas de IA generativa;
•Randomizac¸˜ ao da ordem de exibic¸ ˜ ao: as respostas geradas pelos sistemas foram apresentadas aos avaliadores em sequˆ encia aleat´ oria, de modo que a posic¸˜ ao de cada resposta variava a cada caso; •Padronizac¸˜ ao de instruc¸˜ oes: todos os avaliadores receberam guias idˆ enticos sobre o uso dos crit´ erios e a forma de execuc¸˜ ao da tarefa; •Independˆ encia entre avaliadores: cada avaliador realizou sua an´ alise de forma independente, sem acesso ` as respostas atribu´ ıdas pelos demais participantes; Reitera-se que as respostas foram mantidas tal como geradas por cada sistema, sem intervenc¸ ˜ oes sobre extens˜ ao ou formatac¸˜ ao. Al´ em de a pr´ opria interface conversacional n˜ ao permitir ajustes desse tipo, caracter´ ısticas como o tamanho e a formatac¸˜ ao do texto gerado s˜ ao dos crit´ erios que mais impactam a avaliac¸˜ ao de modelos de IA [Chen et al. 2024]. O procedimento de duplo cegamento, aliado ` a avaliac¸˜ ao autˆ onoma do crit´ erio de fluidez, contribuiu para mitigar poss´ ıveis vieses de preferˆ encia por determinado estilo ou formato de resposta. O desenho experimental segue boas pr´ aticas internacionais de avaliac¸˜ ao emp´ ırica em IA jur´ ıdica, como as adotadas por [Magesh et al. 2025], que aplicam avaliac¸˜ ao cega por m´ ultiplos analistas e, quando necess´ aria, uma terceira revis˜ ao independente para mitigar vieses de julgamento [Caseli and Nunes 2024, Cap´ ıtulo 13]. Esses procedimentos contribu´ ıram para garantir comparabilidade e validade interna ao experimento, reduzindo a influˆ encia de fatores extr´ ınsecos como familiaridade com linguagem ou estilo dos modelos. 3.5. Perfil dos avaliadores Participaram do experimento 48 profissionais do Direito, provenientes de diferentes regi˜ oes do Brasil e com perfis complementares de formac¸˜ ao e atuac¸˜ ao. Essas pessoas foram selecionadas a partir de um banco de cadastro permanente, mantido pelo Jusbrasil. Originalmente, foram selecionadas 50 pessoas colaboradoras, no entanto, duas participac¸ ˜ oes foram exclu´ ıdas ap´ os a an´ alise de concordˆ ancia entre os avaliadores, por apresentarem divergˆ encias substanciais em relac¸˜ ao ` as demais respostas. A amostra abrangeu pessoas advogadas da iniciativa privada (62.5%), servidores p´ ublicos (20.8%), docentes e pesquisadores (10.4%) e membros de carreiras jur´ ıdicas diversas (6.3%), como magistratura e Minist´ erio P´ ublico. O grupo apresentou tempo m´ edio de experiˆ encia profissional de nove anos, com variac¸˜ ao entre rec´ em-formados e profissionais com mais de dez anos de pr´ atica. Essa diversidade foi intencionalmente buscada para representar diferentes perspectivas sobre a aplicac¸˜ ao do Direito na pr´ atica cotidiana. Em relac¸˜ ao ` as ´ areas de especializac¸˜ ao, predominam o Direito Civil (27%), o Direito do Trabalho (18%) e o Direito Administrativo (15%), seguidos por Direito Penal, Empresarial, Constitucional e Tribut´ ario, distribu´ ıdos de forma coerente ao perfil do p´ ublico que utiliza ferramentas de apoio jur´ ıdico na Plataforma do Jusbrasil. Os avaliadores est˜ ao distribu´ ıdos em 12 unidades federativas, com concentrac¸˜ ao nas regi˜ oes Sudeste (46%), Sul (23%) e Nordeste (17%), al´ em de participac¸ ˜ oes pontuais das regi˜ oes Centro-Oeste (10%) e Norte (4%). Essa dispers˜ ao geogr´ afica reforc¸a a heterogeneidade das interpretac¸ ˜ oes e pr´ aticas jur´ ıdicas representadas na amostra.
ou pouco alinhados ao contexto jur´ ıdico. Pesquisar Precedentes / Casos Similares Entre os diversos crit´ erios avaliados, a intenc¸˜ ao de uso voltada ` a pesquisa de precedentes e casos similares foi aquela em que o sistema jus IA apresentou desempenho mais expressivo. Com valores pr´ oximos da excelˆ encia em corretude (0.93), completude (0.86), confiabilidade (0.96) e fluidez (0.97), o modelo demonstrou n˜ ao apenas dom´ ınio t´ ecnico, mas tamb´ em consistˆ encia argumentativa e clareza textual, atributos essenciais para a recuperac¸˜ ao e interpretac¸˜ ao de jurisprudˆ encia. A Tabela 8 apresenta as m´ edias e os respectivos desvios padr˜ ao para cada um dos sistemas avaliados. Esse resultado ´ e coerente com a arquitetura do Jus IA: um sistema jur´ ıdico especializado, treinado sobre a maior base de jurisprudˆ encia do Brasil e equipado com uma busca jur´ ıdica avanc¸ada, capaz de identificar padr˜ oes decis´ orios, extrair fundamentos relevantes e contextualizar casos com precis˜ ao. Ao contr´ ario dos modelos generalistas, que tendem a apresentar variabilidade elevada e lacunas normativas, o Jus IA se destaca por sua capacidade de navegar com profundidade e seguranc¸a pelo universo jur´ ıdico brasileiro. ChatGPT Gratuito demonstrou completude s´ olida (0.69), superando o ChatGPT Plus nesse crit´ erio. Isso sugere que, mesmo sem acesso premium, o modelo consegue cobrir bem os elementos esperados em uma resposta jur´ ıdica. ChatGPT Plus teve desempenho consistente em confiabilidade (0.71), indicando maior estabilidade argumentativa em relac¸˜ ao a vers˜ ao gratuita e ao Gemini. Gemini teve os piores resultados em todos os crit´ erios, especialmente em confiabilidade (0.09) e completude (0.21), o que compromete sua utilidade em tarefas jur´ ıdicas mais exigentes. Tabela 8. Desempenho m´ edio e desvio padr˜ ao dos sistemas de IA em cada um dos crit´ erios de avaliac¸ ˜ ao considerando a intenc¸ ˜ ao de uso Pesquisar Precedentes / Casos Similares. Crit´ erio Gemini ChatGPT Gratuito ChatGPT Plus Jus IA Corretude 0,25 + −0,22 0,58 + −0,36 0,51 + −0,14 0,93 + −0,10 Completude 0,21 + −0,19 0,69 + −0,10 0,63 + −0,12 0,86 + −0,20 Confiabilidade 0,09 + −0,12 0,60 + −0,23 0,47 + −0,11 0,96 + −0,06 Fluidez 0,26 + −0,22 0,41 + −0,42 0,51 + −0,19 0,97 + −0,04 Concluindo, os resultados indicam que o sistema Jus IA apresentou desempenho superior em todas as dimens˜ oes avaliadas, com destaque para os crit´ erios de corretude e confiabilidade, onde as diferenc¸as foram mais acentuadas. Embora as soluc¸ ˜ oes generalistas tenham demonstrado competˆ encia lingu´ ıstica, especialmente em fluidez ecompletude, seu desempenho foi mais inst´ avel, com maior variabilidade entre casos e tendˆ encia a incorrec¸ ˜ oes jur´ ıdicas. Esses resultados s˜ ao reforc¸ados em justificativas apresentadas pelos avaliadores, que evidenciam trˆ es padr˜ oes principais:
1. Fundamentac¸˜ ao expl´ ıcita: As respostas da IA jur´ ıdica consistentemente citaram as normas corretas e explicaram o racioc´ ınio de forma estruturada. 2. Erros conceituais: Os modelos generalistas confundiram conceitos jur´ ıdicos relacionados, como por exemplo prescric¸ ˜ ao edecadˆ encia. 3. Estilo comunicativo: O texto das ferramentas generalistas ´ e mais fluido, mas menos preciso juridicamente. 4.3. Interpretac¸˜ ao dos resultados ` a luz da pr´ atica jur´ ıdica Os resultados emp´ ıricos confirmam a hip´ otese inicial: a especializac¸˜ ao jur´ ıdica melhora de modo consistente a correc¸˜ ao e a confiabilidade das respostas, mantendo n´ ıveis de fluidez equivalentes aos dos modelos generalistas. Isso sugere que a competˆ encia lingu´ ıstica ´ e hoje um ponto de convergˆ encia entre sistemas, enquanto a qualidade jur´ ıdica depende de fatores mais estruturais, como precis˜ ao normativa, coerˆ encia argumentativa e rastreabilidade das fontes. Do ponto de vista epistemol´ ogico, o estudo demonstra que a avaliac¸˜ ao jur´ ıdica n˜ ao pode ser reduzida a m´ etricas autom´ aticas. O julgamento humano, orientado por princ´ ıpios jur´ ıdicos, continua sendo insubstitu´ ıvel para aferir qualidade normativa e argumentativa [Gao et al. 2024]. Metodologicamente, o experimento valida a viabilidade de protocolos de avaliac¸˜ ao emp´ ırica guiados por fundamentos do Direito, oferecendo um modelo replic´ avel para outras jurisdic¸ ˜ oes. 5. Conclus˜ ao e Trabalhos Futuros Este estudo apresentou e aplicou o protocolo do ´ Indice de Qualidade Jus IA, uma proposta metodol´ ogica para a avaliac¸˜ ao de sistemas de Inteligˆ encia Artificial (IA) no dom´ ınio jur´ ıdico. O experimento comparou quatro sistemas de IA conversacional baseados em LLMs: uma soluc¸˜ ao jur´ ıdica especializada, o Jus IA, e trˆ es sistemas de prop´ osito geral, ChatGPT Gratuito, ChatGPT Plus e Gemini. O protocolo do ´ Indice de Qualidade Jus IA mede a qualidade de respostas jur´ ıdicas segundo quatro crit´ erios t´ ecnicos estabelecidos em conformidade ` as dimens˜ oes jur´ ıdicoargumentativas mais relevantes para o dia-a-dia do profissional de Direito. O protocolo foi desenvolvido de maneira multisciplinar, considerando expertise jur´ ıdica e expertise em Inteligˆ encia Artificial e protocolos de avaliac¸˜ ao. Foi realizado um experimento avaliando as respostas das quatro IAs em 15 cen´ arios reais. O conjunto de an´ alise final cont´ em 60 respostas, que foram analisadas cegamente por 48 profissionais de Direito, com backgrounds diversos. Em linhas gerais, o experimento mostra que a especializac¸˜ ao das Inteligˆ encias Artificiais para o dom´ ınio do Direito melhora consideravelmente a performance dos sistemas. A Inteligˆ encia especializada, Jus IA, reduziu em 43% as alucinac¸ ˜ oes dos modelos. A IA Especializada tamb´ em foi a melhor colocada considerando todos os crit´ erios juridicamente motivados, evidenciando o papel indispens´ avel da expertise jur´ ıdica no desenvolvimento de tais sistemas. Os resultados reforc¸am que a especializac¸˜ ao ´ e determinante para a qualidade jur´ ıdica: modelos treinados com base normativa e dogm´ atica, em dados curados por especialistas, produzem respostas mais corretas e confi´ aveis.
As contribuic¸ ˜ oes deste trabalho s˜ ao metodol´ ogicas, conceituais e pr´ aticas: • metodol´ ogica, ao propor um protocolo de avaliac¸˜ ao replic´ avel, que considera a estrutura do pensamento jur´ ıdico para a definic¸˜ ao e valorac¸˜ ao dos crit´ erios de avaliac¸˜ ao; • conceitual, ao demonstrar que a racionalidade jur´ ıdica pode ser considerada na construc¸˜ ao de crit´ erios de qualidade para sistemas de IA especializados no dom´ ınio; • pragm´ atica, ao demonstrar que, no momento atual da tecnologia, IAs especializadas superam enormemente IAs generalistas no dom´ ınio jur´ ıdico em portuguˆ es do Brasil. Trabalhos futuros incluem a ampliac¸˜ ao do conjunto de casos, bem como a integrac¸˜ ao de m´ etricas autom´ aticas que permitam escalar o experimento de forma mais robusta. Tamb´ em est´ a prevista a replicac¸˜ ao da metodologia com outras ferramentas especializadas, al´ em do Jus IA, incluindo LLMs open-source e modelos aplicados a diferentes jurisdic¸ ˜ oes. Por fim, prop˜ oe-se a evoluc¸˜ ao do ´ Indice de qualidade Jus IA como um benchmark p´ ublico e iterativo, contribuindo para pr´ aticas de governanc¸a respons´ avel na aplicac¸˜ ao da IA jur´ ıdica. Pretende-se com esse trabalho n˜ ao apenas comparar diferentes IAs em cen´ arios reais, mas principalmente estabelecer um protocolo de avaliac¸˜ ao aberto, sistem´ atico e reproduz´ ıvel para sistemas jur´ ıdicos baseados em inteligˆ encia artificial. Esperamos que o´ Indice Jus IA possa ser reutilizado em pesquisas futuras, acadˆ emicas ou industriais, de forma a padronizar as an´ alises deste dom´ ınio t˜ ao cr´ ıtico rumo ` a democratizac¸˜ ao e ` a integridade do uso da Inteligˆ encia Artificial no Direito. Ao oferecer uma metodologia aberta, replic´ avel e ancorada em crit´ erios jur´ ıdicos, o estudo busca contribuir para pr´ aticas mais transparentes de avaliac¸˜ ao e para o fortalecimento de uma governanc¸a p´ ublica da IA jur´ ıdica no Brasil. 6. Limitac¸˜ oes Apesar dos resultados expressivos e da validac¸˜ ao metodol´ ogica do protocolo Jus IA, o estudo apresenta algumas limitac¸ ˜ oes que devem ser reconhecidas. Em primeiro lugar, o n´ umero de casos e de intenc¸ ˜ oes de uso avaliados foi limitado a quinze situac¸ ˜ oes, o que restringe a generalizac¸˜ ao dos achados a outros tipos de tarefa jur´ ıdica. Al´ em disso, o experimento concentrou-se exclusivamente no contexto brasileiro, utilizando corpora normativos e doutrin´ arios nacionais. Novos experimentos s˜ ao necess´ arios para confirmar a aplicabilidade do protocolo Jus IA em outras jurisdic¸ ˜ oes ou sistemas jur´ ıdicos de tradic¸˜ ao distinta. Este estudo foi realizado em setembro de 2025; portanto, evoluc¸ ˜ oes de cada um dos sistemas de IA depois desta data n˜ ao poderiam ser consideradas. Outro ponto relevante diz respeito ` a dependˆ encia da avaliac¸˜ ao humana. Embora o experimento tenha levado em considerac¸˜ ao estrat´ egias para a mitigac¸˜ ao da subjetividade da avaliac¸˜ ao humana, como o cegamento duplo e a randomizac¸˜ ao da ordem dos textos avaliados, a interpretac¸˜ ao dos avaliadores continua sujeita a variac¸ ˜ oes subjetivas pr´ oprias da pr´ atica jur´ ıdica.
Por fim, esse estudo limitou-se a investigar a performance de LLMs propriet´ arias e de larga escala considerando o prop´ osito maior do trabalho: avaliar os modelos estado da arte generalistas em comparac¸˜ ao a um modelo robusto de dom´ ınio. A avaliac¸˜ ao da performance de modelos pequenos (small models) ou modelos abertos para as mesmas tarefas permanece um trabalho futuro. 7. Declarac¸˜ ao ´ Etica Este trabalho seguiu princ´ ıpios ´ eticos em todas as etapas de coleta, tratamento e an´ alise dos dados. As interac¸˜ oes utilizadas foram previamente tratadas em conformidade com a Lei Geral de Protec¸˜ ao de Dados (Lei nº 13.709/2018) e integralmente anonimizadas, de modo que nenhuma informac¸˜ ao pessoal ou identific´ avel estivesse dispon´ ıvel aos sistemas avaliados ou ` as pessoas avaliadoras. Os 48 profissionais participantes foram convidados individualmente, informados sobre o objetivo geral da pesquisa (avaliar respostas para perguntas de cunho jur´ ıdico), mas n˜ ao foram instru´ ıdos sobre a gerac¸˜ ao autom´ atica das respostas, nem tiveram acesso a quais modelos geraram quais respostas. Os profissionais aceitaram participar dessa pesquisa de forma volunt´ aria e confidencial. Para reconhecer o tempo e a contribuic¸˜ ao t´ ecnica despendida, os avaliadores foram devidamente remunerados. Este estudo foi realizado por profissionais ligados ` a Jusbrasil. Para assegurar a idoneidade da pesquisa, o protocolo experimental seguiu boas pr´ aticas de pesquisa envolvendo julgamento humano, incluindo cegamento duplo, randomizac¸˜ ao das respostas, padronizac¸˜ ao das instruc¸ ˜ oes e avaliac¸˜ ao das respostas exatamente como foram geradas por cada um dos sistemas, assegurando neutralidade e equidade no processo avaliativo. A presente pesquisa foi intencionalmente realizada de forma transdisciplinar, conduzida por profissionais com background em Direito, Ciˆ encias da Computac¸˜ ao, Neg´ ocios e Lingu´ ıstica. 8. Agradecimentos Gostar´ ıamos de expressar nossa sincera gratid˜ ao a Ana Beatriz Machado, Ana Rita Nascimento, Bruna Bueno, Carolina Santos, Cl´ evia Cristina, Luana Limas, Ludmila Dutra, Luiz Azevedo, Luiza Galuppo, Marcus Nascimento, Mohara Coimbra, Rafael Galassi, Ra´ ıra Cavalcanti, Pedro H. Oliveira, bem como aos diversos times e ´ areas do Jusbrasil pela valiosa contribuic¸˜ ao ao desenvolvimento deste estudo. Seu envolvimento foi essencial para a estruturac¸˜ ao do dataset, a definic¸˜ ao dos crit´ erios de avaliac¸˜ ao, a revis˜ ao metodol´ ogica, e seu comprometimento com a qualidade e a colaborac¸˜ ao teve impacto direto nos resultados aqui apresentados. Apˆ endice A – Question´ ario de Avaliac¸˜ ao Este apˆ endice apresenta o conjunto de quest˜ oes utilizadas no formul´ ario de avaliac¸˜ ao aplicado ao estudo descrito neste artigo. As perguntas foram elaboradas com o objetivo de verificar os crit´ erios corretude,completude,confiabilidade efluidez. Cada item busca capturar aspectos espec´ ıficos da fundamentac¸˜ ao jur´ ıdica, da contextualizac¸˜ ao temporal dos precedentes e da transparˆ encia argumentativa.
O formul´ ario foi estruturado para permitir respostas categ´ oricas (SIM, N ˜ AO, N/A), acompanhadas de justificativas quando necess´ ario (campo “Observac¸ ˜ oes”), facilitando tanto a replicabilidade do processo quanto a an´ alise estat´ ıstica dos resultados. A seguir, s˜ ao listadas as quest˜ oes que comp˜ oem o instrumento de avaliac¸˜ ao. • Correc¸˜ ao jur´ ıdica e f´ atica 1. Sem erro jur´ ıdico ou f´ atico? Avalia se a resposta preserva a veracidade dos fatos e a correc¸˜ ao dos argumentos jur´ ıdicos utilizados. Considerase que todas as proposic¸ ˜ oes est˜ ao corretas (ex.: sem interpretac¸ ˜ oes ou par´ afrases equivocadas, sem confundir tese do tribunal com argumento de parte e sem trocar instˆ ancias). SIM = todas as proposic¸ ˜ oes est˜ ao corretas. N˜ AO = existe pelo menos uma proposic¸˜ ao errada. 2. As referˆ encias normativas e jurisprudenciais apresentadas s˜ ao todas verdadeiras (sem alucinac¸˜ ao)? Todas as leis, artigos, s´ umulas, ac´ ord˜ aos ou regras processuais citadas existem de fato e foram usadas corretamente, sem invenc¸˜ ao ou distorc¸˜ ao do seu sentido original. SIM = todas as referˆ encias s˜ ao verdadeiras, ou seja, n˜ ao houve alucinac¸˜ ao. N˜ AO = houve pelo menos uma alucinac¸˜ ao de norma ou jurisprudˆ encia. N/A = n˜ ao h´ a citac¸˜ ao de norma ou jurisprudˆ encia. 3. A jurisdic¸ ˜ ao e a hierarquia est˜ ao corretas? As normas e precedentes usados s˜ ao da jurisdic¸˜ ao solicitada e respeitam a hierarquia (tribunais superiores acima dos locais). SIM = est˜ ao corretos. N˜ AO = n˜ ao respeitam a jurisdic¸˜ ao solicitada ou a hierarquia. N/A = n˜ ao foram citadas normas ou precedentes. • Completude (estrutura e aderˆ encia) 4. A resposta atendeu ` as instruc¸ ˜ oes do usu´ ario? Avalia se o conte´ udo cobre tema, escopo, perguntas espec´ ıficas, restric¸ ˜ oes e formato solicitado; ainda que a resposta final seja contr´ aria ao resultado desejado pelo usu´ ario (ex.: usu´ ario pedir, por exemplo, jurisprudˆ encia que n˜ ao existe e a resposta ser: n˜ ao encontramos decis˜ oes nesse sentido). SIM = todas as instruc¸ ˜ oes e/ou perguntas foram atendidas. N˜ AO = existe pelo menos uma instruc¸˜ ao ou pergunta ignorada. 5. A pec¸a tem estrutura completa? Inclui: cabec¸alho/qualificac¸˜ ao (partes, ju´ ızo), fatos, fundamentac¸˜ ao, pedidos e fechamento (local/data/assinatura, quando aplic´ avel). SIM = a estrutura est´ a completa. N˜ AO = falta pelo menos uma parte obrigat´ oria da estrutura. N/A = n˜ ao se trata de pec¸a. • Confiabilidade 6. Cada afirmac¸˜ ao jur´ ıdica trouxe referˆ encia ` a fonte verific´ avel? Toda proposic¸˜ ao jur´ ıdica tem citac¸˜ ao imediata que a sustente. –SIM = todas as afirmac¸ ˜ oes tˆ em fonte (lei, precedente ou doutrina) verific´ avel.
–N˜ AO = h´ a pelo menos uma afirmac¸˜ ao sem referˆ encia ou que a fonte n˜ ao foi encontrada. 7. As fontes usadas s˜ ao prim´ arias/oficiais? Preferˆ encia por lei, decis˜ ao ou s´ umula oficial. Evitar fontes secund´ arias: artigos, not´ ıcias ou citac¸ ˜ oes sem link que n˜ ao podem ser verificadas. –SIM = as fontes s˜ ao prim´ arias e/ou oficiais. –N˜ AO = h´ a pelo menos uma fonte secund´ aria. –N/A = n˜ ao foram referenciadas as fontes usadas. 8. A citac¸˜ ao sustenta exatamente o que foi afirmado? O trecho citado realmente confirma a proposic¸˜ ao (sem distorc¸ ˜ oes, sem precedente contr´ ario ou superado). –SIM = todas as citac¸ ˜ oes sustentam o afirmado. –N˜ AO = h´ a pelo menos uma citac¸˜ ao que n˜ ao sustenta o que foi afirmado. –N/A = n˜ ao h´ a citac¸ ˜ oes. 9. H´ a jurisprudˆ encia recente (´ ultimos 5 anos)? Pelo menos 1 precedente relevante ≤5 anos ou justificativa v´ alida se apenas precedente mais antigo. SIM = h´ a precedente recente ou justificativa v´ alida. N˜ AO = s´ o h´ a precedentes antigos sem justificativa. N/A = n˜ ao h´ a citac¸˜ ao de precedentes ou a citac¸˜ ao n˜ ao ´ e verific´ avel. • Fluidez da linguagem (clareza/forma) 10. Precis˜ ao e concis˜ ao O texto transmite a ideia de forma simples e direta, sem redundˆ ancias, coloquialismos, adjetivos desnecess´ arios ou termos vagos (“parece que”, “talvez”) quando existe regra clara. SIM = ´ e integralmente claro, conciso e bem estruturado. N˜ AO = tem pelo menos um trecho confuso, repetitivo ou impreciso. • Observac¸ ˜ oes Referˆ encias [Ashley 2017] Ashley, K. D. (2017). Artificial Intelligence and Legal Analytics: New Tools for Law Practice in the Digital Age. Cambridge University Press, Cambridge. [Bench-Capon and Sartor 2003] Bench-Capon, T. J. M. and Sartor, G. (2003). A model of legal reasoning with cases incorporating theories and values. Artificial Intelligence, 150(1-2):97–143. [Caseli and Nunes 2024] Caseli, H. M. and Nunes, M. G. V., editors (2024). Processamento de Linguagem Natural: Conceitos, T´ ecnicas e Aplicac¸ ˜ oes em Portuguˆ es. BPLN, 3 edition. [Chen et al. 2024] Chen, G. H., Chen, S., Liu, Z., Jiang, F., and Wang, B. (2024). Humans or LLMs as the judge? A study on judgement bias. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. [Dahn and Herrmannova 2025] Dahn, M. and Herrmannova, D. (2025). Thomson Reuters best practices for benchmarking AI for legal research. [Dworkin 1986] Dworkin, R. (1986). Law’s Empire. Harvard University Press, Cambridge, MA.
[Friedman 1937] Friedman, M. (1937). The use of ranks to avoid the assumption of normality implicit in the analysis of variance. Journal of the American Statistical Association, 32(200):675–701. [Gadamer 1960] Gadamer, H.-G. (1960). Wahrheit und Methode. Mohr Siebeck, T¨ ubingen. [Gao et al. 2024] Gao, M., Hu, X., Ruan, J., Pu, X., and Wan, X. (2024). LLM-based NLG evaluation: Current status and challenges. [Hart 1961] Hart, H. L. A. (1961). The Concept of Law. Clarendon Press, Oxford. [Heller 2024] Heller, J. (2024). Legal AI benchmarking: CoCounsel – from code to courtroom: The meticulous testing of CoCounsel’s professional-grade AI. Thomson Reuters Institute. [Krippendorff 2006] Krippendorff, K. (2006). Reliability in content analysis: Some common misconceptions and recommendations. Human Communication Research, 30(3):411–433. [Li et al. 2025] Li, H., Ye, J., Hu, Y., Chen, J., Ai, Q., Wu, Y., Chen, J., Chen, Y., Luo, C., Zhou, Q., and Liu, Y. (2025). CaseGen: A benchmark for multi-stage legal case documents generation. [Luhmann 1993] Luhmann, N. (1993). Das Recht der Gesellschaft. Suhrkamp, Frankfurt am Main. [Magesh et al. 2025] Magesh, V., Surani, F., Dahl, M., Suzgun, M., Manning, C. D., and Ho, D. E. (2025). Hallucination-free? Assessing the reliability of leading AI legal research tools. Journal of Empirical Legal Studies, 22(2):216–242. [Mullick et al. 2022] Mullick, A., Nandy, A., Kapadnis, M. N., Patnaik, S., Raghav, R., and Kar, R. (2022). An evaluation framework for legal document summarization. [Nemenyi 1963] Nemenyi, P. (1963). Distribution-free multiple comparisons. Phd thesis, Princeton University. [Park et al. 2025] Park, M., Oh, H., Choi, E., and Hwang, W. (2025). LRAGE: Legal Retrieval Augmented Generation Evaluation tool. [Pires et al. 2025] Pires, R., Junior, R. M., and Nogueira, R. (2025). Automatic legal writing evaluation of LLMs. [Posner and Saran 2025] Posner, E. A. and Saran, S. (2025). Judge ai: Assessing large language models in judicial decision-making. Research Paper 25-03, University of Chicago Coase-Sandor Institute for Law & Economics. [Rosenoff et al. 2025] Rosenoff, D., Chatelain, E., Ganguru, V., Kottapuzhackal, S., Miracle, E., and Mohanraj, A. (2025). Enhancing generative AI evaluation with synthetic raters. In Proceedings of Haystack US 2025. [Su et al. 2025] Su, W., Yue, B., Ai, Q., Hu, Y., Li, J., Wang, C., Zhang, K., Wu, Y., and Liu, Y. (2025). JuDGE: Benchmarking judgment document generation for Chinese legal system. In Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR ’25). ACM. [Xu and Ashley 2023] Xu, H. and Ashley, K. (2023). A question-answering approach to evaluating legal summaries. arXiv preprint arXiv:2309.15016.