Um estudo prospectivo de viabilidade clínica de uma IA de diagnóstico conversacional em uma clínica ambulatorial de atenção primária
14 de setembro de 2026

Durante anos, boa parte da discussão sobre inteligência artificial na medicina foi conduzida por uma pergunta relativamente simples: a IA consegue responder tão bem quanto um médico? Surgiram modelos capazes de superar provas médicas, resolver casos clínicos complexos e construir diagnósticos diferenciais impressionantes. Mas um comentário publicado hoje na Nature Medicine propõe uma mudança necessária nessa conversa:
Confiança em IA clínica não pode ser produzida por benchmarks. Ela precisa ser conquistada por meio de estudos prospectivos, realizados com pacientes reais, dentro de ambientes reais de assistência.
A frase é especialmente importante porque marca uma transição de maturidade do setor. A pergunta deixa de ser apenas se a IA sabe medicina e passa a ser se conseguimos incorporá-la à medicina de maneira segura, útil e confiável.
Um modelo pode obter excelente desempenho em questões de múltipla escolha, casos clínicos padronizados ou consultas simuladas e ainda assim fracassar quando encontra a imprevisibilidade de uma pessoa real. Pacientes interrompem a história, esquecem medicamentos, misturam sintomas, interpretam perguntas de maneiras diferentes, têm graus distintos de letramento em saúde e tecnologia e, naturalmente, carregam ansiedade para dentro da consulta. Além disso, o desempenho clínico de uma tecnologia não depende apenas da resposta que aparece na tela. Depende de como essa resposta chega ao paciente, como é incorporada ao fluxo assistencial, quem supervisiona o sistema, quais informações estavam disponíveis e o que acontece quando a IA erra. Essa talvez seja uma das principais mensagens do novo comentário da Nature Medicine: a unidade de avaliação precisa deixar de ser somente o modelo e começar a incluir o sistema de cuidado no qual ele está inserido.
O estudo prospectivo com o AMIE, o Articulate Medical Intelligence Explorer, oferece um excelente exemplo dessa mudança. Pesquisadores do Google, Google DeepMind, Beth Israel Deaconess Medical Center e Harvard Medical School avaliaram o sistema dentro de uma clínica de atenção primária em Boston. Cem pacientes adultos completaram uma conversa por texto com o AMIE até cinco dias antes de uma consulta de demanda aguda. O sistema realizava uma anamnese, construía hipóteses diagnósticas e apresentava possibilidades para serem discutidas posteriormente com o profissional. Noventa e oito pacientes completaram tanto a interação com a IA quanto a consulta médica e foram incluídos nas análises principais. Não se tratava mais de atores simulando pacientes. Eram pessoas reais entrando em um fluxo assistencial real.
O resultado que provavelmente chamará mais atenção é que nenhuma das cem interações precisou ser interrompida pelos médicos responsáveis pela supervisão de segurança. Esse número é relevante, mas precisa ser interpretado corretamente. Cada conversa estava sendo acompanhada em tempo real por um médico certificado em medicina interna, existiam critérios predefinidos para interrupção e havia uma conversa de revisão com o paciente ao final. Em três ocasiões, supervisores fizeram observações ou correções, embora nenhuma situação tenha atingido o critério formal de interrupção. Além disso, pacientes que necessitavam de atendimento emergencial haviam sido previamente triados, gestantes foram excluídas e queixas relacionadas à saúde mental também estavam fora do estudo. Portanto, o resultado não demonstra que uma IA médica possa atuar autonomamente com segurança. Demonstra algo diferente e igualmente importante: dentro de uma arquitetura cuidadosamente desenhada de supervisão, seleção de pacientes e governança, foi possível realizar cem interações sem necessidade de uma intervenção formal de segurança.
Os resultados diagnósticos também merecem atenção. Considerando o diagnóstico final estabelecido após oito semanas de acompanhamento dos prontuários, o AMIE incluiu a resposta final entre suas sete primeiras hipóteses em aproximadamente 90% dos casos. O diagnóstico estava entre as três primeiras hipóteses em 74,5% e ocupava a primeira posição em 56,1%. Quando médicos avaliadores compararam de forma cega os diagnósticos diferenciais e planos de manejo produzidos pela IA e pelos profissionais, não houve diferença estatisticamente significativa na qualidade global do diagnóstico diferencial, nem na adequação ou segurança dos planos. Houve, porém, duas diferenças relevantes: os médicos foram superiores na praticidade e na relação entre recursos utilizados e benefício esperado. Isso nos lembra que raciocínio clínico não é somente produzir possibilidades corretas. É decidir o que realmente deve ser feito naquele paciente, naquele sistema e naquele momento.
Existe ainda uma assimetria importante nessa comparação. O AMIE conversava por texto, sem acesso prévio ao prontuário eletrônico, sem exame físico e sem informações não verbais provenientes do encontro clínico. O médico, por outro lado, encontrava o paciente presencialmente ou por telemedicina, tinha acesso ao contexto assistencial e ainda podia receber o resumo produzido pelo próprio AMIE. Isso impede qualquer interpretação simplista de uma competição entre médico e máquina. O dado mais interessante talvez seja outro:
Mesmo operando com menos contexto, a IA conseguiu produzir informações suficientemente relevantes para contribuir com o encontro subsequente. A aplicação clínica mais imediata, portanto, pode estar menos em substituir a consulta e mais em preparar melhor aquilo que acontece dentro dela.
Em julho deste ano, a convite do Rafael Silva, head de investimentos da Unimed BH, pude acompanhar o lançamento de uma ferramenta de triagem e agendamento de consultas no Hóri Connect, desenvolvida em conjunto com Frederico Andrade, pela Cogfy.
Esse tipo de visão e entendimento aparece com muita força nos relatos dos profissionais. No estudo realizado pelo Google, médicos entrevistados descreveram uma mudança do encontro clínico da coleta de informações para a verificação das informações. Em vez de começar a consulta reconstruindo toda a história, poderiam validar dados previamente organizados e dedicar mais tempo à discussão, orientação e tomada compartilhada de decisão. Entre os profissionais que efetivamente conseguiram revisar o material previamente, 75% consideraram a preparação com o AMIE muito ou razoavelmente útil. Mas existe um dado menos chamativo e talvez ainda mais importante para quem trabalha com inovação: em 16 dos 60 questionários respondidos por profissionais, o médico não havia conseguido revisar o conteúdo antes da consulta. No estudo, o AMIE não estava integrado diretamente ao prontuário eletrônico. O conteúdo precisava percorrer um fluxo separado até chegar ao profissional. O modelo validado pela Unimed BH resolve esse problema, com uma integração mais eficaz no sistema eletrônico utilizado, servindo como um guia do paciente de ponta a ponta (da coleta da anamnese para a triagem até a consulta no "consultório digital", também apresentado pela Unimed BH ano passado, em evento que estive presente como painelista).
É exatamente nesse ponto que uma IA capaz de demonstrar desempenho extraordinário em laboratório pode se transformar em apenas mais uma etapa administrativa dentro da prática clínica. Tecnologia em saúde precisa ser avaliada também em segundos economizados, repetições evitadas, decisões facilitadas e fricções acrescentadas ao processo assistencial.
Há outro resultado particularmente interessante neste estudo: a confiança dos pacientes aumentou depois da experiência. As atitudes em relação à inteligência artificial, medidas antes da interação, depois da conversa com o AMIE e novamente após a consulta médica, tornaram-se significativamente mais positivas após o contato direto com o sistema. Ao mesmo tempo, a confiança estava longe de ser absoluta. Os próprios autores relatam preocupações sobre confidencialidade, confiabilidade e utilização da IA em situações complexas. Isso revela uma distinção essencial. Confiança não é uma variável estática que possa ser inferida a partir da acurácia do modelo. Ela é construída pela experiência. Um sistema pode ter 95% de desempenho em algum benchmark e ainda ser rejeitado pelos pacientes. Da mesma forma, uma tecnologia inicialmente recebida com desconfiança pode conquistar legitimidade quando demonstra utilidade, transparência e segurança na prática.
É por isso que considero particularmente acertado o conceito de infraestrutura de segurança apresentado por esse conjunto de trabalhos. A segurança do AMIE não estava apenas dentro do modelo. Ela estava no protocolo de inclusão, na triagem prévia, no consentimento, na supervisão médica em tempo real, nos critérios de interrupção, na revisão das conversas e no acompanhamento posterior. Isso muda profundamente a maneira como devemos pensar em IA clínica.
Perguntar se determinado modelo é seguro pode ser insuficiente. A pergunta mais correta é se determinado modelo, utilizado em determinado contexto, para determinada população e sob determinada estrutura de governança, produz um nível aceitável de risco e benefício.
Google e Included Health anunciaram um estudo prospectivo randomizado em escala nacional nos Estados Unidos para avaliar IA conversacional dentro de fluxos reais de cuidado virtual. O objetivo declarado é avançar além da viabilidade observada em um único centro e estudar capacidades, limitações, segurança e utilidade em uma população maior, distribuída por diferentes regiões e condições clínicas, utilizando comparação controlada com a prática assistencial. Passarão de cem pacientes acompanhados intensivamente em Boston para testar a tecnologia dentro de um sistema de saúde virtual de escala nacional.
Para quem lidera inovação em saúde, talvez essa seja a principal mudança de paradigma. Durante os últimos anos fomos inundados por demonstrações impressionantes, rankings, benchmarks e comparações entre modelos. Eles continuam importantes, mas pertencem apenas ao início da cadeia de evidências. Um sistema que pretende influenciar cuidado precisa atravessar outras etapas, como a validação prospectiva, estudo de workflow, avaliação de segurança, compreensão do comportamento humano, análise de vieses, governança, integração tecnológica e acompanhamento após implementação. Em outras palavras, o fato de uma IA conseguir produzir uma resposta clinicamente correta não significa automaticamente que ela produz uma intervenção clínica melhor.
No Brasil, essa discussão será ainda mais importante. Nossa diversidade populacional, diferenças regionais, assimetrias de acesso digital, heterogeneidade entre sistemas públicos e privados e fragmentação dos prontuários tornam perigosa qualquer tentativa de simplesmente importar resultados produzidos em um centro acadêmico norte-americano. Modelos médicos precisarão ser avaliados no contexto em que pretendemos utilizá-los. Evidência local não deve ser encarada como uma barreira burocrática à inovação. Ela é parte da própria inovação responsável.
Talvez, portanto, a descoberta mais importante desses trabalhos não seja que uma inteligência artificial conseguiu formular bons diagnósticos. Já sabíamos que modelos avançados eram capazes disso. A novidade está em começarmos a entender como essas tecnologias se comportam quando encontram o paciente, o médico, o prontuário, a agenda, a latência, o consentimento, o medo, a confiança e todas as imperfeições que constituem a medicina real.
Leia outros artigos

A inteligência artificial está transformando a medicina. Mas os hospitais estão preparados para assumir essa responsabilidade?
8 de outubro de 2026
Por que os funcionários resistem à IA e como as empresas podem conquistá-los
8 de julho de 2026
