InícioCentro de Notícias da LBank
Pesquisadores tentaram que a IA conduzisse a ciência. Falhou.
researchers-tried-letting-ai-do-science-it-failed
Pesquisadores tentaram que a IA conduzisse a ciência. Falhou.
Um estudo multi-institucional constatou que os agentes de IA de ponta atuais conseguiam lidar com a mecânica da pesquisa, mas falharam em produzir um trabalho original digno de aceitação em uma conferência de IA de alto nível.
2026-07-30 Fonte:decrypt.co

Em resumo

  • Pesquisadores testaram se agentes de IA de ponta poderiam conduzir pesquisa em IA de forma independente.
  • Os sistemas completaram tarefas de engenharia, mas falharam em produzir artigos dignos de aceitação em uma conferência de IA de alto nível.
  • O estudo identificou cinco modos de falha recorrentes que impediram a IA de produzir pesquisa publicável.

Um novo estudo descobriu que os agentes de IA de ponta atuais poderiam completar muitas das tarefas de engenharia necessárias para a pesquisa em IA, mas falharam em produzir trabalho original digno de aceitação em uma conferência de aprendizado de máquina de alto nível.

No estudo, "Agentes de IA podem conduzir pesquisa em IA de forma aberta?", publicado na quarta-feira, pesquisadores da Universidade de Princeton, do UK AI Security Institute, da Universidade de Stanford, da Universidade de Toronto e de várias organizações acadêmicas e de pesquisa avaliaram se agentes de IA de ponta poderiam conduzir pesquisa original em IA de forma independente.

“Responder a isso rigorosamente exige questões de pesquisa reais e não contaminadas que o agente não poderia memorizar de seus dados de treinamento ou encontrar online”, escreveram os pesquisadores. “Para satisfazer esses requisitos, contamos com pesquisa em IA de alta qualidade que não era pública no momento em que conduzimos os experimentos.”

Os pesquisadores forneceram aos agentes de IA as questões centrais de pesquisa de dois artigos não publicados do NeurIPS 2026, impedindo que os sistemas recuperassem respostas de dados de treinamento ou da web. Cada agente recebeu seis dias, milhares de dólares em créditos de API, recursos de GPU, acesso à internet e acesso a uma máquina virtual para produzir um artigo com qualidade de conferência. Os artigos resultantes foram então revisados pelos autores originais da pesquisa não publicada. Ambos foram rejeitados.

Os agentes completaram grande parte da engenharia necessária para a pesquisa, conduzindo revisões de literatura, depurando software, executando experimentos, gerenciando recursos de GPU e produzindo artigos acadêmicos completos sem intervenção humana. Mas os revisores concluíram que os sistemas falharam em gerar contribuições científicas originais dignas de publicação em uma conferência de aprendizado de máquina de alto nível.

Os autores afirmaram que sua avaliação mede melhor o raciocínio científico do que os benchmarks anteriores, porque testa problemas de pesquisa de final aberto em vez de tarefas predefinidas.

Os autores alertaram que o estudo examinou apenas dois projetos de pesquisa e reconheceram limitações, incluindo o pequeno tamanho da amostra e o fato de que os pesquisadores originais avaliaram os artigos gerados por IA. Eles disseram que os resultados sugerem que os atuais agentes de IA de ponta podem automatizar muitas das tarefas de engenharia envolvidas na pesquisa, mas continuam a ter dificuldades em gerar trabalho científico original.

O estudo surge enquanto pesquisadores continuam a descobrir comportamentos surpreendentes e, por vezes, arriscados em agentes de IA cada vez mais autônomos.

Em maio, pesquisadores da UC Riverside, Microsoft e Nvidia descobriram que agentes de IA frequentemente realizavam tarefas perigosas ou irracionais, enquanto permaneciam focados em completar seus objetivos. No início deste mês, a OpenAI revelou que um de seus agentes de IA de ponta escapou do confinamento e invadiu o Hugging Face enquanto tentava trapacear em um benchmark de cibersegurança. Esta semana, a empresa revelou que o agente também havia acessado quatro serviços online adicionais.