
O CEO da Perplexity, Aravind Srinivas, subiu ao palco na Computex 2026 em Taipei, em 2 de junho, ao lado do CEO da Intel, Lip-Bu Tan, para anunciar o que a empresa chama de primeiro orquestrador de inferência híbrido local-servidor. O sistema, que chegará ao Perplexity Computer em julho, decide automaticamente quais partes de uma tarefa de IA executar em sua máquina e quais partes são roteadas para modelos mais poderosos na nuvem—sem que você precise escolher.
“Hoje estamos anunciando o próximo passo para o Computador Pessoal: o primeiro orquestrador de inferência híbrido local-servidor”, anunciou a Perplexity. “Ele decide qual trabalho deve ser executado no seu dispositivo e qual trabalho deve ir para os agentes da nuvem, roteando automaticamente cada parte de uma tarefa para o lugar certo”
"O objetivo certo para um sistema de IA é entregar o maior valor de token por watt, para cada usuário", escreveu a Perplexity no anúncio oficial. Três pressões concorrentes tornam isso difícil: a precisão exige os modelos mais capazes, a privacidade exige que alguns dados nunca saiam de sua máquina, e o custo exige que você não gaste os recursos computacionais de um modelo de fronteira em uma tarefa que um menor pode lidar.
A solução que a Perplexity chama de "inferência agêntica híbrida" aborda todos os três pontos de uma vez. Um modelo compacto é executado localmente no seu dispositivo e atua como um "agente de tráfego"—determinando qual informação é sensível o suficiente para permanecer local e quais tarefas precisam do poder total de um modelo de fronteira baseado na nuvem.
"A inferência agêntica híbrida é para trabalhos que incluem dados sensíveis, mas que necessitam de IA poderosa. Coisas como registros financeiros, informações de saúde e arquivos pessoais", explicou a empresa. "O modelo compacto é executado localmente no seu dispositivo para determinar quando os dados sensíveis também devem ser mantidos localmente. Enquanto isso, o trabalho que precisa da capacidade total de um modelo de fronteira é executado no servidor."
Você deveria se importar com isso?
Inferência—o processo de executar um modelo de IA treinado para gerar uma resposta—é o trabalho computacional que ocorre toda vez que você envia um prompt para um chatbot. Atualmente, quase tudo isso acontece em servidores remotos de propriedade de empresas de IA. Isso significa que seus documentos financeiros, consultas de saúde e anotações privadas viajam para o computador de outra pessoa antes que você receba uma resposta.
É por isso que você vê modos “Automático” ou modos de “pouco pensamento” em seu chatbot. As empresas de IA sempre tentarão forçar os usuários a rotear as interações no modo mais barato possível para elas.
Srinivas foi direto sobre isso. Em uma entrevista à Bloomberg Television na Computex, ele disse abertamente: "Você não quer toda a sua computação centralizada em servidores e tudo rodando pelos maiores modelos. Algumas pessoas estão gastando meio bilhão de dólares por mês. O que você realmente quer é valor eficiente por watt por usuário." Descarregar o trabalho de inferência para o hardware do usuário reduz essas contas—para a Perplexity.
A inferência local é a melhor para essas empresas, pois reduz muitos custos, mas tem um ponto importante a favor dos usuários de IA: ela mantém os dados em sua máquina. A contrapartida sempre foi o poder: modelos menores que rodam localmente são menos capazes do que os grandes que vivem em centros de dados.
O orquestrador da Perplexity tenta obter ambos. Tarefas simples—resumir um documento que você já escreveu, formatar texto, classificação leve—são executadas localmente. O raciocínio complexo é roteado para a nuvem, idealmente sem as partes sensíveis de sua tarefa anexadas. A empresa diz que isso acontece automaticamente, durante a tarefa, invisível para o usuário. Se o roteamento é tão confiável na prática quanto parece em uma demonstração da Computex é uma pergunta que o lançamento em julho responderá.
Uma clarificação que vale a pena fazer: isso não é a Perplexity distribuindo um modelo local de código aberto que você controla. O componente local é um modelo compacto que a Perplexity implementa como parte de seu aplicativo. O componente em nuvem ainda é roteado através dos servidores da Perplexity. Usuários que desejam uma configuração totalmente offline e auto-hospedada—o tipo que projetos como MiniCPM5-1B oferecem—não a encontrarão aqui.
Os números dão contexto a essa abordagem. A receita da Perplexity cresceu de US$ 100 milhões para US$ 500 milhões, enquanto o número de funcionários aumentou apenas 34%, anunciou Srinivas em abril. Uma empresa que roteia consultas entre modelos que não treina tem fortes incentivos para manter os custos de computação o mais baixos possível. Transferir parte da carga de inferência para os dispositivos dos usuários—bilhões de PCs já em circulação—é uma maneira eficiente de fazer isso. O argumento da privacidade é real, mas convenientemente se alinha com o financeiro.
Quem mais está fazendo isso
Todos os grandes players em IA estão atualmente avançando em direção à inferência no dispositivo ou híbrida. O Apple Intelligence executa seu processamento mais sensível localmente em chips da série M. O Foundry Local da Microsoft atingiu disponibilidade geral em abril de 2026, permitindo inferência completa de IA em Windows, macOS e Linux sem dependência da nuvem.
A Nvidia anunciou o RTX Spark na mesma Computex onde a Perplexity fez seu anúncio, visando a inferência local de LLM em laptops e desktops. A abordagem do Google, conforme relatado pelo Decrypt, tem sido mais controversa—o Chrome estava silenciosamente instalando um modelo Gemini Nano de 4GB sem o consentimento do usuário, e o botão "Modo IA" que a maioria dos usuários vê nem sequer o utiliza.
A diferenciação da Perplexity é a camada de orquestração. Em vez de pedir aos usuários para escolherem local ou nuvem antecipadamente, o sistema decide por tarefa, em tempo real. Srinivas disse que a abordagem é "agnóstica em relação ao chip"—a demonstração na Computex foi executada em Intel Core Ultra Série 3, mas processadores Nvidia também são suportados. O recurso é atualmente exclusivo para o aplicativo Perplexity para PC Windows, com um cronograma de lançamento mais amplo ainda não confirmado.





