
Le PDG de Perplexity, Aravind Srinivas, est monté sur scène au Computex 2026 à Taipei le 2 juin aux côtés du PDG d'Intel, Lip-Bu Tan, pour annoncer ce que l'entreprise appelle le premier orchestrateur d'inférence hybride local-serveur. Le système, qui sera intégré à Perplexity Computer en juillet, décide automatiquement quelles parties d'une tâche d'IA doivent être exécutées sur votre machine et quelles parties doivent être acheminées vers des modèles plus puissants dans le cloud, sans vous demander de choisir.
« Aujourd'hui, nous annonçons la prochaine étape pour l'ordinateur personnel : le premier orchestrateur d'inférence hybride local-serveur », a annoncé Perplexity. « Il décide quel travail doit être exécuté sur votre appareil et quel travail doit être envoyé aux agents cloud, acheminant automatiquement chaque partie d'une tâche au bon endroit »
« L'objectif juste pour un système d'IA est de fournir la plus grande valeur de jeton par watt, pour chaque utilisateur », a écrit Perplexity dans l'annonce officielle. Trois pressions concurrentes rendent cela difficile : la précision exige les modèles les plus performants, la confidentialité exige que certaines données ne quittent jamais votre machine, et le coût exige que vous ne dépensiez pas les ressources informatiques d'un modèle de pointe pour une tâche qu'un modèle plus petit peut gérer.
La solution que Perplexity appelle « inférence agencielle hybride » répond aux trois points à la fois. Un modèle compact s'exécute localement sur votre appareil et agit comme un aiguilleur, déterminant quelles informations sont suffisamment sensibles pour rester locales et quelles tâches nécessitent toute la puissance d'un modèle de pointe basé sur le cloud.
« L'inférence agencielle hybride est destinée au travail qui inclut des données sensibles mais qui nécessite une IA puissante. Des choses comme les dossiers financiers, les informations de santé et les fichiers personnels », a expliqué l'entreprise. « Le modèle compact s'exécute localement sur votre appareil pour déterminer quand les données sensibles doivent également être conservées localement. Pendant ce temps, le travail qui nécessite toutes les capacités d'un modèle de pointe s'exécute sur le serveur. »
Devriez-vous vous en soucier ?
L'inférence – le processus d'exécution d'un modèle d'IA entraîné pour générer une réponse – est le travail computationnel qui se produit chaque fois que vous envoyez une invite à un chatbot. À l'heure actuelle, la quasi-totalité de ce travail a lieu sur des serveurs distants appartenant à des entreprises d'IA. Cela signifie que vos documents financiers, vos requêtes de santé et vos notes privées voyagent vers l'ordinateur de quelqu'un d'autre avant que vous ne receviez une réponse.
C'est pourquoi vous voyez des modes « Auto » ou des modes de « faible réflexion » sur votre chatbot. Les entreprises d'IA essaieront toujours de forcer les utilisateurs à acheminer les interactions dans le mode le moins cher possible pour elles.
Srinivas a été direct à ce sujet. Lors d'une interview télévisée sur Bloomberg à Computex, il a dit ouvertement : « Vous ne voulez pas que tout votre calcul soit centralisé sur des serveurs et que tout passe par les plus grands modèles. Certaines personnes dépensent un demi-milliard de dollars par mois. Ce que vous voulez réellement, c'est une valeur efficace par watt et par utilisateur. » Le déchargement du travail d'inférence vers le matériel de l'utilisateur réduit ces coûts – pour Perplexity.
L'inférence locale est la meilleure pour ces entreprises car elle réduit considérablement les coûts, mais elle présente un avantage majeur pour les utilisateurs d'IA : elle conserve ces données sur votre machine. Le compromis a toujours été la puissance : les modèles plus petits qui s'exécutent localement sont moins performants que les grands modèles hébergés dans des centres de données.
L'orchestrateur de Perplexity essaie d'obtenir les deux. Les tâches simples – résumer un document que vous avez déjà écrit, formater du texte, classification légère – s'exécutent localement. Le raisonnement complexe est acheminé vers le cloud, idéalement sans les parties sensibles de votre tâche. L'entreprise affirme que cela se produit automatiquement, en cours de tâche, de manière invisible pour l'utilisateur. La fiabilité de ce routage en pratique par rapport à ce qu'il semble lors d'une démo Computex est une question à laquelle le déploiement de juillet répondra.
Une clarification s'impose : Perplexity ne met pas à disposition un modèle local open source que vous contrôlez. Le composant local est un modèle compact que Perplexity déploie dans le cadre de son application. Le composant cloud transite toujours par les serveurs de Perplexity. Les utilisateurs qui souhaitent une configuration entièrement hors ligne et auto-hébergée – du type de celles offertes par des projets comme MiniCPM5-1B – ne la trouveront pas ici.
Ces chiffres donnent un contexte à cette approche. Les revenus de Perplexity sont passés de 100 millions à 500 millions de dollars tandis que les effectifs n'ont augmenté que de 34 %, a annoncé Srinivas en avril. Une entreprise qui achemine des requêtes vers des modèles qu'elle ne forme pas a de fortes incitations à maintenir les coûts de calcul aussi bas que possible. Le fait de transférer une partie de la charge d'inférence vers les appareils des utilisateurs – des milliards de PC déjà en circulation – est un moyen efficace d'y parvenir. L'argument de la confidentialité est réel, mais il s'aligne opportunément avec l'argument financier.
Qui d'autre le fait ?
Tous les acteurs majeurs de l'IA s'orientent actuellement vers l'inférence sur appareil ou hybride. Apple Intelligence exécute ses traitements les plus sensibles localement sur les puces de la série M. Foundry Local de Microsoft a atteint la disponibilité générale en avril 2026, permettant une inférence IA complète sur Windows, macOS et Linux sans dépendance au cloud.
Nvidia a annoncé RTX Spark au même Computex où Perplexity a fait son annonce, ciblant l'inférence LLM locale sur les ordinateurs portables et de bureau. L'approche de Google, comme l'a rapporté Decrypt, a été plus controversée : Chrome installait silencieusement un modèle Gemini Nano de 4 Go sans le consentement de l'utilisateur, et le bouton « Mode IA » que la plupart des utilisateurs voient réellement ne l'utilise même pas.
La différenciation de Perplexity réside dans la couche d'orchestration. Plutôt que de demander aux utilisateurs de choisir entre le local et le cloud, le système décide par tâche, en temps réel. Srinivas a déclaré que l'approche est « agnostique aux puces » – la démo Computex a été exécutée sur des Intel Core Ultra Series 3, mais les processeurs Nvidia sont également pris en charge. Cette fonctionnalité est actuellement exclusive à l'application Perplexity pour PC Windows, avec un calendrier de déploiement plus large non encore confirmé.