
CEO của Perplexity, Aravind Srinivas, đã lên sân khấu tại Computex 2026 ở Đài Bắc vào ngày 2 tháng 6 cùng với CEO của Intel, Lip-Bu Tan, để công bố cái mà công ty gọi là bộ điều phối suy luận lai cục bộ-máy chủ đầu tiên. Hệ thống này, sẽ có mặt trên Perplexity Computer vào tháng 7, tự động quyết định phần nào của một tác vụ AI sẽ chạy trên máy của bạn và phần nào sẽ được chuyển đến các mô hình mạnh mẽ hơn trên đám mây—mà không yêu cầu bạn phải chọn.
“Hôm nay chúng tôi công bố bước tiếp theo cho Máy tính Cá nhân: bộ điều phối suy luận lai cục bộ-máy chủ đầu tiên,” Perplexity thông báo. “Nó quyết định công việc nào nên chạy trên thiết bị của bạn và công việc nào nên chuyển đến các tác nhân đám mây, tự động định tuyến mỗi phần của một tác vụ đến đúng nơi.”
"Mục tiêu đúng đắn cho một hệ thống AI là cung cấp giá trị token trên mỗi watt cao nhất cho mỗi người dùng," Perplexity viết trong thông báo chính thức. Ba áp lực cạnh tranh khiến điều đó trở nên khó khăn: độ chính xác đòi hỏi các mô hình mạnh nhất, quyền riêng tư đòi hỏi một số dữ liệu không bao giờ rời khỏi máy của bạn, và chi phí đòi hỏi bạn không lãng phí tài nguyên tính toán của một mô hình tiên tiến vào một tác vụ mà một mô hình nhỏ hơn có thể xử lý.
Giải pháp mà Perplexity gọi là "suy luận tác nhân lai" giải quyết cả ba vấn đề cùng một lúc. Một mô hình nhỏ gọn chạy cục bộ trên thiết bị của bạn và hoạt động như một cảnh sát giao thông—xác định thông tin nào đủ nhạy cảm để giữ lại cục bộ và tác vụ nào cần sức mạnh đầy đủ của một mô hình tiên tiến dựa trên đám mây.
"Suy luận tác nhân lai dành cho công việc bao gồm dữ liệu nhạy cảm nhưng cần AI mạnh mẽ. Những thứ như hồ sơ tài chính, thông tin sức khỏe và tệp cá nhân," công ty giải thích. "Mô hình nhỏ gọn chạy cục bộ trên thiết bị của bạn để xác định khi nào dữ liệu nhạy cảm cũng nên được giữ cục bộ. Trong khi đó, công việc cần khả năng đầy đủ của một mô hình tiên tiến sẽ chạy trên máy chủ."
Bạn có nên quan tâm không?
Suy luận—quá trình chạy một mô hình AI được đào tạo để tạo ra phản hồi—là công việc tính toán xảy ra mỗi khi bạn gửi một lời nhắc đến một chatbot. Hiện tại, gần như tất cả đều diễn ra trên các máy chủ từ xa thuộc sở hữu của các công ty AI. Điều đó có nghĩa là các tài liệu tài chính, các truy vấn sức khỏe và ghi chú riêng tư của bạn sẽ được chuyển đến máy tính của người khác trước khi bạn nhận được câu trả lời.
Đây là lý do tại sao bạn thấy chế độ "Tự động" hoặc chế độ "ít suy nghĩ" trên chatbot của mình. Các công ty AI sẽ luôn cố gắng buộc người dùng định tuyến các tương tác theo chế độ rẻ nhất có thể cho họ.
Srinivas đã rất thẳng thắn về điều này. Trong một cuộc phỏng vấn trên Bloomberg Television tại Computex, ông đã nói thẳng ra: "Bạn không muốn tất cả các tính toán của mình tập trung vào các máy chủ và mọi thứ chạy qua các mô hình lớn nhất. Một số người đang chi nửa tỷ đô la mỗi tháng. Điều bạn thực sự muốn là giá trị hiệu quả trên mỗi watt cho mỗi người dùng." Chuyển công việc suy luận sang phần cứng của người dùng sẽ giảm các chi phí đó—cho Perplexity.
Suy luận cục bộ là tốt nhất cho các công ty đó vì nó cắt giảm nhiều chi phí, nhưng lại có một điểm lợi lớn cho người dùng AI: Nó giữ dữ liệu đó trên máy của bạn. Sự đánh đổi luôn là sức mạnh: các mô hình nhỏ hơn chạy cục bộ kém khả năng hơn so với các mô hình lớn nằm trong trung tâm dữ liệu.
Bộ điều phối của Perplexity cố gắng đạt được cả hai. Các tác vụ đơn giản—tóm tắt một tài liệu bạn đã viết, định dạng văn bản, phân loại nhẹ—chạy cục bộ. Suy luận phức tạp được chuyển đến đám mây, lý tưởng là không kèm theo các phần nhạy cảm của tác vụ của bạn. Công ty cho biết điều này xảy ra tự động, giữa tác vụ, người dùng không nhận thấy. Liệu việc định tuyến có đáng tin cậy trong thực tế như trong bản demo tại Computex hay không là một câu hỏi mà đợt ra mắt vào tháng 7 sẽ trả lời.
Một điều đáng làm rõ: đây không phải là Perplexity cung cấp một mô hình cục bộ mã nguồn mở mà bạn kiểm soát. Thành phần cục bộ là một mô hình nhỏ gọn mà Perplexity triển khai như một phần của ứng dụng. Thành phần đám mây vẫn được định tuyến qua các máy chủ của Perplexity. Người dùng muốn một thiết lập hoàn toàn ngoại tuyến, tự lưu trữ—loại mà các dự án như MiniCPM5-1B cung cấp—sẽ không tìm thấy ở đây.
Các con số mang lại ngữ cảnh cho việc định hình này. Doanh thu của Perplexity tăng từ 100 triệu USD lên 500 triệu USD trong khi số lượng nhân viên chỉ tăng 34%, Srinivas công bố vào tháng 4. Một công ty định tuyến các truy vấn qua các mô hình mà họ không đào tạo có động lực mạnh mẽ để giữ chi phí tính toán thấp nhất có thể. Chuyển một phần gánh nặng suy luận sang thiết bị của người dùng—hàng tỷ PC đã lưu hành—là một cách hiệu quả để làm điều đó. Lời hứa về quyền riêng tư là có thật, nhưng nó cũng phù hợp thuận tiện với lợi ích tài chính.
Ai khác đang làm điều này
Mọi người chơi lớn trong AI đều đang hướng tới suy luận trên thiết bị hoặc lai vào thời điểm hiện tại. Apple Intelligence chạy xử lý nhạy cảm nhất của mình cục bộ trên các chip dòng M. Foundry Local của Microsoft đã đạt được tính khả dụng chung vào tháng 4 năm 2026, cho phép suy luận AI hoàn chỉnh trên Windows, macOS và Linux mà không phụ thuộc vào đám mây.
Nvidia đã công bố RTX Spark tại cùng Computex nơi Perplexity đưa ra thông báo của mình, nhắm mục tiêu suy luận LLM cục bộ trên máy tính xách tay và máy tính để bàn. Cách tiếp cận của Google, như *Decrypt* đã báo cáo, đã gây nhiều tranh cãi hơn—Chrome đã âm thầm cài đặt một mô hình Gemini Nano 4GB mà không có sự đồng ý của người dùng, và nút "Chế độ AI" mà hầu hết người dùng thực sự thấy thậm chí không sử dụng nó.
Sự khác biệt của Perplexity là lớp điều phối. Thay vì yêu cầu người dùng chọn cục bộ hay đám mây ngay từ đầu, hệ thống sẽ quyết định theo từng tác vụ, trong thời gian thực. Srinivas cho biết cách tiếp cận này là "không phụ thuộc vào chip"—bản demo tại Computex chạy trên Intel Core Ultra Series 3, nhưng bộ vi xử lý Nvidia cũng được hỗ trợ. Tính năng này hiện độc quyền cho ứng dụng Perplexity dành cho Windows PC, với lộ trình triển khai rộng rãi hơn chưa được xác nhận.