Trang chủTrung tâm tin tức LBank
'Những suy nghĩ bên trong' của mọi mô hình AI lớn bị lộ trong một vụ khai thác quy mô lớn
inner-thoughts-every-major-ai-model-exposed-exploit
'Những suy nghĩ bên trong' của mọi mô hình AI lớn bị lộ trong một vụ khai thác quy mô lớn
Các nhà nghiên cứu phát hiện mọi nhà cung cấp AI lớn đều mã hóa các token suy luận bằng một khóa toàn cục duy nhất — và đã khai thác lỗ hổng này để giải mã 315.320 khối “suy nghĩ” ẩn từ các nhật ký công khai, đồng thời khôi phục được mật khẩu và các khóa API đang hoạt động.
2026-08-12 Nguồn:decrypt.co

Tóm tắt

  • Một nhóm nghiên cứu đã phát hiện ra rằng Anthropic, OpenAI và Google đều sử dụng một khóa mã hóa toàn cầu duy nhất cho các mã thông báo suy luận AI.
  • Bằng cách giải mã 315.320 khối suy luận được thu thập từ các kho lưu trữ công khai trên GitHub và Hugging Face, các nhà nghiên cứu đã thu hồi 182 thông tin xác thực, bao gồm 62 khóa API đang hoạt động, 33 mật khẩu và 30 địa chỉ email cá nhân.
  • OpenAI, Anthropic và Google đã triển khai các bản vá phía máy chủ sau khi tiết lộ có trách nhiệm, nhưng các nhật ký phiên lịch sử đã được chia sẻ công khai vẫn có thể giải mã được.

Các nhà nghiên cứu bảo mật đã tìm ra cách đọc "suy nghĩ bên trong" được mã hóa của mọi mô hình suy luận AI lớn – và đã phát hiện 62 khóa API đang hoạt động cùng 33 mật khẩu bị chôn vùi trong các nhật ký phiên mà các nhà phát triển đã chia sẻ công khai trực tuyến mà không hề biết bên trong chúng chứa gì.

“Bằng cách giải mã 315.320 khối suy luận được thu thập từ các kho lưu trữ công khai, chúng tôi đã thu hồi 367 phần tử Thông tin nhận dạng cá nhân (PII) và 182 thông tin xác thực,” các nhà nghiên cứu viết.

Bài báo, được đệ trình vào ngày 10 tháng 8 bởi một nhóm từ MATS Research, ELLIS Institute Tübingen, Viện Max Planck về Hệ thống Thông minh và công ty bảo mật Snyk, nhắm mục tiêu vào một lớp AI cụ thể: các mô hình suy luận. Đây là những mô hình không chỉ trả lời ngay lập tức mà thay vào đó bắt đầu bằng một chuỗi suy nghĩ nội bộ (một sổ nháp từng bước nơi AI giải quyết vấn đề trước khi hiển thị câu trả lời cho bạn), sau đó đưa ra phản hồi cuối cùng.

Anthropic, OpenAI và Google đều mã hóa sổ nháp ẩn đó. Mã hóa – quá trình xáo trộn dữ liệu thành một mã không thể đọc được – nhằm bảo vệ sở hữu trí tuệ của công ty và giữ cho suy luận trung gian nhạy cảm không bị người dùng tiếp cận. Khối được mã hóa được chuyển lại cho máy chủ của nhà cung cấp với mỗi tin nhắn tiếp theo, duy trì cuộc hội thoại mà không lưu trữ bất cứ thứ gì ở phía công ty.

Một khóa để thống trị tất cả

Lỗi nằm ở kiến trúc. Thay vì gắn mỗi khối suy luận được mã hóa với một người dùng, phiên hoặc mô hình cụ thể, cả ba nhà cung cấp đều sử dụng một khóa mã hóa toàn hệ thống duy nhất trên toàn bộ hệ sinh thái của họ. "Các khối được mã hóa này hoàn toàn tương thích và có thể hoán đổi cho nhau giữa các phiên, người dùng và thậm chí các mô hình khác nhau trong hệ sinh thái của nhà cung cấp," các nhà nghiên cứu viết.

Điều đó có nghĩa là một khối suy luận được mã hóa từ Claude Opus 4.8 – mô hình chủ lực của Anthropic – có thể được tiêm vào Claude Haiku 4.5, một mô hình anh em rẻ hơn, ít được bảo vệ hơn mà không vi phạm các quy tắc của Anthropic. Haiku thiếu cơ chế chống chắt lọc (đào tạo an toàn được thiết kế đặc biệt để ngăn mô hình sao chép suy luận của chính nó theo lệnh) mà Opus có.

Yêu cầu Haiku đọc nguyên văn khối được mã hóa, và nó sẽ làm vậy. "Bằng cách tiêm một dấu vết suy luận được mã hóa từ một mô hình nhất định vào một mô hình yếu hơn và ít được bảo vệ hơn từ cùng một nhà cung cấp, chúng tôi buộc nó phải giải mã và xuất dấu vết nguyên văn dưới dạng văn bản thuần túy, mà không cần trực tiếp bẻ khóa mô hình mạnh hơn," bài báo nêu rõ.

"Khả năng tương thích chéo mô hình có nghĩa là Haiku 4.5 có thể đọc được suy nghĩ của Opus 4.8," nhà nghiên cứu trưởng Alexander Panfilov viết trên X. Cuộc tấn công tương tự cũng được tái tạo trên dòng GPT-5.6 của OpenAI và dòng mô hình Gemini của Google. Không cần quyền truy cập đặc biệt – quyền truy cập API tiêu chuẩn (kết nối mà các nhà phát triển sử dụng để xây dựng ứng dụng trên các mô hình AI) là đủ để thực hiện.

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Nhật ký công khai chứa gì

Để chứng minh thiệt hại trong thế giới thực, nhóm nghiên cứu đã thu thập 6.708 bản ghi tác nhân AI được chia sẻ công khai – nhật ký phiên tự động mà các nhà phát triển thường xuyên đăng lên GitHub và Hugging Face để cộng tác hoặc gỡ lỗi. Họ đã giải mã 315.320 khối suy luận từ các nhật ký đó.

"Các nhà phát triển thường xuyên chia sẻ nhật ký phiên và dấu vết suy nghĩ được mã hóa của họ công khai trực tuyến, hoàn toàn không biết về dữ liệu nhạy cảm ẩn trong các khối được mã hóa," bài báo lưu ý. Hầu hết những bí mật đó chưa bao giờ xuất hiện trong đầu ra AI hiển thị – chúng chỉ tồn tại bên trong suy luận được mã hóa, vô hình đối với bất kỳ ai chưa thực hiện cuộc tấn công.

Lỗ hổng này mở ra bốn vectơ tấn công ngoài việc đánh cắp thông tin xác thực đơn giản: đánh cắp các mẫu suy luận độc quyền từ các công ty AI để đào tạo các mô hình cạnh tranh thông qua chắt lọc (khi một AI nhỏ hơn học cách bắt chước một AI lớn hơn bằng cách nghiên cứu đầu ra của nó); trích xuất dữ liệu riêng tư từ các nhật ký được chia sẻ; thực hiện tiêm nhắc nhở ẩn, trong đó các hướng dẫn độc hại được ẩn bên trong các khối suy luận được mã hóa mà các công cụ giám sát bảo mật không bao giờ nhìn thấy; và bẻ khóa các mô hình mạnh mẽ thông qua các mô hình anh em ít được bảo vệ hơn của chúng.

Anthropic, OpenAI và Google đều đã triển khai các biện pháp giảm thiểu phía máy chủ sau khi nhóm nghiên cứu tuân thủ các quy trình tiết lộ có trách nhiệm. Như Decrypt đã báo cáo trước đây, Anthropic đã là trọng tâm lặp lại đối với các nhà nghiên cứu bảo mật trong năm nay, đặc biệt là khi các mô hình mới nhất của họ tiêu thụ nhiều mã thông báo hơn trong quá trình đó.

Các bản vá đã được triển khai. 6.708 bản ghi phiên với các khối suy luận đã được giải mã đã được thu thập từ web công khai sẽ không biến mất.