
Anthropic đã bắt đầu nhúng một dấu thủy văn không thể nhận biết vào tất cả văn bản mà các mô hình Claude mới nhất của họ tạo ra. Thay đổi này có hiệu lực đối với các mô hình ra mắt tại EU vào ngày 2 tháng 8 năm 2026, và Anthropic cho biết nó sẽ được áp dụng trên toàn thế giới.
Anthropic đã trình bày kế hoạch này trong một bài viết hỗ trợ sau khi ký vào Bộ Quy tắc Thực hành về tính minh bạch của Đạo luật AI của EU. Nói cách khác, đây không hoàn toàn là việc tự nguyện. Dấu hiệu này bao phủ mọi nền tảng của Claude, từ chatbot và API đến Claude Code và các đối tác đám mây như AWS, Google Cloud và Microsoft Foundry.
“Khi một mô hình Claude được hỗ trợ tạo văn bản, nó sẽ dệt một dấu thủy văn không thể nhận biết trực tiếp vào chính văn bản đó. Bạn sẽ không nhìn thấy nó, và nó không làm thay đổi ý nghĩa, chất lượng hay khả năng đọc của phản hồi từ Claude,” Anthropic cho biết. “Bởi vì dấu thủy văn là một phần của văn bản, nó sẽ đi cùng với văn bản khi được sao chép và dán ở nơi khác, và có thể tồn tại qua một số chỉnh sửa.”
Vì vậy, nó phức tạp hơn một chút so với các phương pháp thông thường mà người dùng thường nghĩ đến. Khi một mô hình Claude được hỗ trợ viết văn bản, nó sẽ dệt một dấu thủy văn không thể nhận biết trực tiếp vào các từ, mà không có thẻ hiển thị. Vì dấu này là một phần của văn bản, nó tồn tại qua thao tác sao chép-dán và, Anthropic thừa nhận, "có thể tồn tại qua một số chỉnh sửa." Các tệp tin có thêm một lớp thứ hai: siêu dữ liệu được ký theo tiêu chuẩn mở C2PA (hãy nghĩ đến một bản kê khai vận chuyển kỹ thuật số ghi lại ai đã tạo ra tệp và liệu có ai đã chỉnh sửa nó sau đó hay không).
Anthropic chưa công bố cách tạo ra dấu thủy văn. Bài viết hỗ trợ gọi nó là cấp độ mô hình (mô hình được huấn luyện với nó) và bản địa văn bản (nó không phải là công cụ bên ngoài như trình tạo siêu dữ liệu, chẳng hạn), nhưng tài liệu phát hiện và kỹ thuật chính xác vẫn chưa được công bố.
Các nhà nghiên cứu suy luận đó là một chữ ký thống kê: Mô hình điều chỉnh lựa chọn từ ngữ của mình theo một độ lệch nhẹ, có thể phát hiện được, cùng loại phương pháp mà Google sử dụng trong SynthID Text. Điều đó vẫn chỉ là một phỏng đoán cho đến khi Anthropic công bố công cụ phát hiện.
Nhưng điều đó không làm các nhà bảo vệ quyền riêng tư chùn bước, và một số chuyên gia đã và đang nghiên cứu các phương pháp để phá vỡ dấu thủy văn bí mật của Anthropic. mikiane/claude-watermark-cleaner (106 sao trên Github) loại bỏ các ký tự Unicode vô hình, sau đó viết lại văn bản bằng một mô hình không phải Claude để phá vỡ mẫu token.
Một dự án lớn hơn, guillaumemeyer/watermarks-remover (4.6k sao trên Githum), loại bỏ các dấu văn bản của Claude cộng với các tín hiệu kiểu C2PA và SynthID trên các định dạng PNG, JPEG, SVG, PDF và DOCX. Các tác giả cho rằng dấu văn bản thống kê "không phải là cách đáng tin cậy để chứng minh nguồn gốc" và chủ yếu buộc người dùng phải trải qua lần chạy mô hình thứ hai để làm sạch văn bản của chính họ. Không thể đảm bảo việc loại bỏ cho đến khi Anthropic cung cấp công cụ phát hiện và ngưỡng của họ.
Lịch sử của Anthropic khiến phản ứng về quyền riêng tư trở nên gay gắt hơn. Công ty đã gỡ bỏ một trình theo dõi Claude Code ẩn vào tháng 3 sau khi các nhà nghiên cứu phát hiện nó gắn thẻ vị trí và việc sử dụng proxy của một số người dùng thông qua các điểm đánh dấu Unicode không được tiết lộ—chính kỹ thuật đánh dấu kín đáo này hiện đang là trọng tâm của kế hoạch dấu thủy văn.
Dấu hiệu này chứng minh Claude có tham gia vào văn bản, chứ không phải nó đã viết toàn bộ, vì vậy nó sẽ xử lý một bài viết gốc với một chỉnh sửa nhỏ giống như một văn bản được AI tạo ra hoàn toàn. Yêu cầu Claude đọc lại hoặc dịch đoạn văn của bạn và kết quả vẫn có thể mang tín hiệu. Anthropic thẳng thắn thừa nhận rằng chỉnh sửa nhiều có thể loại bỏ dấu hiệu này, và việc thiếu dấu hiệu không chứng minh rằng con người đã viết thứ gì đó.
Một dự luật của Hoa Kỳ, Đạo luật COPIED, thúc đẩy cùng ý tưởng: một cách chuẩn hóa để đánh dấu nội dung AI bằng dấu thủy văn để các nền tảng có thể theo dõi nguồn gốc của nó. Như vấn đề tống tiền của Claude đã cho thấy, các mô hình của công ty này đã phải đối mặt với sự giám sát chặt chẽ về những gì chúng làm với văn bản mà chúng xử lý.
Anthropic chưa cho biết khi nào họ sẽ công bố các công cụ phát hiện cho phép bất kỳ ai xác minh dấu hiệu này.








