
Nếu bạn hỏi năm hệ thống AI tiên tiến nhất thế giới về tính đúng đắn của một tuyên bố, thì hai phần ba số lần, ít nhất một trong số chúng sẽ đưa ra câu trả lời khác. Đó là kết quả của một nghiên cứu mới được công bố trong tháng này bởi nhà nghiên cứu Kosta Jordanov tại Lenz Research.
Nghiên cứu đã cung cấp cho GPT-5.4, Claude Opus 4.7, Gemini 3 Pro, Gemini 3 Pro với Search, và Sonar Pro cùng 1.000 tuyên bố kiểm chứng thực tế do người dùng thật gửi. Các mô hình này phải chọn một trong bốn nhãn: đúng, phần lớn đúng, gây hiểu lầm, hoặc sai.
Trong số 1.000 tuyên bố, có 672 trường hợp ít nhất một mô hình không đồng nhất với đa số. Trong 34% các trường hợp, sự bất đồng rất nghiêm trọng: một mô hình cho rằng tuyên bố là đúng, trong khi mô hình khác lại cho là sai.
“Đây không phải là các mục tiêu chuẩn với khóa câu trả lời công khai—mà là các tuyên bố do người dùng thật gửi để kiểm chứng trên một nền tảng kiểm tra sự thật,” nghiên cứu viết. “Chỉ một kết quả trong số các loại có thể đúng cho mỗi tuyên bố, vì vậy bất kỳ sự bất đồng nào giữa hội đồng đều có nghĩa là phán quyết của ít nhất một mô hình không nhất quán về nhãn theo tiêu chí 4 loại này.”
Các nghiên cứu trước đây về hiện tượng 'ảo giác' của AI đã chỉ ra rằng các chatbot tự tạo ra thông tin sai lệch. Đó là một vấn đề. Nhưng đây là một vấn đề khác. Các mô hình không nhất thiết phải bịa đặt, chúng chỉ đơn giản là không thể đồng ý về các đánh giá thực tế cơ bản về cùng một tài liệu.
Nghiên cứu đã sử dụng một thiết lập khiến các công ty AI khó có thể biện minh. Thay vì lấy các tuyên bố từ các bộ thử nghiệm tiêu chuẩn—loại thường bị rò rỉ vào dữ liệu đào tạo—các nhà nghiên cứu đã sử dụng các tuyên bố do người thật gửi đến nền tảng kiểm tra sự thật của Lenz. “Hầu hết các tuyên bố này khó có thể xuất hiện trong bất kỳ kho dữ liệu đào tạo nào với một nhãn 'chuẩn' được gắn kèm—không có khóa câu trả lời chính tắc để khớp mẫu, không có bảng xếp hạng chuẩn để dựa vào,” bài báo lưu ý.
Chỉ số thống kê về mức độ đồng thuận, được gọi là alpha của Krippendorff, đạt 0,639 trên thang điểm mà 1,0 có nghĩa là đồng thuận hoàn hảo và 0 có nghĩa là ngẫu nhiên. Nghiên cứu cho biết điều này cho thấy “sự đồng thuận không tầm thường nhưng còn hạn chế.” “Các phán quyết của mô hình được cấu trúc chứ không phải ngẫu nhiên, nhưng không đủ nhất quán để coi hội đồng là một thẩm phán có thể thay thế lẫn nhau,” các nhà nghiên cứu lưu ý. Các nhà nghiên cứu thường coi bất kỳ con số nào dưới 0,8 là yếu.
Khi cả năm mô hình đồng ý—chỉ xảy ra trong 328 trên 1.000 tuyên bố—chúng hầu như không bao giờ đồng ý rằng điều gì đó là gây hiểu lầm hoặc phần lớn đúng. Chỉ có bốn tuyên bố nhận được phán quyết “gây hiểu lầm” nhất trí. Không có tuyên bố nào nhận được phán quyết “phần lớn đúng” nhất trí.
Các nhà nghiên cứu đã cung cấp các ví dụ về các tuyên bố mà các mô hình AI có sự khác biệt lớn nhất, bao gồm "Danh mục đầu tư đang hoạt động của Ngân hàng Thế giới tại Nigeria đạt hơn 16,4 tỷ USD tính đến năm 2025." ChatGPT 5.4 cho rằng đó là "phần lớn đúng" trong khi Gemini 3 Pro gọi đó là "sai" và mô hình chị em của nó là Gemini 3 Pro + Search đánh giá nó là "gây hiểu lầm."
Trong một ví dụ khác, các mô hình được cung cấp tuyên bố: "Donald Trump nói rằng một cuộc tấn công vào Iran đã bị hoãn lại theo yêu cầu của các Đồng minh vùng Vịnh." GPT-5.4 cho rằng đó là sai, Claude Opus 4.7 gọi nó là phần lớn đúng, Gemini 3 Pro nói sai, và Gemini 3 Pro + Search đánh giá nó là đúng.
“Hội đồng đi đến các phán quyết dứt khoát; phần giữa của tiêu chí là nơi nó bị phân tách,” các nhà nghiên cứu nhận thấy. Sự nhất trí chỉ xảy ra ở các cực: tuyên bố hoặc là hoàn toàn đúng hoặc hoàn toàn sai.
Điều này quan trọng bởi vì mọi người ngày càng tìm đến các hệ thống AI để kiểm tra sự thật. Nếu bạn dán một tuyên bố từ một bài báo tin tức vào ChatGPT, Claude, hoặc Gemini, bạn có thể nhận được ba câu trả lời khác nhau. Bạn sẽ tin vào câu trả lời nào?
Các công ty AI rất thích nói với bạn rằng các mô hình của họ ngày càng chính xác hơn. Họ công bố điểm chuẩn cho thấy sự cải thiện ổn định. Nhưng nghiên cứu của Lenz đã thử nghiệm các mô hình này trên những tuyên bố phức tạp, mơ hồ mà con người thật sự tranh cãi—và phát hiện ra rằng các mô hình cũng tranh cãi.
Bài báo cẩn thận chỉ ra điều này. “Đa số các mô hình tiên tiến không phải là chân lý tuyệt đối. Phán quyết của đa số đôi khi sai; một mô hình bất đồng ý kiến cá nhân đôi khi lại đúng. Chúng tôi sử dụng đa số làm điểm tham chiếu cấu trúc để đo lường sự bất đồng, chứ không phải là đại diện cho sự đúng đắn.”
Có một vấn đề sâu xa hơn ẩn chứa trong các con số. Khi các mô hình bất đồng, ít nhất một trong số chúng phải sai—nghiên cứu gọi phán quyết của một mô hình là “không nhất quán về nhãn theo tiêu chí 4 loại này.” Không có cơ chế giải quyết tranh chấp, không có tòa phúc thẩm. Các báo cáo gần đây về độ tin cậy của AI đã dấy lên những cảnh báo tương tự.
Trong số 328 tuyên bố mà cả năm mô hình đồng ý, không có tuyên bố nào nhận được phán quyết “phần lớn đúng” nhất trí. Hộp chứa các sắc thái đã hoàn toàn trống rỗng. Nếu các mô hình AI chỉ có thể tìm thấy sự đồng thuận ở các thái cực, liệu chúng có thể được tin cậy làm người kiểm tra sự thật hay không?