
Anthropic cho biết AI Claude của họ vừa viết bằng chứng toán học dài nhất từng được tạo ra và sử dụng nó để chính thức chứng minh Định lý lớn Fermat, một bài toán đã làm khó các nhà toán học trong 358 năm.
Claude đã làm điều đó trong 11 ngày, chủ yếu là tự động, tạo ra 13 triệu dòng mã mà máy tính có thể kiểm tra từng dòng, thay vì chỉ tin lời một nhà toán học.
Định lý lớn Fermat nói rằng bạn không thể lấy ba số nguyên dương, nâng mỗi số lên một lũy thừa cao hơn 2, và có tổng hai số đầu tiên bằng số thứ ba. Ông đã ghi chú yêu sách đó vào lề một cuốn sách toán học vào năm 1637, thêm rằng ông có một "bằng chứng thực sự tuyệt vời" nhưng lề quá nhỏ để ghi hết.
Sau đó ông qua đời. Các nhà toán học đã dành 358 năm tiếp theo để cố gắng tái tạo lại những gì ông nghĩ mình đã có.
Chứng minh một điều gì đó và kiểm tra nó là hai công việc khác nhau
Một bằng chứng toán học là một chuỗi các bước logic, và nếu một mắt xích bị đứt, toàn bộ bằng chứng sẽ sụp đổ. Việc tìm ra mắt xích bị đứt đó, ẩn giấu đâu đó trong hàng trăm trang lập luận dày đặc, có thể khiến các nhà toán học khác mất nhiều năm cuộc đời.
Hình thức hóa một bằng chứng có nghĩa là dịch nó sang một ngôn ngữ cực kỳ trực quan đến nỗi máy tính có thể tự mình xác minh mọi bước mà không cần chủ quan.
Các nhà toán học đã không giỏi trong việc kiểm soát điều này trong một thời gian. Một giải thưởng của Đức năm 1908 trị giá khoảng 1 triệu đến 2 triệu đô la theo giá trị ngày nay, được trao cho bằng chứng hợp lệ đầu tiên của định lý, đã thu hút 621 bài nộp sai chỉ trong năm đầu tiên.
Kiểm tra một bằng chứng toán học lớn có thể mất nhiều năm. Hình thức hóa—chuyển đổi lý luận toán học thành một dạng mà các trợ lý chứng minh bằng máy tính như Lean có thể xác minh—có thể giúp ích.
Tháng trước, Claude đã hoàn thành bằng chứng hình thức hóa đầu tiên về Định lý lớn Fermat, một trong những… pic.twitter.com/pdT8zwlV4A
— Anthropic (@AnthropicAI) September 4, 2026
Bằng chứng thực sự không xuất hiện cho đến năm 1995, từ nhà toán học người Anh Andrew Wiles, và nó đi kèm với một bước ngoặt. Wiles đã công bố giải pháp của mình trong ba bài giảng vào tháng 6 năm 1993, chỉ để một người đánh giá tìm thấy một lỗ hổng trong đó sau này.
Ông đã dành gần một năm để sửa chữa nó với một cựu sinh viên, Richard Taylor, gần như bỏ cuộc, và cuối cùng đã công bố một bằng chứng đã được chỉnh sửa, dài 129 trang vào tháng 5 năm 1995. Nó dựa trên toán học không tồn tại trong thời đại của Fermat, đó là lý do lớn khiến các nhà toán học hiện nay nghi ngờ rằng "bằng chứng tuyệt vời" của Fermat thực sự có hiệu quả.
Nhà toán học Kevin Buzzard của Đại học Hoàng gia London đã khởi động một dự án vào năm 2024 để làm chính xác những gì Claude vừa làm: dịch bằng chứng của Wiles sang Lean, một ngôn ngữ mà máy tính có thể kiểm tra. Đây là loại công việc cần một đội quân các nhà toán học tình nguyện – đề cương của dự án này dài 86 trang, và nguồn tài trợ của nó đã được đảm bảo đến năm 2029.
Claude đã hoàn thành toàn bộ công việc trong 11 ngày.
Claude đã làm điều đó như thế nào
Anthropic giải thích trong một bài đăng chi tiết hơn rằng Tianyi Peng, người xây dựng các công cụ hình thức hóa AI cùng một nhóm tại Columbia, đã quyết định xem Claude có thể tự mình đi được bao xa. Hàng chục tác nhân Claude đã làm việc song song, viết các định nghĩa, chứng minh các kết quả nhỏ và xếp chồng chúng thành những kết quả lớn hơn, hầu như không có sự can thiệp của con người ngoại trừ một vài gợi ý như "ưu tiên định lý này tiếp theo."
Lúc đầu mọi việc không suôn sẻ. Ban đầu, các tác nhân liên tục quên mất những gì họ đã chứng minh và ngừng hợp tác, và những khởi đầu sai lầm đó vẫn chiếm khoảng 7% số dòng trong bằng chứng cuối cùng.
Điều khắc phục vấn đề là một công cụ có tên Prove2Me, cũng được xây dựng bởi nhóm của Peng, đã cung cấp cho mỗi tác nhân cùng một danh sách việc cần làm trực tiếp về những bằng chứng nhỏ hơn vẫn cần thực hiện, để không ai lặp lại công việc hoặc đi lạc. Nó cũng sắp xếp các tệp để Lean có thể kiểm tra mọi thứ nhanh hơn và giữ các ghi chú bằng tiếng Anh đơn giản về mỗi kết quả để các tác nhân có thể tái sử dụng công việc của nhau thay vì tự tạo lại.
Khi hoàn thành, Claude đã chứng minh hơn 30.000 định lý hỗ trợ và tiêu tốn hàng tỷ token, chạy trên một mô hình nghiên cứu mà Anthropic cho biết tương đương với Claude Fable 5.1, phiên bản họ sau đó phát hành ra công chúng. Bằng chứng hoàn chỉnh dài 13 triệu dòng—hơn năm lần kích thước của Mathlib, thư viện chung mà các nhà toán học đã sử dụng cho loại công việc này.
Một cuốn tiểu thuyết điển hình dài 80.000 từ. Bằng chứng của Claude tương đương với 160 cuốn tiểu thuyết chỉ toàn những lập luận logic.
Vậy điều này có thực sự quan trọng không?
Buzzard—người mà phiên bản dự án của riêng ông vẫn được tài trợ đến năm 2029—đã xem xét bằng chứng của Claude và tán thành, nói rằng nó chứng minh định lý "không có giả định nào khác ngoài các tiên đề của toán học."
Điều này không giống như việc Claude khám phá ra toán học hoàn toàn mới, điều mà Anthropic cũng tuyên bố với nghiên cứu mật mã của họ hồi đầu năm nay. Wiles đã chứng minh định lý Fermat ba thập kỷ trước—Claude chỉ xây dựng một bằng chứng có thể kiểm tra bằng máy. Điều đó quan trọng bởi vì các nhà toán học ngày càng bị quá tải với các bằng chứng chưa được xác minh, bao gồm cả những bằng chứng do AI viết, nhanh hơn khả năng kiểm tra bằng tay của con người.
Ngoài ra, các loại bằng chứng này là xác định và không dễ mắc lỗi của con người, điều này rất quan trọng trong toán học.
Đó không phải là một vấn đề mới. Một bằng chứng có sự hỗ trợ của máy tính về giả thuyết Kepler đã mất bốn năm trước khi một hội đồng đánh giá chỉ cam kết "chắc chắn 99%", và bằng chứng của Grigori Perelman về giả thuyết Poincaré cũng mất khoảng thời gian tương tự để được hiểu đầy đủ.
Nếu bạn không muốn tin lời của Anthropic về bất cứ điều gì trong số này, bạn không cần phải tin. Bằng chứng đầy đủ 13 triệu dòng đang nằm trên GitHub ngay bây giờ, miễn phí cho bất kỳ nhà toán học nào có đủ thời gian rảnh rỗi để xem xét từng dòng một.








