Trang chủTrung tâm tin tức LBank
Luật sư AI đã vượt trội các giáo sư luật về khả năng suy luận—Chính các giáo sư luật thừa nhận
ai-lawyers-better-law-professors-reasoning-stanford
Luật sư AI đã vượt trội các giáo sư luật về khả năng suy luận—Chính các giáo sư luật thừa nhận
Các nhà nghiên cứu phát hiện các giáo sư ưa thích các câu trả lời do AI tạo ra hơn những câu được viết bởi đồng nghiệp của họ, điều này đặt ra những câu hỏi về vai trò của AI trong giáo dục chuyên nghiệp.
2026-06-03 Nguồn:decrypt.co

Tóm tắt

  • Các giáo sư luật ưa chuộng câu trả lời về luật hợp đồng do AI tạo ra hơn so với câu trả lời của các giáo sư đồng nghiệp, với tỷ lệ khoảng 75%.
  • Các phản hồi của AI ít bị gắn cờ là có hại hơn so với các phản hồi do giáo sư viết.
  • Các nhà nghiên cứu cho biết kết quả cho thấy các mô hình ngôn ngữ lớn có thể tuân thủ các tiêu chuẩn chuyên môn.

Theo một nghiên cứu gần đây do Đại học Stanford dẫn đầu, khảo sát cách các mô hình ngôn ngữ lớn thực hiện các tác vụ suy luận pháp lý, các giáo sư luật đã ưa chuộng câu trả lời do trí tuệ nhân tạo tạo ra hơn so với câu trả lời của các giáo sư đồng nghiệp.

Trong nghiên cứu, 16 giáo sư từ 14 trường luật của Hoa Kỳ – bao gồm Stanford, Yale, Đại học New York, Đại học Chicago, Georgetown, UCLA và Đại học Virginia – đã tạo ra 40 câu hỏi về luật hợp đồng bao gồm học thuyết pháp lý, án lệ, các tình huống giả định và các vấn đề chính sách. Các nhà nghiên cứu coi đây là một cách lý tưởng để kiểm tra năng lực của AI hiện đại.

“Các mô hình ngôn ngữ lớn (LLM) ngày càng được quảng bá như những gia sư giáo dục, nhưng hầu hết các đánh giá lại tập trung vào các lĩnh vực có một sự thật duy nhất,” các nhà nghiên cứu viết. “Tuy nhiên, nhiều ngành khoa học lại phụ thuộc vào sự phán đoán: suy luận, cân nhắc sự mơ hồ và đưa ra các kết luận có thể bảo vệ được. Luật pháp mang đến một bài kiểm tra sắc bén.”

Trong 2.918 so sánh mù, các giáo sư đã chọn câu trả lời mà họ muốn đưa cho sinh viên hơn. Gemini 2.5 Pro của Google đã thắng 75,92% số trận đối đầu với giảng viên con người, trong khi NotebookLM của gã khổng lồ công nghệ này thắng 74,75% số lần, cho thấy kết quả do AI tạo ra được ưu tiên hơn con người trong khoảng ba phần tư số phản hồi.

Theo các nhà nghiên cứu, để xác định liệu kết quả có phản ánh sự đồng thuận chuyên môn rộng rãi hơn hay không, các nhà nghiên cứu đã phân tích mức độ thường xuyên các giáo sư đồng ý khi đánh giá cùng một cặp câu trả lời.

“Sự đồng thuận quan sát được vượt quá mức mong đợi nếu các phán đoán hoàn toàn mang tính cá nhân, cho thấy rằng thành công của LLM phản ánh sự phù hợp với các tiêu chí kỷ luật chung,” họ viết.

Nghiên cứu cho thấy các mô hình AI cũng vượt trội hơn các giảng viên con người trên nhiều danh mục, bao gồm các câu hỏi gợi nhớ liên quan đến vụ án, bộ luật hoặc học thuyết, các tình huống giả định và thảo luận chính sách.

“Để tìm hiểu xem liệu lợi thế của bất kỳ LLM nào có thể do phong cách viết bề mặt thay vì nội dung thực chất hay không, chúng tôi đã tạo ra một bộ các đặc điểm từ vựng-cú pháp bổ sung – độ dài câu trả lời, cấu trúc tổ chức, sắc thái lập luận, cơ sở pháp lý, giọng điệu tự tin, sự rõ ràng và hỗ trợ sư phạm – và kiểm tra xem chúng có thể giải thích bao nhiêu phần trăm mẫu ưu tiên,” nghiên cứu cho biết.

Các câu trả lời do AI tạo ra cũng ít bị gắn cờ là có hại hơn so với những câu trả lời do giáo sư viết, với Gemini ghi nhận tỷ lệ có hại là 3,41% và NotebookLM là 3,64%, so với 12,06% đối với giảng viên con người. Trong một phân tích riêng về các mô hình bổ sung, Claude Opus 4.7 của Anthropic xếp hạng nhất, tiếp theo là ChatGPT 5.4 của OpenAI và Gemini 2.5 Pro, trong khi mỗi mô hình AI được đánh giá đều vượt trội hơn giảng viên con người về mặt trung bình.

Các nhà nghiên cứu cảnh báo rằng nghiên cứu không đo lường liệu các câu trả lời có phù hợp với sở thích giảng dạy cá nhân của mỗi giáo sư hay không, để ngỏ khả năng các phản hồi do AI tạo ra được coi là chấp nhận được nói chung chứ không phải được điều chỉnh riêng cho phương pháp của bất kỳ giảng viên nào.

“Mặc dù các phản hồi của LLM thường được ưa chuộng hơn so với phản hồi của giảng viên con người, nhưng môi trường đánh giá của chúng tôi không cho phép chúng tôi đo lường trực tiếp mức độ hài lòng của sở thích giảng viên,” nghiên cứu cho biết. “Ít nhất về mặt lý thuyết, có thể các LLM, mặc dù thường cung cấp các phản hồi mạnh mẽ hơn, vẫn tạo ra các câu trả lời chỉ được coi là ‘đủ tốt’.”

Nghiên cứu được đưa ra trong bối cảnh các tòa án, công ty luật và trường luật ngày càng phải vật lộn với việc sử dụng trí tuệ nhân tạo như thế nào trong ngành luật.

Vào tháng 3, Tòa án Tối cao Los Angeles bắt đầu thử nghiệm các công cụ AI để giúp thẩm phán quản lý khối lượng công việc ngày càng tăng, trong khi các trường luật đang bổ sung các chương trình đào tạo AI.

“Những lợi ích tiềm năng của các công nghệ mới này như một yếu tố nhân lên sức mạnh trong thực tiễn hành nghề luật không thể bị bỏ qua,” John P. Anderson, Trưởng khoa Trường Luật Mississippi College, trước đây đã nói với Decrypt. “Dù sinh viên của chúng tôi có kế hoạch trở thành luật sư tranh tụng hay luật sư giao dịch, các nhà tuyển dụng tương lai của họ sẽ mong đợi sự quen thuộc với các công cụ AI này. Chúng tôi muốn các công ty tuyển dụng sinh viên của chúng tôi tin tưởng rằng mọi sinh viên tốt nghiệp MC Law đều thành thạo công nghệ AI.”

Tuy nhiên, đồng thời, các công ty luật vẫn tiếp tục đối mặt với các trường hợp bị ảnh hưởng bởi những ảo giác và các lỗi khác do AI tạo ra. Vào tháng 4, công ty luật Sullivan & Cromwell đã thừa nhận trước tòa án phá sản Hoa Kỳ rằng một hồ sơ gần đây trong một vụ án nổi tiếng có chứa các trích dẫn giả do AI tạo ra.