Trang chủTrung tâm tin tức LBank
Nghiên cứu mới nhất của DGrid AI giải quyết một lỗ hổng cốt lõi trong chấm điểm AI phi tập trung
dgrid-ais-latest-research-tackles-a-core-flaw-in-decentralized-ai-scoring
Nghiên cứu mới nhất của DGrid AI giải quyết một lỗ hổng cốt lõi trong chấm điểm AI phi tập trung
Nghiên cứu PoQ mới của DGrid AI giới thiệu phương pháp chấm điểm không cần dữ liệu tham chiếu để thưởng cho các node AI mà không cần đáp án đúng. DGrid đã huấn luyện các trọng tài AI chuyên biệt để chấm điểm chất lượng đầu ra, qua đó cải thiện các hệ thống thưởng AI phi tập trung ở quy mô lớn. Các mô hình Proof of Quality mới của DGrid AI giúp các mạng lưới AI phi tập trung đánh giá phản hồi một cách chính xác mà không cần dữ liệu thực tế.
2026-06-18 Nguồn:crypto.news

DGrid AI giới thiệu một khuôn khổ Proof of Quality (Bằng chứng chất lượng) mới được thiết kế để đánh giá đầu ra của AI và cải thiện việc phân phối phần thưởng trên các mạng phi tập trung.

Tóm tắt
  • Nghiên cứu PoQ mới của DGrid AI giới thiệu phương pháp chấm điểm không cần tham chiếu để thưởng cho các nút AI mà không cần câu trả lời đúng.
  • DGrid đã đào tạo các "giám khảo" AI chuyên biệt để chấm điểm chất lượng đầu ra, cải thiện hệ thống phần thưởng AI phi tập tập trung ở quy mô lớn.
  • Các mô hình Proof of Quality mới của DGrid AI giúp các mạng AI phi tập trung đánh giá phản hồi chính xác mà không cần dữ liệu "ground truth" (sự thật cơ sở).

Các mạng AI phi tập trung đang đối mặt với một vấn đề về thanh toán mà các nhà nghiên cứu đã âm thầm tìm cách giải quyết trong nhiều năm, và một bài báo gần đây từ DGrid AI đã đưa vấn đề này ra thảo luận trực tiếp. Các hệ thống chấm điểm chất lượng cung cấp phần thưởng cho các nút phần lớn phụ thuộc vào việc có sẵn câu trả lời đúng để so sánh. Trong thực tế sản xuất, câu trả lời đó hiếm khi tồn tại.

Bài báo, thứ tư trong loạt nghiên cứu liên tục của DGrid về Proof of Quality (PoQ), đề xuất một phương án thay thế được đào tạo và công bố các số liệu đằng sau nó. PoQ sử dụng các mô hình đánh giá nhỏ để chấm điểm chất lượng của từng đầu ra, và những điểm số đó thúc đẩy việc phân phối phần thưởng. Chi phí thấp và có khả năng mở rộng.

DGrid đã xây dựng điều này từng bước một: một phiên bản nhận biết chi phí tích hợp độ trễ vào tính toán thanh toán, một lớp chống lại các tác nhân xấu (adversarial-robustness) giúp hệ thống vẫn hoạt động tốt khi người chấm điểm gian lận hoặc lười biếng, và một khuôn khổ chia “chất lượng” thành các phần có thể kiểm tra. Đó là kỹ thuật vững chắc. Và mỗi lớp đều gặp phải cùng một trở ngại.

Vấn đề chấm điểm đã phát triển như thế nào

Cấu trúc cơ bản của một mạng suy luận phi tập trung tạo ra một thách thức về đo lường. Các nút độc lập chạy các mô hình ngôn ngữ và phản hồi các truy vấn của người dùng. Những phản hồi đó cần được chấm điểm vì điểm số quyết định khoản thanh toán. Việc xác minh mã hóa cho mọi tính toán sẽ an toàn về mặt kỹ thuật nhưng lại quá tốn kém ở quy mô lớn, vì vậy giải pháp thực tế là đánh giá chất lượng tự động bằng cách sử dụng các mô hình nhỏ hơn.

Công việc trước đây của DGrid đã phát triển phương pháp đó một cách tuần tự, bổ sung các khoản thanh toán được điều chỉnh theo độ trễ, các biện pháp bảo vệ chống lại những người chấm điểm thao túng, và một phân tích chi tiết hơn về ý nghĩa thực sự của “chất lượng” trong ngữ cảnh chấm điểm. Điều mà nó không thể giải quyết hoàn toàn là tín hiệu đánh giá.

Tín hiệu mạnh nhất mà nhóm có được là sự tương đồng về ngữ nghĩa: so sánh đầu ra của mô hình với một câu trả lời đúng đã biết và đo khoảng cách giữa chúng trong không gian nhúng. Điều đó hoạt động trong các môi trường đánh giá chuẩn (benchmark) nơi tồn tại các câu trả lời tham chiếu. Nó không hoạt động trong một mạng trực tiếp nơi người dùng đang đặt câu hỏi mở và không có dữ liệu ground truth nào đang chờ trong cơ sở dữ liệu.

Các giải pháp thay thế có sẵn trên thị trường cho kết quả tệ hơn. Một NLI cross-encoder, một lớp mô hình được thiết kế để đánh giá mối quan hệ suy luận logic giữa các câu, đã cho ra hệ số tương quan Pearson là −0.363 khi được sử dụng để đánh giá chất lượng câu trả lời mà không có câu trả lời tham chiếu. Hệ số tương quan âm có nghĩa là mô hình có nhiều khả năng ưu tiên các phản hồi kém hơn là các phản hồi tốt. Đó không phải là một công cụ đánh giá hữu ích.

Những gì bài báo đề xuất

Thay vì điều chỉnh các mô hình hiện có, các nhà nghiên cứu đã đào tạo ba "giám khảo" đặc biệt để chấm điểm chất lượng mà không cần tham chiếu. Mỗi "giám khảo" nhận một câu hỏi và một phản hồi làm đầu vào và đưa ra điểm từ 0 đến 10, mà không được cung cấp câu trả lời đúng.

Ba mô hình khác nhau chủ yếu về kích thước và tốc độ:

  • TextCNN (~10M tham số) chạy trong khoảng 1 mili giây mỗi lần gọi, phù hợp cho việc lọc bước đầu với thông lượng cao.
  • MiniLM (22M tham số) nằm ở giữa, khoảng 13 mili giây.
  • DeBERTa (184M tham số) mất khoảng 15 mili giây và được tối ưu hóa cho độ chính xác.

Quá trình đào tạo tuân theo quy trình hai giai đoạn. Các mô hình đầu tiên được tiền đào tạo trên UltraFeedback, một bộ dữ liệu công khai về các phản hồi được GPT-4 chấm điểm, trước khi tinh chỉnh trên phân phối tác vụ riêng của mạng. Mục đích là cung cấp cho các "giám khảo" sự hiểu biết cơ bản rộng rãi về chất lượng trước khi thu hẹp trọng tâm vào ngữ cảnh chấm điểm cụ thể.

Kết quả cốt lõi

Trên một tập dữ liệu thử nghiệm độc lập gồm 300 ví dụ, "giám khảo" DeBERTa đạt hệ số tương quan Pearson là 0.747 so với dữ liệu ground-truth proxy — mà không cần truy cập bất kỳ câu trả lời tham chiếu nào. Các công cụ đánh giá dựa trên tham chiếu từ khuôn khổ trước đó, có quyền truy cập vào các câu trả lời đúng, đạt tối đa 0.647.

Khoảng cách này có một lời giải thích đơn giản. Các công cụ đánh giá cũ hơn là các chỉ số tương đồng đo khoảng cách cosine đến một vector nhúng (embedding) tham chiếu. Các "giám khảo" mới được tối ưu hóa end-to-end cho chính tác vụ chấm điểm. Sự khác biệt về hiệu suất phản ánh sự khác biệt đó nhiều hơn là bất kỳ đột phá kiến trúc nào.

Một lưu ý mà các tác giả đưa ra: dữ liệu ground truth được sử dụng ở đây bản thân nó là một proxy — sự trùng lặp từ cấp độ token chứ không phải là đánh giá của con người. Các "giám khảo" tương quan tốt với chỉ số này, nhưng liệu sự trùng lặp từ có đáng tin cậy phản ánh những gì một con người sẽ coi là một phản hồi chất lượng hay không là một câu hỏi riêng biệt, chưa được giải quyết.

Hai tính năng hướng đến triển khai đi kèm với các "giám khảo". Một đường ống phân cấp (cascading pipeline) định tuyến các truy vấn qua mô hình nhẹ trước và chỉ chuyển sang các mô hình nặng hơn khi điểm số không rõ ràng, giảm chi phí đánh giá lên đến 72.7% ở cài đặt ngưỡng tích cực nhất, mặc dù hệ số tương quan giảm xuống khoảng 0.51 trong cấu hình đó. Một cơ chế hiệu chỉnh trực tuyến, chạy mà không cần điều chỉnh thủ công, liên tục xác định chất lượng ngữ nghĩa là tín hiệu chủ đạo và điều chỉnh trọng số tương ứng, gán cho nó trọng số gấp 4.7 lần trọng số ban đầu theo thời gian.

Hệ thống vẫn còn gặp khó khăn ở đâu

Các "giám khảo" hoạt động không đồng đều giữa các loại tác vụ. Về trả lời câu hỏi, hệ số tương quan đạt 0.830. Về tóm tắt, nó giảm xuống 0.199. Bài báo cho rằng điều này không phải do lỗi của bản thân các "giám khảo" mà do chỉ số đánh giá được sử dụng trong quá trình đào tạo: sự trùng lặp từ thô là một thước đo kém hiệu quả đối với chất lượng tóm tắt, vì vậy các mô hình được đào tạo dựa trên nó học cách theo dõi một tín hiệu yếu. Các tác giả mô tả đây là vấn đề mở chính hơn là một hạn chế đã biết đang được âm thầm quản lý.

Cách trình bày đó nhất quán với cách bài báo trình bày tổng thể các kết quả của nó — có phương pháp, với các trường hợp thất bại được nêu rõ ràng như những cải tiến. Bốn bài báo trong chuỗi nghiên cứu này, công trình này ít giống một thông báo sản phẩm hơn và giống một nhóm đang dần khắc phục các lỗ hổng trong một thứ mà họ thực sự muốn triển khai.

Tuyên bố miễn trừ trách nhiệm: Nội dung này được cung cấp bởi bên thứ ba. Cả crypto.news và tác giả bài viết này đều không xác nhận bất kỳ sản phẩm nào được đề cập trên trang này. Người dùng nên tự nghiên cứu trước khi thực hiện bất kỳ hành động nào liên quan đến công ty.