Trang chủTrung tâm tin tức LBank
Perceptron đang biến băng thông nhàn rỗi thành dữ liệu huấn luyện AI
perceptron-is-turning-idle-bandwidth-into-ai-training-data
Perceptron đang biến băng thông nhàn rỗi thành dữ liệu huấn luyện AI
Perceptron đang sử dụng băng thông nhàn rỗi của người tiêu dùng để thu thập dữ liệu web có sẵn công khai và cung cấp các bộ dữ liệu đào tạo AI với chi phí thấp hơn. Nền tảng này cho biết mạng lưới của họ trải rộng trên hơn 150 quốc gia và thưởng cho những người đóng góp, đồng thời xác minh chất lượng dữ liệu trước khi cung cấp cho các khách hàng doanh nghiệp. Perceptron đã ra mắt Quỹ Dữ liệu AI trị giá 10 triệu đô la để giúp các nhà phát triển tiếp cận cơ sở hạ tầng dữ liệu và đẩy nhanh quá trình phát triển các mô hình AI.
2026-07-03 Nguồn:crypto.news

Ngành trí tuệ nhân tạo hiện đang đối mặt với nút thắt cổ chai nghiêm trọng về dữ liệu đào tạo, đặc biệt là khi các tập đoàn công nghệ tập trung đang khóa các nhà phát triển giai đoạn đầu khỏi các kênh thông tin chất lượng cao. Nền tảng hạ tầng dữ liệu phi tập trung Perceptron đang nỗ lực giải quyết nút thắt cơ cấu này bằng cách triển khai một lớp hạ tầng phi tập trung thu thập thông tin web từ các thiết bị của người dùng hàng ngày.

Tóm tắt
  • Perceptron sử dụng băng thông nhàn rỗi của người tiêu dùng để thu thập dữ liệu web công khai và cung cấp bộ dữ liệu đào tạo AI với chi phí thấp hơn.
  • Nền tảng này cho biết mạng lưới của họ trải rộng hơn 150 quốc gia và thưởng cho những người đóng góp, đồng thời xác minh chất lượng dữ liệu trước khi cung cấp cho khách hàng doanh nghiệp.
  • Perceptron đã ra mắt Quỹ Dữ liệu AI trị giá 10 triệu đô la để giúp các nhà phát triển tiếp cận hạ tầng dữ liệu và đẩy nhanh quá trình phát triển các mô hình AI.

Truyền thông hiện đại hoàn toàn tập trung vào việc nhấn mạnh cách các tên tuổi hàng đầu trong lĩnh vực trí tuệ nhân tạo liên tục triển khai các hệ thống phần cứng thế hệ mới để tăng cường sức mạnh tính toán thô. Tuy nhiên, một trong những hạn chế hoạt động ít được nhắc đến nhất là chất lượng của dữ liệu đào tạo, yếu tố tạo nên nền tảng cốt lõi của bất kỳ mô hình AI chức năng nào.

Vấn đề là với phần lớn nội dung web mở đã được thu thập kỹ lưỡng, việc kiểm soát chặt chẽ của các tập đoàn đối với các giao diện lập trình ứng dụng công khai đã khóa chặt những nền tảng còn lại của việc thu thập bộ dữ liệu sau những rào cản chi phí khổng lồ lên tới hàng triệu đô la. Điều này về cơ bản đã trở thành một đặc quyền độc quyền đắt đỏ cấm đoán đối với một số ít các tập đoàn công nghệ lớn.

Đối với các ông lớn công nghệ đang dẫn đầu cuộc đua AI, việc đảm bảo các kênh thông tin đắt đỏ này không phải là một thách thức tài chính lớn, nhưng còn các nhà đổi mới thiếu vốn thì sao? Nếu không có ngân sách cần thiết, các startup giai đoạn đầu phải chật vật để xây dựng các sản phẩm cạnh tranh.

“OpenAI trả khoảng 60 triệu đến 100 triệu đô la mỗi năm cho các công ty như Reddit và Twitter để có thể truy cập dữ liệu thông qua API,” Đồng sáng lập & CEO của Perceptron, Peter Anthony nói với crypto.news trong một cuộc phỏng vấn gần đây.

“Nhiều dự án AI mới ngoài kia không có ngân sách để chi 60 triệu đến 100 triệu đô la để có thể truy cập dữ liệu. Nếu bạn xây dựng mô hình tốt nhất thế giới, nó sẽ khá vô dụng nếu không có quyền truy cập vào dữ liệu chất lượng tốt. Bạn có thể là đứa trẻ thông minh nhất ở trường, nhưng nếu bạn không thể tiếp cận bất kỳ cuốn sách nào, bạn thực sự không có nhiều thông tin để trình bày.”

Anthony nhận ra rằng sự bất đối xứng thị trường này tạo ra không gian cho một hạ tầng thay thế có thể phục vụ phân khúc thị trường độc lập, điều này cuối cùng đã dẫn ông đến việc đồng sáng lập Perceptron, một nền tảng dự định sử dụng băng thông nhàn rỗi của người tiêu dùng để giải quyết “vấn đề nút thắt cổ chai dữ liệu” mà AI đang phải đối mặt hiện nay.

“Phần lớn dữ liệu của thế giới đã được truy cập và thu thập, nhưng có rất nhiều dữ liệu bị ẩn đằng sau những nơi khác nhau mà chưa thể tiếp cận, vì vậy chúng tôi đang thu thập dữ liệu và định vị mình để có thể cung cấp dữ liệu cho các công ty AI với chi phí giảm,” Anthony giải thích.

Khai thác băng thông nhàn rỗi

Nhưng băng thông nhàn rỗi mà Perceptron dự định tận dụng là gì? Anthony giải thích rằng đây là tài sản kinh tế không được công nhận mà người dùng hàng ngày liên tục tạo ra thông qua việc duyệt web định kỳ, chỉ để chứng kiến các tập đoàn lớn khai thác và kiếm lợi từ nó.

“Hiện tại, mỗi khi bạn và tôi sử dụng internet trên điện thoại, máy tính của mình, chúng ta đều đang tạo ra dữ liệu. Dữ liệu đó được thu thập, đóng gói thành các bộ dữ liệu khổng lồ bởi các công ty như Google, và được bán với giá hàng triệu, đôi khi hàng tỷ đô la. Thế nhưng bạn và tôi không bao giờ nhận được một xu nào từ giá trị đó.”

Điều mà Perceptron đã làm là hoàn toàn đảo ngược mô hình khai thác này. Họ đã xây dựng một mạng lưới trải rộng hơn 150 quốc gia bao gồm khoảng 800.000 nút, và các nút này được vận hành bởi những người dùng cá nhân chỉ đơn giản là chạy một tiện ích mở rộng trình duyệt trên Chrome hoặc một ứng dụng trên thiết bị Android của họ.

Mặc dù các cài đặt điểm cuối này không thu thập các tệp kỹ thuật số riêng tư hoặc cung cấp cho công ty dữ liệu đo từ xa cá nhân nhạy cảm, nhưng thay vào đó, nó đảm bảo các góc nhìn địa lý cục bộ, mà Anthony mô tả là “các điểm quan sát khác nhau” trên web mở, sau đó có thể được trích xuất thành các mảnh nhỏ và kết hợp thành một bộ dữ liệu có ý nghĩa.

“Điều rất quan trọng là chúng ta tập trung vào thực tế rằng nó không sử dụng dữ liệu cá nhân của từng người, nó không khai thác dữ liệu và thông tin cá nhân của bạn, nhưng giả sử hiện tại bạn đang ở Malawi. Khi bạn xem một trang web cụ thể, tôi có thể vào xem cùng trang web đó, nhưng rất có thể, vì tôi đang ở Dubai, chúng ta sẽ thấy một loại kết quả khác. Tất cả những gì chúng ta có được từ tình huống này là khả năng sử dụng máy tính của bạn để xem một thứ gì đó giống như một trang web bình thường, hoặc bất cứ điều gì có thể là.”

Để minh họa, Anthony lưu ý rằng nếu một khách hàng doanh nghiệp yêu cầu một bộ dữ liệu về các bài đăng trên mạng xã hội liên quan đến chăm sóc sức khỏe từ Hoa Kỳ, Perceptron có thể điều phối trên mạng lưới nút toàn cầu của mình để trích xuất các bài đăng công khai cá nhân mà không cần tương tác với các API doanh nghiệp hạn chế.

Vì dữ liệu này đã được công chúng tự do truy cập thông qua bất kỳ trình duyệt web tiêu chuẩn nào, việc định tuyến thu thập thông qua các nút đầu cuối cá nhân sẽ lách luật các rào cản thương mại. Sau khi các gói dữ liệu nhỏ này được truy xuất, mạng lưới sẽ chuyển dữ liệu chưa tinh chế trở lại một máy chủ tập trung nơi các mô hình trí tuệ nhân tạo chuyên biệt sẽ làm sạch và kiểm tra thông tin để kiểm soát chất lượng.

“Bằng cách này, chúng tôi có thể giảm đáng kể chi phí mà hiện tại nhiều công ty tập trung lớn như Google đang tính phí.”

Được thúc đẩy bởi một vòng lặp kinh tế khuyến khích những người tham gia mạng lưới chất lượng

Câu hỏi tiếp theo là tại sao bất kỳ ai lại tự nguyện cung cấp phần cứng của họ cho một mạng lưới như thế này, và câu trả lời rất đơn giản, một vòng lặp giá trị chung đảm bảo rằng các nút này kiếm được điểm cho kết nối thụ động của họ, số điểm này dự kiến sẽ chuyển đổi thành các token crypto gốc trong tương lai.

Theo Anthony, mô hình phân tán này “sẽ cho phép họ kiếm được điểm” đóng vai trò là thước đo trực tiếp cho sự đóng góp vào mạng lưới của họ, và do đó “bất cứ khi nào có doanh thu được tạo ra bởi công ty, các token sẽ được đưa trở lại hệ sinh thái” để duy trì một vòng lặp kinh tế tuần hoàn.

“Cũng sẽ có các token được dành riêng để mua lại token,” ông nói thêm.

Tuy nhiên, không phải ai chạy một nút cũng đủ điều kiện nhận phần thưởng nhất quán, vì luôn có thách thức về kiểm soát chất lượng, điều này có thể ảnh hưởng đến tính toàn vẹn của bộ dữ liệu nếu không được kiểm tra.

Perceptron giải quyết vấn đề này bằng cách định tuyến các gói đã thu thập trở lại một máy chủ tập trung, nơi các thuật toán tự động đánh giá có hệ thống các đầu vào so với các tiêu chuẩn mục tiêu trước khi giải phóng bất kỳ khoản bồi thường nào.

Hơn nữa, Anthony cho biết startup này gần đây đã mua lại một công ty chuyên về phần mềm xác minh giao dịch và thanh toán để tự động hóa quá trình xác thực này một cách có cấu trúc.

Để thu hút thêm những người tham gia mạng lưới đồng thời thúc đẩy việc tạo ra các bộ dữ liệu, Perceptron cũng có kế hoạch ra mắt nền tảng Data Questing có cấu trúc, cho phép những người đóng góp biến nỗ lực của con người thành các đầu vào đào tạo độc đáo.

“Chúng tôi đặt mục tiêu xây dựng hiệu quả các bộ dữ liệu và tạo ra các bộ dữ liệu hiện không có sẵn thông qua các quy trình tập trung,” Anthony nói thêm.

Mục tiêu cuối cùng

Về lâu dài, Anthony cho biết ông muốn thấy mạng lưới chuyển đổi sang mô hình tập trung vào thông tin kinh doanh, có khả năng cung cấp phân tích chuyên sâu cho khách hàng doanh nghiệp.

“Sự khác biệt là các bộ dữ liệu truyền thống là tĩnh, chúng được thu thập một lần và nhanh chóng trở nên lỗi thời. Nhưng có một lượng lớn dữ liệu được tạo ra mỗi khi bạn tương tác với bất kỳ thứ gì trực tuyến, và hiện tại, hầu hết đều bị lãng phí,” Anthony nói.

“Một máy chủ duy nhất cố gắng giám sát tất cả những người dùng khác nhau này thực sự không thể thu thập thông tin tình báo có ý nghĩa ở quy mô đó. Điều chúng ta cần là một sự thay đổi hướng tới thông tin kinh doanh phân tán, để chúng ta thực sự có thể cải thiện các dịch vụ trên các lĩnh vực như thương mại điện tử, giao dịch, và nhiều hơn nữa.”

Perceptron cũng đã ra mắt Quỹ Dữ liệu AI trị giá 10 triệu đô la, thông qua đó nền tảng này dự kiến sẽ tài trợ cho các nhà phát triển độc lập và hỗ trợ triển khai “các dự án thực tế đang cung cấp dịch vụ thực sự.” Theo các điều khoản của chương trình, các nhóm kỹ sư được chọn sẽ nhận được năm tuần hỗ trợ hạ tầng dữ liệu chuyên biệt và lên đến 5 TB dữ liệu thực tế miễn phí để đẩy nhanh quá trình tối ưu hóa các mô hình AI giai đoạn đầu.

“Mục tiêu là hỗ trợ các dự án khi chúng phát triển và yêu cầu dữ liệu của chúng tăng lên. Chúng tôi có thể trở thành một trong những nhà cung cấp đáng tin cậy của họ, đây vừa là một khoản đầu tư vào hệ sinh thái rộng lớn hơn vừa là một cách để chúng tôi xây dựng doanh thu ổn định, dài hạn,” Anthony lưu ý.

Tính đến thời điểm xuất bản, Anthony cho biết Perceptron đã và đang cung cấp các sản phẩm dữ liệu đa dạng cho nhiều doanh nghiệp thương mại khác nhau. Mạng lưới này cung cấp các bộ dữ liệu hình ảnh phong phú cho các nền tảng tạo video từ văn bản, bao gồm một công ty có tên Everlyn AI, để đào tạo các mô hình tổng hợp nội dung hình ảnh một cách chính xác.

Ngoài ra, dự án còn đang vượt ra ngoài việc biên soạn hình ảnh tiêu chuẩn, vì nền tảng này đã tham gia vào lĩnh vực phân tích cảm xúc bằng cách theo dõi các cuộc thảo luận công khai trên Twitter, YouTube và các thị trường tài sản kỹ thuật số. Việc phân tích tâm lý công chúng này giúp các công ty và sàn giao dịch crypto xây dựng các công cụ theo dõi đưa ra tín hiệu sớm để ngăn chặn các biến động giá đột ngột.