
人工智慧公司正在掃描成卡車的書籍,其中有些甚至是珍稀書籍,並且經常在訓練模型的過程中將它們毀壞——現在我們對哪些公司以及它們如何進行有了些概念。
獨立科技媒體《404 Media》在一批珍稀書籍中放置了一個追蹤裝置,並觀察它運往亞馬遜位於拉斯維加斯的設施,該公司在那裡掃描並毀壞印刷書籍以訓練人工智慧。
這項於週一發布的調查,首次公開指出與人工智慧訓練相關的大量書籍採購最終流向何處。
最終目的地是亞馬遜的 VGT3 團隊。員工告訴該媒體,他們所做的就是接收大量的印刷書籍,然後切掉書脊,以便頁面更快地送入掃描儀。書籍在此過程中被毀壞。該團隊的標誌非常貼切,是一隻爪子抓著書的恐龍。
2022 年之前印刷的書籍所包含的文本大多不易在網上獲取,而且至關重要的是,它們不是由機器生成的。用模型自身的輸出進行訓練,存在「模型崩潰」的風險,即品質會在每次遞歸循環中下降。
因此,2022 年之前的紙質資料是人工智慧訓練的「潔淨燃料」。
亞馬遜並非唯一一家。一個專門為人工智慧實驗室提供實體書籍的產業已經形成,這些書籍被剝離、掃描並丟棄——這就像《華氏451度》的場景,文本被毀壞以餵養機器。Anthropic 內部「巴拿馬計畫」已經大規模運行,透過破壞性掃描將數百萬本書數位化。
這場對潔淨文本的爭奪已然對簿公堂。一位聯邦法官裁定,利用合法購買的書籍訓練人工智慧可被視為合理使用,這對 Anthropic 而言是一次局部勝利,Meta 和 OpenAI 也曾提出類似主張。盜版書籍則是另一回事:Anthropic 已同意就掃描盜版書籍支付 15 億美元的和解金,而 Salesforce 目前正因涉嫌書籍盜版面臨集體訴訟。
亞馬遜的這項業務之所以保持低調,存在結構性原因。過去一年,書商注意到大量訂單激增,並懷疑背後是人工智慧公司所為——這些買家對價格不敏感,且選書看似隨機。一個 AirTag 揭露了目的地,最終證實了他們的疑慮。
亞馬遜表示,它「透過商業渠道購買書籍,以幫助開發和改進客戶使用的產品和服務。」