537
AirTag вывел на след книжного конвейера Amazon
Старые книги скупают тысячами, разрезают и сканируют. Путь одной такой партии удалось проследить до Amazon.
Еще несколько недель назад у букинистов в США, Великобритании, Ирландии и Австралии были лишь косвенные признаки новой охоты за печатными книгами. Через Biblio, Alibris и другие площадки приходили заказы на сотни и тысячи никак не связанных между собой изданий. Покупателей почти не интересовали жанр, автор или логика подборки. Зато повторялись два признака: крупный объём и наличие ISBN.
404 Media решило проверить маршрут одного такого заказа буквально физически. В июле журналисты договорились с продавцом, получившим заказ примерно на тысячу книг, и спрятали Apple AirTag в одном из томов. Маячок прошёл через несколько логистических точек и в итоге оказался на объекте Amazon в Северном Лас-Вегасе. Площадка связана с комплексом LAS8, а подразделение VGT3, по словам работников, занимается обработкой печатных книг.
Сам процесс выглядит куда менее литературно, чем результат. С книги срезают корешок, страницы отделяют и подают в промышленный сканер, ISBN фиксируют в системе. После этого экземпляр уже невозможно вернуть на полку в прежнем виде. Это принципиально отличается от ранней модели Google Books, где библиотечные тома старались оцифровывать без разрушения и затем возвращали владельцам.
Amazon подтвердил важную часть цепочки. Представитель компании сообщил, что корпорация покупает книги через коммерческие каналы для разработки и улучшения своих продуктов и сервисов. При этом Amazon не раскрыл, какие именно модели или системы получают эти тексты и какая часть закупок относится непосредственно к обучению генеративного ИИ. Поэтому точнее говорить не о раскрытом составе конкретного датасета, а о подтверждённой связке: массовая закупка, объект Amazon и разрушительное сканирование.
Почему вообще понадобилась бумага, тоже становится понятнее. Для разработчиков особенно ценны книги, вышедшие до массового распространения генеративного ИИ: такой корпус почти наверняка создан людьми и не загрязнён машинными пересказами. Чем больше синтетического текста оказывается в интернете, тем выше цена старых офлайн-источников — особенно тех, которых нет в хорошем цифровом виде.
Юридический фон уже сформирован предыдущими делами. В споре Bartz против Anthropic федеральный суд США признал fair use и использование законно приобретённых книг для обучения моделей, и перевод купленного печатного экземпляра в цифровой формат для внутренней библиотеки. Но миллионы файлов, скачанных Anthropic из пиратских библиотек, суд рассматривал отдельно: последующая покупка легальных копий не стирала проблему первоначального происхождения.
Именно поэтому массовая покупка бумажных книг выглядит для AI-компаний намного удобнее пиратского архива. Но юридическая чистота приобретения не снимает другой вопрос. Для обычного книжного рынка подержанный экземпляр после продажи может перейти следующему читателю. В индустрии данных он превращается в одноразовый носитель: купить, разрезать, отсканировать, сохранить только текст.
AirTag сделал видимой цепочку, которую раньше можно было обсуждать лишь по странным заказам и догадкам продавцов. Теперь спор смещается: не покупают ли технологические компании книги для оцифровки, а где проходит граница между законным использованием текста и необратимой потерей самого физического экземпляра.
Фото: редакция ИЗНАНКИ.
МВД призвало россиян меньше улыбаться для предотвращения несанкционированных платежей
Улыбка может стать причиной финансовых потерь: за год зафиксировано 43 случая ...
/ / Интересное
Автор: Денис Иванов
Прибыли российский рыбаков значительно снизились
А долги достигли триллиона рублей
/ / Интересное
Автор: Дмитрий Зорин
ВОЗ одобрила первую вакцину против оспы обезьян: новый этап в борьбе с вирусом mpox
Препарат MVA-BN, разработанный компанией Bavarian Nordic, получил официальное ...
/ / Интересное
Автор: Дарья Никитская