일본 헌책방들의 일일 매출이 최대 5배 증가했다고 니혼테레비 취재 결과를 인용해 톰스하드웨어가 현지 시각 9월 24일 보도했다. 구매자들이 2022년 이전에 출간된 책을 톤 단위로 사들이면서 나타난 변화다. 목적은 AI 모델 학습용 데이터 확보다.
생성형 AI가 확산된 2022년 이후 출간된 책에는 AI가 작성하거나 수정한 문장이 섞여 있을 가능성이 있어, 학습 데이터로서의 가치가 낮게 평가된다.
무역 통계에는 일본 대형 출판 유통사의 계열사가 지난해부터 ‘JAPANESE BOOKS’ 항목으로 50톤 넘는 물량을 미국에 수출한 기록이 남아 있다. 권수로 환산하면 약 10만 권이다. 톰스하드웨어는 이 물량이 스캔 뒤 폐기하는 시설로 향한 것으로 보인다고 전했다.
파괴 스캔은 책의 제본을 잘라내고 낱장으로 분리해 고속으로 촬영하는 방식이다. 페이지를 한 장씩 넘기며 찍는 것보다 훨씬 빠르지만 원본은 남지 않는다.
일본어 데이터는 영어에 비해 공개된 대규모 말뭉치가 적다. 말뭉치는 언어 모델을 학습시키기 위해 모아 둔 문서 집합을 말한다. 웹에서 수집할 수 있는 일본어 문서가 상대적으로 한정돼 있어, 출판물로 눈을 돌린 것으로 볼 수 있다.
일본 저작권법 제30조의4는 정보 해석 목적의 저작물 이용을 폭넓게 허용하지만, 해석 범위를 둘러싼 논의가 계속되고 있다. 중고 서적을 정당하게 구입했더라도 스캔 데이터를 모델 학습에 쓰는 행위가 어디까지 허용되는지는 별개의 문제다.
자세한 내용은 톰스하드웨어에서 확인할 수 있다.
이미지 출처: 이디오그램 생성
AI Matters 뉴스레터 구독하기











