updated
일본 헌책방에 쏟아진 대량 주문, AI는 왜 종이책을 찾을까
일본 헌책 대량 주문 보도에서 출발해 실제 미국 스캔 사례와 책이 데이터가 되는 과정을 따라간다. AI가 배우는 것과 사람이 다시 읽을 책을 남기는 일은 어떻게 다를까.

헌책방에서 잘 팔리지 않던 전문서가 한꺼번에 나갔다. 철학과 역사, 의학과 법률. 취향이 뚜렷한 한 사람의 장바구니라고 보기에는 범위가 넓었다. 일본 NTV가 2026년 9월 22일 전한 소식이다. 여러 계정이 서점들에 넣은 주문의 배송지가 같은 오카야마 물류센터라는 공통점도 있었다. 서점들 사이에서는 AI 학습자료를 모으는 것 아니냐는 추측이 나왔다.
보도에 등장한 ‘50톤’도 눈길을 끌었다. 다만 한 번에 주문한 양은 아니다. NTV가 무역정보 도구로 확인했다고 밝힌 것은 2025년 이후 미국으로 수출된 일본 책의 누적 기록이다. 관련 기업은 AI 기업의 학습용이라고 인식하고 판매한 사실이 없다고 답했다. 최종 구매자와 실제 처리 방식, 이번 주문과 수출 기록의 연결은 아직 확인되지 않았다. NTV의 원취재 배포 기사
그렇다고 종이책으로 AI를 만든다는 이야기 자체가 상상은 아니다. 미국에서는 실제 구매와 스캔 과정이 법원 문서에 남았다. 여기서 더 흥미로운 질문이 생긴다. 인터넷에 글이 그렇게 많은데, 왜 굳이 책을 사고 상자에 넣어 옮길까? 그리고 책이 AI의 학습자료가 되면, 그 책은 새로운 형태로 살아남는 것일까.
인터넷에 많다는 것과, 필요한 글이 있다는 것
우리는 검색창에 제목을 넣어 결과가 뜨면 그 책이 인터넷에 있다고 느낀다. 하지만 책 소개와 서평이 검색되는 것, 본문 전체를 읽을 수 있는 것은 다르다. 서점의 상품 페이지에는 목차와 몇 쪽의 미리보기만 있을 수 있다. 어떤 책에 무엇이 들어 있는지 아는 것과 그 내용을 학습자료로 확보하는 일 사이에는 거리가 있다.
가령 온라인에는 제목과 출판 연도만 올라온 지역 산업사 책을 상상해보자. 책 안에는 지역 사업장의 변화와 당시 사람들의 표현이 수백 쪽에 걸쳐 실려 있다. 이런 경우 똑같은 소개글을 여러 사이트에서 모아도 그 본문은 얻을 수 없다. 쉽게 발견되는 양보다 아직 옮겨지지 않은 내용이 중요해진다.
AI의 자료를 고르는 연구에서도 단순한 양만 보지는 않는다. 2023년 공개된 학습자료 비교 연구는 웹, 책, 논문 등 여러 종류의 자료를 섞고 일부 종류를 빼는 실험을 했다. 책과 폭넓은 웹 자료를 제외했을 때 질의응답 성능이 크게 떨어지는 조건이 나타났다. 연구진은 다양한 내용과 품질을 함께 볼 필요가 있다고 설명했다. 특정 규모의 모델을 비교한 실험이므로 최신 AI의 최적 배합까지 알려주는 결과는 아니다. 학습자료 구성에 관한 연구
이 결과를 책을 읽는 경험과 연결해보면 매력이 보인다. 한 주제를 처음부터 설명하는 글, 반론을 소개한 뒤 자기 논리를 펼치는 글, 인물의 관계를 길게 이어가는 이야기. 책에는 사실의 목록뿐 아니라 그 사실을 연결하고 표현한 문장이 있다. 여러 분야의 책을 모으려는 관심을 이해할 만한 배경이다.
종이책이라고 모두 정확하거나 좋은 것도 아니다. 오래된 정보, 편향된 주장, 잘못된 설명도 책이 될 수 있다. 같은 연구에서도 자료 구성이 질의응답뿐 아니라 유해한 표현의 생성과 인식에 서로 다른 영향을 주었다. 학습에 유용한 자료라도 편향과 오류는 함께 살펴야 한다.
긴 입력을 처리하도록 모델을 추가 훈련한 2024년 연구에서도, 책 같은 특정 영역의 긴 문서 비중만 높이는 방식은 최선이 아니었다. 여러 영역의 균형이 중요했다. 창고에 쌓인 책의 높이를 성능표로 바로 바꿀 수는 없는 셈이다. 무엇을 얼마나 섞고 어떤 능력을 시험하는지까지 봐야 한다. 긴 문서 학습과 자료 균형에 관한 연구
실제로 책을 샀고, 자르고, 파일로 만들었다
확인된 사례는 일본의 주문과 분리해서 볼 필요가 있다. AI 서비스 Claude를 만드는 미국 기업 Anthropic의 사례다. 2025년 6월 23일 미국 캘리포니아 북부 연방지방법원의 결정문에는 회사가 종이책을 대량 구매하고 처리한 과정이 나온다. 당시 도서 수집을 맡은 톰 터비는 이전에 구글의 도서 스캔 사업에서 제휴 업무를 이끌었던 인물이다.
문서에 따르면 2024년 봄 무렵 시작된 대량 구매 뒤, 업체들은 제본을 해체하고 페이지를 잘라 스캔했다. 종이 원본은 폐기했고, 페이지 이미지와 기계가 읽을 수 있는 문자가 들어 있는 PDF를 만들었다. 회사는 모은 자료 중 일부를 골라 모델별 학습자료에 넣었다. 자료실에 들어갔다는 사실과 학습에 쓰였다는 사실도 구분된다. Bartz 대 Anthropic 사건 결정문, 3~6쪽
이 과정은 우리가 전자책을 사는 장면과도 다르다. 독자용 전자책은 화면에서 책을 읽도록 만들어진 상품이다. 여기서는 묶여 있는 종이를 기계가 처리할 수 있는 자료로 바꾸는 작업이 등장한다. 사람에게는 표지와 책등이 책을 보호하고 구별해주지만, 종이를 한 장씩 연속해서 읽히려면 먼저 제본을 풀어야 한다.
같은 물건을 보면서 한쪽은 앞으로 펼칠 책을 떠올리고, 다른 쪽은 추출할 글자를 떠올린다. 처리 방식에 따라 원본의 운명이 달라지는 지점이다. 그런데 책을 해체하는 방법만 있을까.
책을 스캔하려면 꼭 잘라야 할까
아니다. 책을 펼쳐 놓고 위에서 촬영하는 방식도 있다. PFU·리코의 ScanSnap SV600 같은 장비는 그런 방식을 공식적으로 소개한다. 책을 해체하지 않고 촬영하며, 펼친 면의 휘어짐을 보정하고 페이지 넘김을 감지하는 기능도 제공한다. 이번 일본 주문에 쓰였다는 뜻이 아니라, 책을 자르지 않는 방식도 있다는 예다. 제조사의 책 스캔 방식 설명
두 방식은 작업대 위의 풍경부터 다르다. 제본을 해체하는 방식에서는 분리한 종이를 차례로 통과시킨다. 펼침 방식에서는 책의 형태를 유지한 채 다음 면을 보여줘야 한다. 펼친 책의 안쪽은 휘거나 그림자가 생길 수 있어 촬영과 보정이 중요해진다. 제본을 유지하는 방식에도 원본을 다루는 주의와 수고는 남는다.
책의 크기와 상태, 장비와 사람의 개입 방식에 따라 작업 조건은 달라진다. 여기서 주목할 것은 스캔은 종이를 이미지로 옮기는 일이고, 원본을 해체하거나 폐기하는 것은 별도의 선택이라는 점이다.
종이를 연속해서 스캔한다.
원래의 묶인 책 형태는 사라진다.
제본을 유지하며 면을 넘긴다.
곡면·그림자 등을 다뤄야 한다.
검색·분석에 쓸 문자 데이터가 된다.
사진 속 글자는 아직 ‘문자 데이터’가 아니다
책 한 페이지를 휴대폰으로 찍어보면 이 차이를 쉽게 떠올릴 수 있다. 사진을 눈으로 읽는 데는 문제가 없어도, 사진 속 한 문장만 복사해서 검색창에 붙이려면 글자를 인식하는 기능이 필요하다. 이처럼 이미지의 글자 모양을 문자로 바꾸는 기술을 OCR이라고 한다. 스캔 이미지와 OCR 결과는 같은 내용을 가리켜도 서로 다른 자료다.
일본 국립국회도서관의 Mina Search도 디지털 이미지에서 OCR로 만든 본문을 검색에 활용한다. 도서관은 자동으로 만든 글자를 일일이 사람이 교정한 것은 아니며, 얼룩이나 퇴색 때문에 잘못 인식하거나 읽지 못하는 글자가 있을 수 있다고 안내한다. 검색에 등장한다고 해서 그 문자 파일을 모두 내려받을 수 있는 것도 아니다. 국립국회도서관의 본문 검색 안내
설명을 위한 가상 문장으로 ‘이 마을의 인구는 1,000명이다’를 떠올려보자. 숫자 한 자리가 다르게 인식되면 문장 모양은 그럴듯한데 내용은 틀려진다. 글자 몇 개만 따로 보면 오타 같아도, 그 문장을 자료로 활용하는 사람에게는 인구 자체가 달라진 셈이다. 책을 파일로 만들었다는 사실만으로 내용이 정확하게 옮겨졌다고 볼 수 없는 이유다.
레이아웃에도 의미가 있다. 본문 옆의 작은 주석, 두 단으로 나뉜 글, 표 안의 숫자는 눈으로 보면 위치가 관계를 알려준다. 이를 줄글로 옮기면 어떤 내용이 먼저이고 무엇이 무엇을 설명하는지 정해야 한다. 가령 표의 열 제목과 숫자가 떨어지면 가격인지 연도인지 헷갈릴 수 있다. 공개 OCR 소프트웨어 Tesseract의 문서도 표를 읽을 때 별도의 구획·배치 분석이 필요할 수 있다고 설명한다. 글자 인식과 페이지 배치에 관한 기술 안내
그래서 이미지와 문자를 함께 보유하는 데에는 서로 다른 쓸모가 있다. 이미지는 인식이 의심스러울 때 원래 페이지의 모습을 확인하게 해준다. 문자는 특정 표현을 찾고, 문단을 처리하고, 내용끼리 비교하기 좋다. 그래서 파일이 있다는 소식에 한 가지 질문을 더 해야 한다. 페이지의 모습이 남았을까, 추출한 글자만 남았을까.
모으는 일만큼 중요한, 덜어내는 일
문자로 옮겼다고 모든 내용이 그대로 학습에 들어가는 것도 아니다. 공개 영어 학습자료인 Dolma는 웹 문서와 논문, 코드, 공공영역의 책 등을 섞고, 자료를 걸러내고 중복을 줄이는 절차를 설명한다. 웹 자료의 경우 같은 주소를 다시 수집한 것, 다른 주소에 있는 동일 문서, 여러 문서에 반복되는 문단 등을 구별해 처리한다. 일본 책의 행방과는 별개로, 공개된 자료 제작 과정을 들여다볼 수 있는 사례다. Dolma의 자료 구성과 중복 제거 설명
같은 기사가 열 군데에 실렸다고 새로운 사건 열 개가 생기는 것은 아니다. 여러 책에 반복되는 안내문도 비슷하게 생각해볼 수 있다. 데이터의 부피에는 새 내용과 반복 내용이 함께 들어 있다. 중복을 덜어내는 작업은 무조건 자료를 많이 확보하는 일과 다른 방향으로 움직인다. 큰 창고가 있어도 그 안의 물건을 분류해야 쓸 수 있는 것과 같다.
그렇다고 비슷해 보이는 것을 전부 지우면 되는 것도 아니다. 설명용으로 초판과 개정판을 떠올려보자. 대부분의 문장이 같아도 고쳐진 한 문단이 중요한 책일 수 있다. 본문에 반복되는 문장을 줄이는 목적과 어떤 판본에 어떤 내용이 있었는지 보존하는 목적은 다르다. 데이터를 정리한다는 말에는 무엇을 같다고 볼지에 대한 판단이 들어간다.
Dolma의 설명에는 독자 입장에서 눈여겨볼 대목도 있다. 원자료에 여러 변환을 거쳤기 때문에, 이 학습자료가 원래 콘텐츠를 직접 읽으려는 사람에게 적합한 대체품은 아니라고 밝힌다. AI를 훈련하기 편하게 정리한 자료와 책을 읽기 편하게 정리한 자료가 다를 수 있다는 뜻이다. ‘학습에 쓸 수 있다’와 ‘책 대신 읽을 수 있다’는 처음부터 같은 목표가 아니다.
책이 AI 안에 남는다는 말의 함정
모델 학습은 책 파일을 책장에 꽂아두는 일과 다르다. 언어모델은 많은 글에서 단어와 표현 사이의 관계를 학습하고, 주어진 문맥에 이어질 내용을 만들어낸다. 책 제목별 파일을 차례로 열어 원문 페이지를 보여주는 전자도서관과는 작동 목적이 다르다. 학습자료와 모델을 구분해야 하는 가장 큰 이유다. 구글의 언어모델 기초 설명
가령 AI에게 옛 도시의 생활을 설명해달라고 했더니 그럴듯한 문장이 나왔다고 하자. 독자는 그 답변이 유용할 수 있다. 하지만 그 사실만으로 어떤 책의 몇 쪽을 정확하게 보존했고, 필요할 때 그대로 확인할 수 있다고 말할 수는 없다. 자연스러운 설명을 얻는 일과 출처의 한 문장을 대조하는 일은 다른 작업이다. 학습한 표현이 일부 재현될 수 있느냐는 문제와도 별개다.
AI 서비스에 별도의 검색 기능이나 원문 자료실을 연결할 수도 있다. 원문 열람이 가능하다면 그 기능을 떠받치는 파일과 검색 체계, 접근 권한이 필요하다. 요약을 얻으려는지, 정확한 문장을 인용하려는지, 판본을 확인하려는지에 따라 독자가 찾아야 할 자료도 달라진다.
할 수 있는 일이 달라진다‘책이 데이터가 됐다’를 네 가지로 나눠 보기
페이지와 제본을 직접 살필 수 있다.
보관 장소와 상태 관리가 필요하다.
찍힌 면의 글자와 배치를 확인한다.
스캔 품질과 누락 여부가 중요하다.
표현을 찾고 내용을 비교한다.
글자 인식 오류는 따로 확인한다.
학습한 관계를 바탕으로 답을 만든다.
원문 열람 서비스 자체는 아니다.
도서관도 스캔하지만, 목적지는 다르다
종이책의 디지털화 자체는 낯선 일이 아니다. 일본 국립국회도서관은 원격으로 자료를 이용할 수 있게 하고, 반복 열람에 따른 원본 손상을 줄이기 위해 디지털화한다고 설명한다. 사람들에게 디지털 사본을 제공하면 종이 원본을 덜 만지게 할 수 있다. 여기서는 파일이 원본을 버리기 위한 수단이 아니라 원본을 지키는 수단으로도 쓰인다. 도서관이 자료를 디지털화하는 이유
핵심은 결과를 누구에게 어떤 방식으로 제공하도록 설계했느냐다. 회사가 연구를 위해 파일을 보관하는 것과 독자가 책을 찾아 읽도록 서비스를 운영하는 것은 다른 약속이다. 목록 검색, 화면 열람, 파일 내려받기는 각각 따로 제공될 수 있다. 디지털화를 이야기할 때 실제 독자에게 어디까지 열리는지를 봐야 한다.
가령 어느 회사 서버에 오래된 책의 스캔이 완벽하게 남아 있다고 가정해보자. 일반 독자가 접근할 수 없다면 그 독자에게는 여전히 읽을 수 없는 책이다. 반대로 원본이 멀리 있는 도서관에 있어도 열람 가능한 사본과 검색 체계가 잘 갖춰져 있다면 찾아볼 기회는 늘어난다. 보존의 성과를 파일 개수 하나로만 판단하기 어려운 이유다.
더구나 파일을 만들어두는 것으로 장기 보존이 끝나지도 않는다. 국립국회도서관은 저장매체의 수명뿐 아니라 파일 형식, 읽는 장치와 소프트웨어의 노후화를 디지털 보존의 문제로 설명한다. 2026년 3월에는 2026~2030년의 디지털화·보존 기본계획도 세웠다. 파일은 물리적 공간을 덜 차지할 수 있지만, 미래에도 읽을 수 있도록 관리하는 일까지 없애주지는 않는다. 디지털 정보의 장기 보존에 관한 안내
오래된 사진 파일이 있는 디스크를 갖고 있어도, 연결할 장치가 없거나 파일을 열지 못하면 내용을 보기 어렵다는 경험을 떠올리면 된다. 책의 디지털 보존도 ‘한 번 복사했는가’에서 ‘계속 확인하고 이용할 수 있는가’로 질문이 이어진다. AI 학습을 마쳤다는 소식에는 이런 관리의 약속이 자동으로 따라오지 않는다.
팔린 책을 반기면서도, 마음이 복잡한 이유
일본 보도를 읽은 사람들의 반응도 한 방향만은 아니었다. 하테나 북마크의 공개 댓글에서 이용자 kuippa는 집에 쌓여 있는 것보다 일본어가 미래로 이어지는 측면을 긍정적으로 보았다. opaopachang은 헌책이 외국 AI의 재료가 되는 듯해 마음이 개운하지 않다는 취지로 썼다. 두 사람의 의견을 요약한 것이며, 일본 전체의 여론이나 실제 폐기 여부를 보여주는 자료는 아니다. 해당 보도에 달린 공개 댓글
한쪽은 활용되지 않던 지식이 이어질 가능성을, 다른 쪽은 책이 사람에게 읽히는 경로에서 멀어지는 모습을 본다. 디지털화를 통한 활용과 원본에 대한 애착은 동시에 존재할 수 있다. 문제는 새로운 쓰임이 생겼다는 사실만으로 이전의 쓰임도 충분히 보장된다고 말할 수 있느냐다.
서점, 작가, 독자의 관심도 조금씩 다를 수밖에 없다. 서점에는 오래 보관한 재고가 판매되는 일이 중요하다. 작가는 자신의 문장이 새로운 사업에 어떤 조건으로 쓰이는지 물을 수 있다. 독자는 다음에 그 책을 구해 읽을 수 있을지가 궁금하다. 이 세 질문은 한 번의 거래에서 함께 생기지만, 책값을 지불했다는 사실 하나로 모두 답해지는 것은 아니다.
실제로 미국의 작가 권익단체 Authors Guild는 9월 18일 성명에서 Anthropic의 해적판 다운로드 관련 합의와, 작가 동의 없이 책을 학습에 활용하는 문제를 구별했다. 파괴적 스캔이 계속되는 상황을 비판하며 출판사들이 작가의 지속 가능한 활동을 지원해야 한다고 주장했다. 일본 주문에 대한 조사 결과가 아니라 작가의 권리를 대변하는 단체의 요구다. Authors Guild의 성명
성명의 관심사는 스캔 기계만이 아니다. 책을 만드는 사람에게 어떤 몫이 돌아가는지, 앞으로 새 책을 계속 쓸 환경이 남는지에 있다. 독자가 ‘책 한 권이 팔렸으니 모두에게 좋은 일 아닌가’라고 느끼는 지점과, 작가가 ‘그 문장으로 만드는 서비스는 별개의 이용 아닌가’라고 묻는 지점이 여기서 갈린다. 이 차이를 알아야 논쟁을 종이와 디지털의 취향 싸움으로 축소하지 않을 수 있다.
책을 샀다는 말 뒤에 남는 질문
법원도 모든 행위를 한 덩어리로 판단하지 않았다. 앞서 본 미국 결정은 해당 사건의 모델 학습용 복제와 구매한 종이책의 내부 디지털 대체를 공정이용으로 인정했지만, 해적판을 영구 자료실에 확보한 행위에는 같은 판단을 적용하지 않았다. 미국의 특정 사건에 관한 결정이지 모든 나라의 모든 AI 학습에 대한 허가증은 아니다. 해당 결정의 판단 범위, 30~31쪽
해적판 다운로드 관련 합의 절차는 이후에도 진행됐다. 공식 합의 관리 사이트에 따르면 법원은 2026년 7월 20일 최종 승인을 했고, 9월에는 청구 안내가 진행됐다. 이 절차가 앞서 본 작가들의 다른 요구까지 모두 해결한 것은 아니다. 공식 합의 관리 사이트의 현재 안내
일본 문화청의 설명 역시 데이터 분석을 위한 이용에 일정한 권리 제한이 있음을 안내하면서, 필요한 범위와 권리자의 이익을 부당하게 해치는 경우 등의 조건을 함께 둔다. 이번 거래에 대한 판결은 아니지만, 실물 구입·파일 복제·모델 학습·출력물 이용을 한꺼번에 판단할 수 없는 이유를 보여준다. 일본 문화청의 AI와 저작권 설명
처음의 헌책방 이야기로 돌아오면 아직 비어 있는 자리가 보인다. 최종 구매자는 누구이며, 어떤 책을 어떻게 처리하고 있는가. 원본과 파일은 각각 남는가. 그 자료는 연구자에게만 열리는가, 언젠가 일반 독자도 볼 수 있는가. 이런 답이 나와야 이번 대량 주문을 단순한 매출 증가 이상으로 평가할 수 있다.
AI에 책이 필요할 수 있다는 사실은 이해할 만하다. 인터넷에서 쉽게 얻기 어려운 내용과 다양한 글을 재료로 삼을 수 있기 때문이다. 그 새로운 수요를 평가할 때에는 학습 성능뿐 아니라 책의 이후도 함께 볼 만하다. 누군가 그 내용을 더 알고 싶어졌을 때, 요약된 답변을 넘어 원래 책을 찾아 읽을 길이 마련되어 있는가.
참고자료
- NTV — 일본 헌책 대량 주문 취재의 정식 배포 본문
- Longpre 외 — 학습자료의 나이·영역·품질·유해성 비교
- Fu 외 — 긴 문서를 다루는 모델의 자료 구성 연구
- Bartz 대 Anthropic — 공정이용 결정문
- PFU·Ricoh — ScanSnap SV600 책 스캔 방식
- 일본 국립국회도서관 — Mina Search 본문 검색과 OCR 안내
- Tesseract — 글자 인식 품질과 페이지 구획·표 분석
- Soldaini 외 — Dolma 자료 구성·중복 제거·용도 설명
- Google for Developers — 언어모델 기초 설명
- 일본 국립국회도서관 — 자료를 디지털화하는 이유
- 일본 국립국회도서관 — 디지털 정보의 장기 보존
- 하테나 북마크 — NTV 보도에 달린 공개 반응
- Authors Guild — Anthropic 합의와 작가·출판사 관계 성명
- Bartz 대 Anthropic — 공식 합의 관리 사이트
- 일본 문화청 — AI와 저작권에 관한 일반적 이해 설명