AI 서재
책으로 읽는 AI서재
한 권을 고르고, 목차에서 차례대로 읽을 수 있게 정리했습니다.
PDF 다운로드 책
다국어로 읽는 대학생 교양 인공지능
한국어 원문과 외국어 번역을 함께 실은 유학생용 교재입니다. 각 책 소개 페이지에서 PDF를 받을 수 있습니다.
[AI서재] AI 침묵의 글자를 깨우다 - 제10장. 태양의 주기와 동물 인장의 암호를 해킹하다: 인더스 문자와 롱고롱고의 소리
AI 침묵의 글자를 깨우다
제10장. 태양의 주기와 동물 인장의 암호를 해킹하다: 인더스 문자와 롱고롱고의 소리
김경진 변호사
10.1. 사건 파일
도장에 새겨진 네 글자
인더스 문명은 기원전 2600년 무렵부터 기원전 1900년 무렵까지 이어졌다[1]. 터전은 오늘날 파키스탄과 인도 북서부다. 도시의 크기와 수를 보면 청동기 시대에서 손꼽히는 문명이다. 청동기 시대는 쇠보다 청동을 많이 쓰던 옛 시대다. 도시와 마을이 퍼진 땅은 100만 제곱킬로미터가 넘는 것으로 알려져 있다[2].
1920년대에 하라파와 모헨조다로에서 큰 발굴이 시작되었다[1]. 이 일을 총괄한 사람은 영국 고고학자 존 마셜이다. 그는 인도고고조사국의 책임자였다. 하라파 현장은 1921년에 다야 람 사니가 맡아 팠다. 모헨조다로 현장은 1922년에 라칼다스 바네르지가 맡았다. 마셜은 이 발굴들을 묶어 새 문명의 존재를 세상에 알렸다[3].
땅속에서 곧은 벽돌 길과 배수 시설이 나왔다. 그리고 손바닥보다 작은 네모난 도장이 잔뜩 나왔다[1].
도시의 모습만으로도 알 수 있는 것이 많다. 길은 바둑판처럼 곧게 뻗었고 집집마다 하수구가 이어졌다. 벽돌은 크기를 맞춰 구웠다. 무게를 재는 추도 규격이 있었다. 계획을 세우고 규칙을 지키는 사회였다는 뜻이다. 그런데 그들이 남긴 글은 읽히지 않는다.
도장은 활석이라는 무른 돌로 만들었다. 활석은 손톱으로도 자국이 나는 돌이다. 도장 아래쪽에는 동물 그림이 파여 있다. 뿔이 하나 달린 짐승, 혹이 솟은 소, 코끼리 같은 그림이다. 그림 위 빈자리에는 기호가 한 줄로 늘어서 있다[1].
도장은 눌러 찍는 물건이다. 무른 진흙에 대고 누르면 그림과 기호가 그대로 옮겨 간다. 짐을 묶은 끈 위에 진흙을 붙이고 도장을 찍으면 봉인이 된다. 인더스 도시들에서는 도장을 찍은 진흙 봉인도 함께 나왔다[1].
학자들은 이 기호 무리를 인더스 문자 또는 하라파 문자라고 부른다[1]. 이름에 문자가 들어가지만 아직 읽지 못한다. 소리도 뜻도 모른다. 발견된 지 백 년이 넘도록 그렇다[2].
읽지 못한다는 말에는 두 가지 뜻이 겹쳐 있다. 기호의 소리를 모른다는 뜻이 하나다. 기호의 의미를 모른다는 뜻이 다른 하나다. 지금은 둘 다 모르는 상태다.
문제는 길이다. 도장 하나에 새겨진 기호는 보통 네다섯 개뿐이다[1]. 한 면에 새겨진 긴 기록도 열일곱 자를 넘지 않는다. 세 면에 나누어 새긴 것을 다 세어야 스물여섯 자가 된다[4]. 교실에서 쓰는 공책 한 줄도 채우지 못하는 분량이다.
도장이나 그릇에 새긴 이런 글을 명문이라고 부른다. 지금까지 모은 인더스 명문은 3천 점 안팎이다[5]. 점수는 적지 않지만 하나하나가 너무 짧다. 짧은 글만 모아서는 문장의 짜임을 알아내기 어렵다. 주어와 서술어가 어떻게 놓이는지 볼 기회가 없기 때문이다.
바다 건너 나무판의 기호
남태평양 한가운데에 라파누이라는 섬이 있다. 우리에게는 이스터섬이라는 이름이 익숙하다. 사람이 사는 이웃 땅까지 2천 킬로미터가 넘는다. 커다란 돌사람상 모아이로 알려진 곳이기도 하다. 이 섬에서도 뜻 모를 기호가 적힌 나무판이 나왔다. 이 기록은 오늘날 롱고롱고라고 불린다[6].
기호는 붓으로 쓴 글씨가 아니다. 날카로운 흑요석 조각이나 뼈로 만든 도구로 나무를 파서 새겼다. 새겨진 모양은 사람, 새, 물고기를 닮았다[6]. 손발을 든 사람 모양이 자주 나온다.
읽는 방향도 낯설다. 읽는 사람은 판 아래쪽 왼쪽 끝에서 시작한다. 한 줄을 읽고 나면 판을 180도 돌린다. 위아래가 뒤집힌 상태에서 다음 줄을 읽는다. 줄마다 판을 뒤집는 이 방식을 역우행서체라고 부른다[6]. 쉬운 말로는 뒤집어 읽는 방식이다. 옛 그리스에도 줄마다 방향을 바꾸는 글이 있었다. 그쪽은 판을 돌리지 않고 글자의 방향만 바꾼다.
이 방식은 연구자를 한 번 더 시험한다. 어느 줄이 첫 줄인지 정해야 순서가 잡힌다[6]. 순서를 잘못 잡으면 기호가 이어지는 차례가 통째로 뒤바뀐다. 컴퓨터에 자료를 넣기 전에 사람이 먼저 판단해야 하는 대목이다.
남은 유물은 얼마 되지 않는다. 세계의 박물관과 개인 소장가에게 흩어져 있는 진품은 26점이다. 모두 라파누이섬 밖에 있다[6]. 거기 새겨진 기호를 다 합쳐도 약 1만 5천 자다[7]. 책 한 권에도 못 미치는 양이다.
유물이 이렇게 적은 데는 이유가 있다. 19세기에 섬의 인구가 크게 줄었고 나무판도 많이 사라졌다. 남은 것들은 유럽의 박물관과 수도원으로 흩어졌다. 그중 네 점이 로마의 한 수도회에 보관되어 있다[8].
이 나무판이 언제 만들어졌는지도 오래 다투던 문제였다. 유럽 사람이 섬에 들어온 뒤 흉내 내어 만들었다는 의심이 있었다. 2024년에 실비아 페라라 연구진이 로마의 나무판 네 점의 나이를 쟀다[8]. 나무에 남은 탄소의 양을 재어 나이를 알아내는 방법을 썼다. 이 방법을 방사성 탄소 연대 측정이라고 부른다.
네 점 가운데 세 점은 19세기 나무였다. 나머지 한 점은 훨씬 오래된 나무로 나왔다. 유럽 배가 섬에 닿은 1720년대보다 200년 넘게 앞선다[8]. 라파누이 사람들이 스스로 글자를 만들었을 가능성이 커졌다.
연구진은 조건을 하나 달아 두었다. 나무를 벤 때가 기호를 새긴 때와 같지는 않다. 나무의 나이는 새김이 그보다 뒤라는 사실만 알려 준다. 오래된 나무를 나중에 깎아 썼을 수도 있기 때문이다. 이른 연대가 나온 나무판이 한 점뿐이라는 점도 남는다[8].
이것이 글자이기는 한가
두 기호 체계를 두고 학계는 오래 다투었다. 다툼은 해독에서 시작하지 않았다. 이것이 말을 받아 적은 글자가 맞느냐를 먼저 따졌다[1][9].
2004년에 스티브 파머, 리처드 스프롯, 마이클 위첼이 함께 논문을 냈다. 이들은 인더스 기호가 글자가 아니라고 주장했다. 기록이 너무 짧고, 긴 문서가 하나도 없다는 점을 근거로 들었다. 그러니까 이 기호는 집안의 표식이나 물건의 소유 표시, 또는 부적에 가깝다는 뜻이다[9].
반대편에서는 통계로 답을 찾자고 나섰다. 기호가 나오는 빈도와 앞뒤로 붙는 규칙을 세어 보자는 것이다[5]. 사람의 말에는 말버릇 같은 통계 습관이 있다. 그 습관이 기호에도 있는지 재 보자는 접근이다.
이 방법의 장점은 뜻을 몰라도 쓸 수 있다는 데 있다. 기호를 번호로 바꿔 놓고 순서만 세면 된다. 컴퓨터가 잘하는 일이기도 하다.
해독을 가로막는 세 개의 벽
두 기호 체계 모두 아직 해독되지 않았다. 앞을 막는 벽은 세 개다.
대조할 글이 없다. 이집트 상형문자는 로제타석 덕분에 풀렸다. 로제타석에는 같은 내용이 그리스어로도 적혀 있었다. 프랑스 학자 샹폴리옹은 아는 글과 모르는 글을 나란히 놓고 짝을 맞췄다. 같은 내용을 두 가지 말로 나란히 적은 글을 대역본이라고 부른다. 인더스 유적과 라파누이섬에서는 그런 기록이 나오지 않았다[2][6].
어떤 말을 적은 것인지도 모른다. 기호가 받아 적은 실제 말을 바탕 언어라고 부른다. 인더스 문자의 바탕 언어를 두고 드라비다어 계통설과 인도아리아어 계통설이 맞선다. 알려진 어느 어족에도 속하지 않는다는 주장도 있다[2].
남은 벽은 자료의 양이다. 오늘날 인공지능은 방대한 글을 먹고 자란다. 그런데 여기 있는 것은 인더스 도장 몇천 점과 나무판 26점뿐이다[1][6]. 자료가 모자라면 인공지능은 그럴듯한 거짓말을 만들어 낸다. 이 현상을 환각이라고 부른다.
이 세 개의 벽은 서로를 붙들고 있다. 바탕 언어를 알면 소릿값을 맞춰 볼 수 있다. 대역본이 있으면 바탕 언어를 알아낼 수 있다. 자료가 많으면 통계로 실마리를 잡을 수 있다. 어느 하나가 풀리지 않으니 나머지도 제자리다.
2025년 1월 5일에 인도 타밀나두주가 상금을 걸었다. 첸나이에서 열린 인더스 문명 발견 100주년 국제 학술 대회 개막식에서 나온 발표다[10]. 인더스 문자를 고고학 전문가가 인정할 만큼 풀어내는 사람에게 100만 달러를 준다는 내용이다[10][11]. 2026년 9월까지 알려진 수상자는 없다.
[1] Rao, R. P. N., Yadav, N., Vahia, M. N., Joglekar, H., Adhikari, R., & Mahadevan, I. (2009). Entropic evidence for linguistic structure in the Indus script. Science, 324(5931), 1165. https://doi.org/10.1126/science.1170391
[2] Khan, M. A., Khurshid, S. K., & Aslam, M. (2025). Modern algorithms for ancient scripts: A review of AI-based techniques in Indus civilization research. Cultural and Historical Heritage: Preservation, Presentation, Digitalization, 11(2), 11-21. https://doi.org/10.55630/KINJ.2025.110201
[3] Grand Valley State University. (n.d.). Archaeologist of the month: John Marshall. gvsu.edu. https://www.gvsu.edu/archaeology/module-spotlight-view.htm?entryId=A748C17B-A353-F70E-D7422D41F7889433 (2026년 9월 3일 접속)
[4] Farmer, S. (n.d.). Claims concerning the longest Indus "inscription". safarmer.com. https://safarmer.com/indus-longestinscription/ (2026년 9월 3일 접속)
[5] Yadav, N., Joglekar, H., Rao, R. P. N., Vahia, M. N., Adhikari, R., & Mahadevan, I. (2010). Statistical analysis of the Indus script using n-grams. PLoS ONE, 5(3), e9506. https://doi.org/10.1371/journal.pone.0009506
[6] Australian Museum. (2026, 5월 28일). Kohau Rongorongo: Talking tablet. australian.museum. https://australian.museum/learn/cultures/pasifika-collections/rapa-nui-collections/kohau-rongorongo-talking-tablet/ (2026년 9월 3일 접속)
[7] Ross, L. (2026, 3월 31일). Reading Rongorongo (Version 2). Zenodo. https://doi.org/10.5281/zenodo.19362491 (2026년 9월 3일 접속)
[8] Ferrara, S., Tassoni, L., Kromer, B., Wacker, L., Friedrich, M., Tonini, F., Lastilla, L., Ravanelli, R., & Talamo, S. (2024). The invention of writing on Rapa Nui (Easter Island): New radiocarbon dates on the Rongorongo script. Scientific Reports, 14, 2794. https://doi.org/10.1038/s41598-024-53063-7
[9] Farmer, S., Sproat, R., & Witzel, M. (2004). The collapse of the Indus-script thesis: The myth of a literate Harappan civilization. Electronic Journal of Vedic Studies, 11(2), 19-57. https://doi.org/10.11588/ejvs.2004.2.620
[10] The Tribune. (2025, 1월 6일). Stalin announces $1 mn prize for deciphering Indus Valley script. tribuneindia.com. https://www.tribuneindia.com/news/india/stalin-announces-1-mn-prize-for-deciphering-indus-valley-script/ (2026년 9월 3일 접속)
[11] Smithsonian Magazine. (2025, 1월 30일). Officials are offering $1 million to anyone who can decode this ancient script. smithsonianmag.com. https://www.smithsonianmag.com/smart-news/officials-are-offering-1-million-to-anyone-who-can-decode-this-ancient-script-180985922/ (2026년 9월 3일 접속)
10.2. 과학 수사대의 추적: 정보 엔트로피 측정기
글자의 지문을 재는 자
인더스 도장과 라파누이의 나무판은 서로 만난 적이 없다. 그런데 두 곳의 연구자가 같은 도구를 집어 들었다. 뜻을 모르는 기호 줄을 앞에 두고 할 수 있는 일이 비슷했기 때문이다.
읽지 못하는 글자를 앞에 두고 연구자들은 다른 질문을 골랐다. 무슨 뜻이냐고 묻는 대신 어떻게 배열되어 있느냐고 물었다. 뜻을 몰라도 순서는 셀 수 있기 때문이다.
이때 쓰는 도구가 정보 엔트로피다. 엔트로피는 다음에 무엇이 올지 얼마나 알기 어려운가를 재는 값이다. 값이 크면 다음이 예측하기 어렵다는 뜻이다. 값이 작으면 다음이 거의 정해져 있다는 뜻이다.
이 개념은 통신 공학에서 나왔다. 전화선으로 신호를 보낼 때 얼마만큼의 정보가 실리는지 재려고 만든 자다. 뜻과 상관없이 순서만 보고 계산한다. 읽지 못하는 글자에 댈 수 있는 이유가 여기에 있다.
교실 좌석을 떠올리면 이해가 쉽다. 제비뽑기로 앉으면 옆에 누가 올지 알 수 없다. 이때 엔트로피가 높다. 번호순으로 앉으면 옆에 올 사람이 정해진다. 이때 엔트로피가 낮다.
사람의 말은 두 극단 사이에 있다. 문법이 순서를 묶어 두지만 할 말은 자유롭게 고른다. 그래서 사람이 쓰는 말의 엔트로피는 중간 지대에 놓인다. 이 중간 지대를 자로 삼자는 것이 연구의 출발점이다.
우리말로도 확인할 수 있다. "학교에" 다음에 올 말은 여러 가지다. 간다, 갔다, 다녀왔다가 모두 가능하다. 그러나 아무 말이나 오지는 못한다. 선택지가 있되 좁혀져 있는 이 상태가 언어의 특징이다.
인더스 기호를 재 보다
2009년에 라제시 라오와 니샤 야다브를 포함한 연구진이 이 자를 인더스 기호에 댔다. 이들은 앞 기호를 알고 있을 때 다음 기호의 불확실성을 계산했다[1]. 앞 기호를 알 때 다음 기호가 얼마나 예상되는지 재는 이 값을 조건부 엔트로피라고 부른다.
비교 상대도 함께 준비했다. 한쪽에는 영어, 산스크리트어, 수메르어 같은 사람의 말을 놓았다. 다른 쪽에는 사람의 말이 아닌 것을 놓았다. 생물의 유전자 서열, 컴퓨터 프로그램 코드, 무작위로 만든 기호열이 그것이다[1].
결과는 인더스 기호가 사람 말들 쪽에 붙어 나온 것이었다. 무작위 기호열보다 규칙이 뚜렷하고 컴퓨터 코드보다 자유로웠다. 연구진은 이 결과를 사이언스에 실었다[1].
같은 연구진은 확률 모형도 함께 내놓았다. 앞 기호가 정해지면 다음 기호가 나올 확률을 표로 만드는 방식이다. 이렇게 앞 기호만 보고 다음을 셈하는 모형을 마르코프 모형이라고 부른다. 표를 들여다보면 어떤 기호가 글머리에 잘 오는지 드러난다. 어떤 기호가 글 끝에 잘 오는지도 드러난다[2].
같은 연구진은 다음 해에 기호의 빈도도 조사했다. 약 3천 점의 명문을 모으고 그중 상태가 좋은 1,548점을 골랐다. 소수의 기호가 쓰임의 대부분을 차지하고 나머지 기호는 드물게 나왔다. 이 모양은 사람의 언어에서 늘 보이는 분포다[3].
이 분포에는 이름이 있다. 지프의 법칙이라고 부른다. 자주 쓰는 낱말 몇 개가 글의 대부분을 채운다는 규칙이다. 우리말도 은, 는, 이, 가 같은 낱말이 앞줄을 차지한다. 반대로 한 번만 나오고 마는 낱말은 아주 많다. 인더스 기호도 같은 모양을 보였다[3].
놓이는 순서에서도 규칙이 드러났다. 기호 23개가 글의 끝 80퍼센트를 차지했다. 반대로 글머리 80퍼센트를 채우려면 기호 82개가 필요했다[3]. 끝에 오는 기호가 훨씬 한정되어 있다는 뜻이다. 우리말에서 문장 끝에 조사나 어미가 몰리는 모습과 비슷하다.
연구진은 앞 기호로 다음 기호를 맞히는 모형도 만들었다[2]. 이 모형은 마모되어 읽기 어려운 기호를 약 75퍼센트 확률로 되살렸다[3]. 규칙이 있어야 나올 수 있는 성적이다.
되살린다는 말을 오해하면 안 된다. 모형이 채워 넣는 것은 기호의 모양뿐이다. 그 기호가 무슨 소리였는지는 여전히 모른다. 빠진 퍼즐 한 칸을 채워 준 것이지 그림을 읽어 준 것이 아니다.
반박과 되받는 반박
이 모형에는 한계도 있다. 앞의 한두 기호만 보고 다음을 맞히는 방식이기 때문이다[2]. 사람의 문장은 훨씬 멀리 떨어진 말끼리 호응한다. 자료가 짧으면 그 먼 호응을 배울 수 없다.
이 결과에 대해 곧바로 반박이 나왔다. 리처드 스프롯이 2010년에 비판 글을 실었다. 엔트로피 값이 비슷하다는 사실만으로는 글자라고 못 박을 수 없다는 지적이다. 사람 말이 아닌 기호 체계도 비슷한 값을 낼 수 있다는 것이다[4].
라오 연구진은 같은 해에 같은 학술지에서 답을 냈다. 자신들은 인더스 기호가 글자임을 증명한 것이 아니라고 밝혔다. 글자일 가능성을 통계로 뒷받침했을 뿐이라는 설명이다[5].
스프롯은 2014년에 비판을 한 걸음 더 밀고 나갔다. 그는 사람 말이 아닌 기호 자료를 여러 벌 모았다. 메소포타미아의 신 표시, 북아메리카의 토템 기둥, 헛간 벽에 그리는 별무늬가 그것이다. 날씨 예보에 쓰는 그림도 넣었다. 이 자료들과 인더스 기호를 같은 잣대로 견주었다[6].
그가 만든 판정 절차는 인더스 기호를 사람 말이 아닌 쪽으로 분류했다. 스프롯은 통계만으로는 부족하다고 적었다. 해독에 성공하거나 그 문화가 글을 썼다는 고고학 증거가 따로 있어야 한다는 주장이다[6]. 이 논쟁은 아직 끝나지 않았다.
2026년 4월에 나온 새 분석도 같은 물음 앞에 선다. 아시시 나이르는 인더스 명문 1,916점을 놓고 검사를 다시 설계했다. 그는 사람 말이 아닌 기호 체계를 흉내 낸 가짜 자료를 컴퓨터로 만들었다. 진짜 인더스 자료와 가짜 자료의 통계를 나란히 놓고 견주었다[7].
인더스 자료는 어느 가짜 자료와도 딱 맞아떨어지지 않았다. 두 가짜 자료 사이의 중간에 놓였다. 실제로 존재하는 어떤 비언어 기호 체계도 인더스 통계를 그대로 재현하지 못했다. 나이르는 이것이 글자인지 아닌지 판정을 미뤄야 한다고 적었다. 이 글은 학술지 심사를 거치기 전에 인터넷에 먼저 올린 사전 공개본이다[7].
기호를 알아보는 눈
통계 이전에 해야 할 일이 있다. 돌에 새겨진 흐릿한 자국을 기호로 옮겨 적는 일이다. 이 작업은 오랫동안 사람의 눈과 손에 기댔다.
옮겨 적기는 생각보다 어렵다. 도장은 4천 년 동안 닳았다. 같은 기호라도 새긴 사람에 따라 모양이 조금씩 다르다. 두 개의 기호로 볼지 하나의 기호로 볼지 판단이 갈리기도 한다. 이 판단이 달라지면 뒤따르는 통계도 달라진다.
2017년에 사티시 팔라니아판과 로노조이 아디카리가 이 일을 컴퓨터에 맡겼다. 도장 사진을 넣으면 기호 목록이 나오는 처리 흐름을 만들었다[8].
2025년에는 바이슈나비 딕시트 연구진이 이 흐름을 이어받았다. 인장 사진에서 기호를 알아보는 신경망과 동물 그림을 알아보는 신경망을 따로 만들었다. 자료를 다섯 몫으로 나눠 돌아가며 시험했다. 두 신경망 모두 평균 85퍼센트 안팎의 정확도를 보였다[9].
이 문제를 줄이려면 판단 기준을 공개하고 서로 견주어야 한다. 2025년에 무자파르 알리 칸 연구진이 그 작업을 정리했다. 2009년부터 2025년까지 나온 인더스 문자 관련 인공지능 연구를 모아 유형별로 나누었다. 자주 되풀이되는 실수도 함께 적었다[10].
2025년에 아툴 샤르마와 슈바지트 로이 초두리가 도구를 하나 공개했다. 이름은 AI-EPIGRAPHY다. 사용자가 기호 순서를 넣으면 확률이 높은 해석 후보를 돌려준다. 빈도 분석과 연쇄 확률 계산을 묶어 놓은 도구다[11].
2026년 5월에는 자료 기반 자체를 다시 짜는 시도가 발표되었다. 베아타 메제시 연구진은 희귀하고 읽지 못하는 문자를 한데 모으는 데이터베이스를 만들었다. 고화질 사진, 옮겨 적은 기호, 주석, 출처 정보를 하나의 틀에 담았다. 흩어진 자료를 모으는 일이 해독보다 앞선 숙제라는 판단이다[12].
[1] Rao, R. P. N., Yadav, N., Vahia, M. N., Joglekar, H., Adhikari, R., & Mahadevan, I. (2009). Entropic evidence for linguistic structure in the Indus script. Science, 324(5931), 1165. https://doi.org/10.1126/science.1170391
[2] Rao, R. P. N., Yadav, N., Vahia, M. N., Joglekar, H., Adhikari, R., & Mahadevan, I. (2009). A Markov model of the Indus script. Proceedings of the National Academy of Sciences, 106(33), 13685-13690. https://doi.org/10.1073/pnas.0906237106
[3] Yadav, N., Joglekar, H., Rao, R. P. N., Vahia, M. N., Adhikari, R., & Mahadevan, I. (2010). Statistical analysis of the Indus script using n-grams. PLoS ONE, 5(3), e9506. https://doi.org/10.1371/journal.pone.0009506
[4] Sproat, R. (2010). Ancient symbols, computational linguistics, and the reviewing practices of the general science journals. Computational Linguistics, 36(3), 585-594. https://doi.org/10.1162/coli_a_00011
[5] Rao, R. P. N., Yadav, N., Vahia, M. N., Joglekar, H., Adhikari, R., & Mahadevan, I. (2010). Entropy, the Indus script, and language: A reply to R. Sproat. Computational Linguistics, 36(4), 795-805. https://doi.org/10.1162/coli_c_00030
[6] Sproat, R. (2014). A statistical comparison of written language and nonlinguistic symbol systems. Language, 90(2), 457-481. https://doi.org/10.1353/lan.2014.0031
[7] Nair, A. (2026, 4월 20일). How non-linguistic is the Indus sign system? A synthetic-baseline scorecard. arXiv:2604.17828. https://arxiv.org/abs/2604.17828 (2026년 9월 3일 접속)
[8] Palaniappan, S., & Adhikari, R. (2017). Deep learning the Indus script. arXiv:1702.00523. https://arxiv.org/abs/1702.00523
[9] Dixit, V., Hussain, N., Basak, S., Atturu, D., Mitra, D., & Bhattacharya, U. (2025). Deep learning in archiving Indus script and motif information. Journal of Computer Applications in Archaeology, 8(1), 156-169. https://doi.org/10.5334/jcaa.175
[10] Khan, M. A., Khurshid, S. K., & Aslam, M. (2025). Modern algorithms for ancient scripts: A review of AI-based techniques in Indus civilization research. Cultural and Historical Heritage: Preservation, Presentation, Digitalization, 11(2), 11-21. https://doi.org/10.55630/KINJ.2025.110201
[11] Sharma, A., & Roy Chowdhury, S. (2025). AI-EPIGRAPHY: An interactive tool for computational decipherment of the Indus Valley script. Proceedings of IndiaHCI '25. https://doi.org/10.1145/3768633.3770145
[12] Megyesi, B., Rattenborg, R., Lang, B., Waldispuhl, M., & Heder, M. (2026). Building a corpus and database for rare and undeciphered scripts. Proceedings of the Fourth Workshop on Language Technologies for Historical and Ancient Languages (LT4HALA 2026) @ LREC 2026, 184-196. ELRA Language Resources Association. https://aclanthology.org/2026.lt4hala-1.17/ (2026년 9월 3일 접속)
10.3. 밝혀진 진실
달을 세는 나무판
라파누이의 나무판 가운데 마마리라는 이름이 붙은 것이 있다. 이 나무판에는 다른 곳과 생김새가 다른 구간이 있다. 초승달 모양 기호가 줄줄이 이어진다[1].
독일 학자 토마스 바르텔이 20세기 중반에 이 구간을 주목했다. 그는 이것이 달의 날짜를 적은 기록이라고 보았다[1]. 1990년에 자크 기가 자료를 다시 정리해 같은 결론을 폈다[2].
2011년에 폴 홀리가 이 해석을 더 다졌다. 마마리 나무판의 달력은 서른 밤으로 이루어져 있다. 이 숫자는 실제 달의 주기와 맞는다. 폴리네시아 여러 섬의 달력과도 맞는다[1].
홀리는 타히티와 뉴질랜드의 달력도 함께 놓고 견주었다. 밤마다 붙는 이름이 섬마다 비슷했다. 라파누이의 달력은 다른 섬들보다 사흘쯤 밀려 있었다. 섬이 멀리 떨어져 있는 동안 생긴 차이로 보인다[1].
기호 배치도 규칙을 따랐다. 초승달 기호 사이사이에 다른 기호가 끼어들어 여덟 무리로 나눈다. 마지막 두 개의 초승달은 달이 보이지 않는 밤을 가리킨다[1].
같은 배열이 나무판 밖에서도 나온다. 섬의 바위그림 가운데 거북 무늬와 초승달이 함께 새겨진 것이 있다. 거기서도 마지막 두 초승달이 거북의 등딱지 안에 놓여 있다. 나무판이 달 없는 밤을 따로 떼어 그린 방식과 같다[1]. 나무판과 바위가 같은 셈법을 나눠 가졌다.
이 해석은 롱고롱고 연구에서 폭넓게 인정받는다. 그렇더라도 읽어 낸 것은 날짜의 순서다. 라파누이 사람들이 그 밤을 무엇이라 불렀는지는 모른다.
인공지능이 낸 답과 그 무게
달을 세는 일과 해를 세는 일은 붙어 있다. 일식은 해와 달이 겹칠 때 일어난다. 그래서 달력을 읽어 냈다는 주장은 곧 하늘 전체를 읽어 냈다는 주장으로 번진다.
2026년 3월에 로건 로스가 사전 공개 논문을 냈다. 그는 개인 컴퓨터에서 언어 모형을 돌려 롱고롱고를 분석했다. 기호 89개로 이루어진 사전을 만들었고, 이것으로 남은 기록의 97퍼센트 가까이를 덮었다고 주장했다. 마마리 나무판이 일식과 월식을 예측하는 표라는 주장도 폈다[3].
이 주장은 아직 학계의 검증을 거치지 않았다. 로스의 글은 학술지 심사를 통과한 논문이 아니다. 인터넷 저장소에 먼저 올린 사전 공개본이다[3]. 사전 공개본은 누구나 올릴 수 있다. 내용이 맞는지는 다른 연구자들이 뒤이어 따져 보아야 한다.
이런 주장을 다룰 때는 검사 방법을 함께 보아야 한다. 남은 롱고롱고 기록은 26점, 약 1만 5천 자다[3]. 자료가 이만큼뿐인 곳에서는 우연히 들어맞는 결과가 나오기 쉽다. 기호 89개에 소릿값을 자유롭게 배정하면 어떤 문장이든 만들어 낼 수 있다. 그래서 학계는 다른 사람이 같은 방법으로 같은 결과를 얻는지를 먼저 묻는다.
진짜 해독이라면 통과해야 하는 시험이 있다. 해독안을 만들 때 쓰지 않은 다른 나무판을 가져와 읽어 보는 것이다. 거기서도 뜻이 통하는 문장이 나와야 한다. 미케네 그리스어를 적은 선형문자 B가 그 시험을 통과한 예다[4]. 롱고롱고와 인더스 문자는 아직 그 문턱을 넘지 못했다.
기계가 하는 일과 못 하는 일
지금까지 인공지능이 이 두 문자에서 해낸 일은 분명하다.
기계는 흐릿한 자국에서 기호를 알아본다[5]. 사람이 눈으로 대조하려면 몇 달 걸릴 일을 몇 시간에 끝낸다. 마모되어 읽기 어려운 기호를 앞뒤 맥락으로 되살리기도 한다[6]. 흩어진 유물의 사진과 기록을 한 곳에 모아 검색할 수 있게 만든다[7].
자료를 모으는 일은 눈에 잘 띄지 않는다. 그러나 이 일이 없으면 뒤따르는 계산도 없다. 사진의 밝기와 각도가 제각각이면 기호를 견줄 수 없다. 옮겨 적는 규칙이 연구자마다 다르면 통계도 어긋난다. 2026년에 나온 데이터베이스는 그 기준을 하나로 맞추려는 시도다[7].
통계 쪽에서도 성과가 있다. 인더스 기호가 무작위 배열이 아니라는 사실은 여러 연구가 확인했다[6][8]. 배열에 규칙이 있다는 결론은 되풀이해 재현되었다. 그렇다고 이것이 글자라는 결론은 아니다. 규칙이 있다는 말과 말을 받아 적었다는 말은 다르다.
그러나 기계가 하지 못한 일이 더 크게 남아 있다. 인더스 기호 하나하나의 소릿값은 여전히 모른다[9]. 롱고롱고 기호의 소릿값도 모른다[3]. 두 문자 모두 뜻을 확정한 낱말이 아직 없다. 인더스 도장에 적힌 것이 사람 이름인지 물건 이름인지도 정해지지 않았다[9].
이유는 자료의 성질에 있다. 대역본이 있으면 해독이 훨씬 쉬워진다. 인더스 유적에도 라파누이섬에도 그런 글은 없다[9]. 대역본 없이 풀린 예가 없지는 않다. 선형문자 B가 그렇게 풀렸다. 대신 그때는 바탕 언어를 짐작할 실마리가 있었고 자료도 넉넉했다[4]. 인더스 문자는 바탕 언어가 무엇인지도 정해지지 않았다[9]. 롱고롱고는 남은 글이 너무 적다[3].
2026년 4월의 분석은 이 사정을 숫자로 다시 보여 주었다. 인더스 명문 1,916점은 사람 말의 통계와도, 사람 말이 아닌 기호의 통계와도 딱 맞지 않았다[10]. 백 년 넘게 이어진 물음이 아직 열려 있다는 뜻이다.
기다리는 쪽에 서서
읽지 못한 글자를 다루는 연구는 두 가지 태도를 요구한다. 하나는 새 도구를 끝까지 밀어붙이는 태도다. 다른 하나는 나온 결과를 의심하는 태도다.
인공지능은 앞의 일을 잘한다. 세고, 견주고, 후보를 늘어놓는다. 뒤의 일은 사람의 몫이다. 후보 가운데 무엇이 그 시대에 있을 법한지 판단해야 한다. 그 판단에는 유적의 위치, 무덤에서 나온 물건, 남아 있는 구전이 함께 들어간다.
라파누이의 달력 해석이 그 예다. 초승달 기호를 세는 일은 계산이다. 그 서른 밤을 폴리네시아 여러 섬의 달력과 견주는 일은 고증이다[1]. 두 작업이 맞물렸을 때 해석이 설득력을 얻었다.
인더스 도장의 동물 그림도 그런 자료다. 뿔 하나 달린 짐승이 무엇을 뜻했는지 우리는 모른다. 마마리 나무판의 서른 밤도 마찬가지다. 순서는 알아냈지만 그 밤에 사람들이 무엇을 했는지는 모른다.
모른다고 말하는 일에도 값어치가 있다. 어디까지 밝혀졌고 어디부터 추측인지 선을 그어야 다음 연구가 시작된다. 선을 흐리면 그럴듯한 이야기가 사실 행세를 한다. 읽지 못한 글자를 다루는 연구에서 이 선 긋기는 결과를 내는 일만큼 중요하다.
이 장에서 다룬 두 문자는 서로 만난 적이 없다. 시대도 3천 년 넘게 떨어져 있고 사는 곳도 지구 반대편이다. 그런데 연구자들이 겪는 어려움은 거의 같다. 짧은 자료, 없는 대역본, 모르는 바탕 언어다. 같은 도구가 두 곳에서 함께 쓰이는 까닭이 여기에 있다.
타밀나두주가 내건 100만 달러도 그 사정을 비춘다[11]. 상금이 걸린 지 한 해가 넘도록 주인이 나오지 않았다. 계산기는 빨라졌지만 열쇠는 아직 나오지 않았다.
[1] Horley, P. (2011). Lunar calendar in rongorongo texts and rock art of Easter Island. Journal de la Societe des Oceanistes, 132, 17-38. https://doi.org/10.4000/jso.6314
[2] Guy, J. B. M. (1990). The lunar calendar of Tablet Mamari. Journal de la Societe des Oceanistes, 91(2), 135-149. https://doi.org/10.3406/jso.1990.2882
[3] Ross, L. (2026, 3월 31일). Reading Rongorongo (Version 2). Zenodo. https://doi.org/10.5281/zenodo.19362491 (2026년 9월 3일 접속)
[4] Chadwick, J. (1958). The decipherment of Linear B. Cambridge University Press.
[5] Palaniappan, S., & Adhikari, R. (2017). Deep learning the Indus script. arXiv:1702.00523. https://arxiv.org/abs/1702.00523
[6] Yadav, N., Joglekar, H., Rao, R. P. N., Vahia, M. N., Adhikari, R., & Mahadevan, I. (2010). Statistical analysis of the Indus script using n-grams. PLoS ONE, 5(3), e9506. https://doi.org/10.1371/journal.pone.0009506
[7] Megyesi, B., Rattenborg, R., Lang, B., Waldispuhl, M., & Heder, M. (2026). Building a corpus and database for rare and undeciphered scripts. Proceedings of the Fourth Workshop on Language Technologies for Historical and Ancient Languages (LT4HALA 2026) @ LREC 2026, 184-196. ELRA Language Resources Association. https://aclanthology.org/2026.lt4hala-1.17/ (2026년 9월 3일 접속)
[8] Rao, R. P. N., Yadav, N., Vahia, M. N., Joglekar, H., Adhikari, R., & Mahadevan, I. (2009). Entropic evidence for linguistic structure in the Indus script. Science, 324(5931), 1165. https://doi.org/10.1126/science.1170391
[9] Khan, M. A., Khurshid, S. K., & Aslam, M. (2025). Modern algorithms for ancient scripts: A review of AI-based techniques in Indus civilization research. Cultural and Historical Heritage: Preservation, Presentation, Digitalization, 11(2), 11-21. https://doi.org/10.55630/KINJ.2025.110201
[10] Nair, A. (2026, 4월 20일). How non-linguistic is the Indus sign system? A synthetic-baseline scorecard. arXiv:2604.17828. https://arxiv.org/abs/2604.17828 (2026년 9월 3일 접속)
[11] The Tribune. (2025, 1월 6일). Stalin announces $1 mn prize for deciphering Indus Valley script. tribuneindia.com. https://www.tribuneindia.com/news/india/stalin-announces-1-mn-prize-for-deciphering-indus-valley-script/ (2026년 9월 3일 접속)
















