AI 서재
책으로 읽는 AI서재
한 권을 고르고, 목차에서 차례대로 읽을 수 있게 정리했습니다.
PDF 다운로드 책
다국어로 읽는 대학생 교양 인공지능
한국어 원문과 외국어 번역을 함께 실은 유학생용 교재입니다. 각 책 소개 페이지에서 PDF를 받을 수 있습니다.
[AI서재] 인공지능, 동물의 언어를 번역하다 - 제5장 대지의 언어
인공지능, 동물의 언어를 번역하다
제5장 대지의 언어
김경진 변호사
5.1 침팬지의 소리에는 규칙이 있다
사람의 말은 소리 몇 개를 이리저리 이어 붙여 만든다. 몇 안 되는 소리로 끝없이 많은 뜻을 만든다. 오랫동안 사람들은 이런 재주가 오직 사람만의 것이라고 믿었다. 그런데 동물의 소리를 오래 지켜본 학자들이 이 믿음을 다시 보게 되었다.
무대는 아프리카 서쪽 코트디부아르의 타이 국립공원이다. 여기에는 야생 침팬지 무리가 산다. 독일 막스 플랑크 진화인류학 연구소와 프랑스 국립과학연구원의 학자들이 이들을 오래 지켜보았다. 세드리크 지라르뷔토 박사와 로만 위티히 박사가 앞장섰다 [1].
이 연구는 한두 해로 끝나지 않았다. 여러 해에 걸쳐 같은 무리를 지켜본 결과다. 학자들은 다 자란 침팬지 46마리의 소리를 모았다. 녹음한 소리가 4,826개나 되었다. 예전에는 이 소리를 그냥 감정을 드러내는 신음으로만 여겼다. 그러나 하나하나 세어 보니 안에 질서가 있었다.
학자들은 이 많은 소리를 오래 듣고 갈래지었다. 소리의 높낮이와 길이를 자로 재듯 나누었다. 그 결과 침팬지가 쓰는 기본 소리가 12가지로 나뉘었다. 끙끙거림, 짖음, 비명 같은 소리다. 사람 말의 자음과 모음처럼 가장 작은 소리 조각인 셈이다.
침팬지는 이 12가지 소리를 아무렇게나 내지 않았다. 정해진 순서에 따라 이어 붙였다. 그렇게 만든 소리 묶음이 390개가 넘었다. 어떤 순서는 자주 나오고 어떤 순서는 거의 나오지 않았다. 소리를 잇는 데 틀이 있다는 뜻이다.
요즘은 이런 많은 소리를 살필 때 기계학습이라는 인공지능이 학자를 돕는다. 기계학습은 수많은 소리에서 되풀이되는 짜임을 빠르게 찾아낸다. 사람 혼자서는 몇 해가 걸릴 셈을 며칠 만에 해낸다. 규칙을 찾아내는 것은 학자이고, 인공지능은 그 일을 거드는 도구다.
소리 묶음은 층을 이루고 있었다. 두 소리를 이은 묶음이 세 소리 묶음 안에 들어가기도 했다. 사람 말도 이렇게 층을 이룬다. 낱말이 모여 구가 되고, 구가 모여 문장이 되는 것과 같다.
학자들은 사람 말의 큰 특징을 하나 든다. 뜻이 없는 작은 소리 조각을 이어 새 뜻을 만드는 힘이다. 소리 조각 하나에는 뜻이 없다. 이어 붙이는 순서가 비로소 뜻을 만든다. 이런 힘을 소리의 이중 짜임이라고 부른다. 다만 침팬지의 12가지 소리가 사람의 자음, 모음과 똑같지는 않다. 학자들은 아직 조심스럽게 살피고 있다 [2].
시간이 지나 새 연구가 이어졌다. 2025년에 학자들은 침팬지가 소리 두 개를 짝지어 뜻을 바꾼다는 것을 밝혔다. 이런 두 소리 묶음을 살펴보니 16가지가 있었다. 어떤 묶음은 두 소리의 뜻을 그대로 더했다. 어떤 묶음은 아주 새로운 뜻으로 바뀌었다.
예를 들어 어떤 소리 뒤에 다른 소리가 붙으면 뜻이 달라졌다. 나무 위에 잠자리를 만들자는 신호가 되기도 했다. 위험을 알리는 소리와 도움을 부르는 소리를 이어 뱀을 조심하라고 전하기도 했다. 소리 하나일 때와 둘일 때가 서로 다른 뜻을 지녔다 [3].
이런 발견은 사람 말이 어떻게 생겨났는지 알려 주는 발자국이다. 침팬지는 이 소리 묶음으로 위험을 알리고 서로 행동을 맞춘다. 소리를 엮는 재주가 사람만의 것이 아니라는 뜻이다. 침팬지의 소리 규칙은 먼 옛날부터 이어져 온 소통의 흔적을 보여 준다 [4].
[1] Girard-Buttoz, C., Wittig, R. M., et al. (2022). Chimpanzees produce diverse vocal sequences with ordered and recombinatorial properties. Communications Biology, 5, 410. https://doi.org/10.1038/s42003-022-03350-8
[2] Girard-Buttoz, C., et al. (2025). Versatile use of chimpanzee call combinations promotes meaning expansion. Science Advances, 11(19), eadq2879. https://doi.org/10.1126/sciadv.adq2879
[3] Leroux, M., et al. (2023). Call combinations and compositional processing in wild chimpanzees. Nature Communications, 14, 2225. https://doi.org/10.1038/s41467-023-37816-y
[4] Sun, W. (2025, May 9). Origins of language: Wild chimps mirror linguistic structures in human language. Phys.org. https://phys.org/news/2025-05-language-wild-chimps-mirror-linguistic.html
5.2 겔라다개코원숭이의 사람 닮은 말 박자
침팬지가 숲에서 소리 규칙을 보여 주었다면, 다른 원숭이는 사람과 더 닮은 소리를 낸다. 에티오피아의 높은 산에 사는 겔라다개코원숭이(Theropithecus gelada)다. 이들은 험한 바위 절벽에서 큰 무리를 이루고 산다. 서로 나누는 소리가 마치 사람이 도란도란 수다 떠는 것처럼 들린다 [1][2].
겔라다의 소리는 사람 귀에 정답게 들린다. 여러 사람이 낮은 목소리로 웅얼거리는 듯하다. 그 소리가 하루 종일 절벽을 감돈다. 학자들이 오래도록 이 소리에 마음을 빼앗긴 까닭이다.
미국 미시간 대학교의 토어 버그만 교수가 이 소리를 오래 살폈다. 겔라다는 사이좋게 지낼 때 입술을 빠르게 턴다. 이 소리를 입술 털기라고 부른다. 여기에 목을 떨어 내는 굵은 소리를 겹친다. 이 소리를 워블 소리라고 부른다.
버그만 교수는 이 소리의 박자를 재 보았다. 사람은 말할 때 입을 1초에 세 번에서 여덟 번쯤 여닫는다. 겔라다의 워블 소리는 1초에 여섯 번에서 아홉 번을 떤다. 두 박자가 서로 겹친다. 1초에 몇 번 되풀이되는지 세는 단위를 헤르츠(Hz)라고 한다.
이 발견은 2013년에 세상에 나왔다. 사람과 겔라다는 서로 먼 곳에 산다. 그런데도 소리를 내는 박자가 비슷했다. 마치 약속이라도 한 것 같다.
겔라다는 입술만 터는 데서 그치지 않는다. 두 소리를 겹쳐 더 많은 뜻을 담는다. 학자들은 겔라다의 소리를 챠크마개코원숭이의 소리와 견주었다. 함께 어울려 사는 무리가 클수록 소리의 종류도 많았다. 나눌 이웃이 많으면 나눌 말도 많은 셈이다.
요즘은 이런 소리 자료가 아주 많이 쌓였다. 그래서 학자들은 인공지능을 도구로 쓰기 시작했다. 인공지능은 수많은 소리를 빠르게 갈래지어 준다. 귀로만 짐작하던 박자를 숫자로 또렷하게 보여 준다. 밝혀내는 것은 학자이고, 인공지능은 그 일을 거드는 손이다 [3].
여기서 물음이 하나 생긴다. 사람과 겔라다는 조상이 다른데 왜 박자가 닮았을까. 생김새가 다른 동물이 같은 방향으로 나아가는 것을 수렴 진화라고 부른다. 서로 다른 두 반이 따로 만든 응원 구호가 비슷한 박자를 띠는 것과 같다. 비슷한 삶을 살다 보면 비슷한 재주에 이르는 것이다.
[1] Bergman, T. J. (2013). Speech-like vocalized lip-smacking in geladas. Current Biology, 23(7), R268-R269. https://doi.org/10.1016/j.cub.2013.02.038
[2] Gustison, M. L., le Roux, A., & Bergman, T. J. (2012). Derived vocalizations of geladas (Theropithecus gelada) and the evolution of vocal complexity in primates. Philosophical Transactions of the Royal Society B, 367(1597), 1847-1859. https://doi.org/10.1098/rstb.2011.0218
[3] Nature. (2025, September 17). AI is helping to decode animals' speech. Nature News. https://doi.org/10.1038/d41586-025-02917-9
5.3 땅속 벌거숭이두더지쥐의 사투리
밝은 땅 위에서 원숭이가 소리를 나눈다면, 어두운 땅속에도 소리의 사회가 있다. 빛 한 점 없는 흙 굴속이다. 여기에는 벌거숭이두더지쥐(Heterocephalus glaber)가 산다. 이 동물은 개미나 벌처럼 무리를 이룬다. 여왕 한 마리가 새끼를 낳고, 나머지는 일을 나눠 맡는다. 여왕과 일꾼처럼 역할을 나누는 이런 사회를 진사회성이라고 부른다 [1].
독일 베를린의 막스 델브뤼크 센터 연구진이 이들의 소리를 모았다. 앨리슨 바커 박사가 앞장섰다. 벌거숭이두더지쥐는 서로 만나면 부드럽게 짹짹거린다. 연구진은 이런 소리를 3만 개 넘게 모아 하나하나 살폈다. 소리의 높낮이와 길이 같은 여러 특징을 자로 재듯 뽑아냈다 [2].
밝혀낸 사실은 이렇다. 무리마다 저마다 다른 소리 버릇이 있었다. 사람으로 치면 지방마다 다른 사투리와 같다. 이를 땅속 무리 사투리라고 부른다. 벌거숭이두더지쥐는 어두운 굴에서 눈으로 볼 수 없다. 오직 소리로 내 편과 남을 가른다.
굴속은 언제나 캄캄하다. 빛이 없으니 얼굴을 알아볼 길이 없다. 그래서 소리가 이름표 노릇을 한다. 같은 사투리를 쓰면 같은 무리다. 낯선 사투리가 들리면 남의 무리로 여긴다. 소리 하나가 무리를 지키는 문지기인 셈이다.
이 사투리는 타고나는 것이 아니었다. 갓 태어난 새끼는 어른의 소리를 계속 따라 한다. 그러면서 무리의 소리 버릇을 배운다. 다른 무리에서 새로 들어온 쥐도 마찬가지였다. 새 무리의 소리를 따라 하며 그 사투리를 익혔다. 사투리가 핏줄로 정해지지 않고 배움으로 정해진 것이다.
이 배움의 길은 사람 아기가 말을 배우는 길과 닮았다. 아기가 어른 말을 듣고 조금씩 따라 하듯, 새끼 쥐도 그렇게 소리를 배워 갔다 [3].
가장 눈여겨볼 대목은 여왕의 힘이다. 여왕이 살아 있으면 무리의 사투리가 하나로 잘 지켜진다. 그런데 여왕이 갑자기 죽으면 사투리가 흐트러진다. 소리의 규칙이 일제히 흔들렸다. 여왕이 무리의 소리를 하나로 묶는 기둥이었던 셈이다.
이 많은 소리를 갈래짓는 데는 인공지능이 도움이 되었다. 인공지능은 무리마다 다른 소리 버릇을 빠르게 가려냈다. 그러나 사투리를 배움으로 익히고 여왕이 그것을 지킨다는 사실을 밝힌 것은 오랜 관찰이었다. 인공지능은 그 관찰을 거드는 도구였다.
여왕이 무너지면 소리도 무너진다는 사실은 뜻이 깊다. 소리를 하나로 묶는 데는 중심이 있어야 했다. 우리 반이 함께 정한 규칙과도 비슷하다. 규칙을 지키게 하는 중심이 흔들리면 규칙도 흔들린다.
[1] Barker, A. J., et al. (2021). Cultural transmission of vocal dialect in the naked mole-rat. Science, 371(6528), 503-507. https://doi.org/10.1126/science.abc6588
[2] Max Delbrück Center for Molecular Medicine. (2021, January 28). Naked mole-rats 'chirp' in colony-specific, culturally transmitted dialects. EurekAlert! https://www.eurekalert.org/news-releases/510214
[3] Vaidyanathan, G. (2021, February). The queen sets the tone: Deciphering the dialects of naked mole-rats. Mongabay News. https://news.mongabay.com/2021/02/the-queen-sets-the-tone-deciphering-the-dialects-of-naked-mole-rats/
5.4 미어캣의 경고음과 하이에나의 웃음소리
땅 위 여러 동물도 소리에 많은 뜻을 담는다. 미어캣(Suricata suricatta)이 좋은 예다. 미어캣은 적이 하늘에서 오는지 땅에서 오는지 소리로 알린다. 독수리가 오는지, 뱀이 오는지 소리를 달리한다. 위험이 얼마나 급한지까지 소리에 담는다 [1].
이 사실은 스위스의 마르타 만서 교수가 오래전에 밝혔다. 만서 교수는 남아프리카 칼라하리 사막에서 미어캣을 오래 지켜보았다. 경고음을 하나하나 듣고 갈래지었다. 급한 위험일수록 소리가 더 거칠고 시끄러워졌다. 위험의 종류를 알리는 소리와 급함을 알리는 소리가 따로 있었다. 미어캣은 소리 하나로 무리 전체를 함께 움직였다.
요즘은 이런 경고음을 인공지능이 갈래짓기도 한다. 인공지능은 사람이 듣기 어려운 작은 소리 결을 빠르게 가려낸다. 그러나 소리에 위험의 종류와 급함이 담겨 있다는 사실은 오랜 현장 관찰이 먼저 밝힌 것이다.
아프리카 초원의 밤을 다스리는 점박이하이에나(Crocuta crocuta)도 그렇다. 하이에나는 웃는 듯한 소리를 낸다. 이 낄낄 웃음소리에는 여러 정보가 담겨 있다. 프랑스의 니콜라 마트봉 연구진이 이 소리를 살폈다. 어수선한 소음처럼 들리지만 그렇지 않았다. 그 안에는 나이와 무리 안 서열이 담겨 있었다. 저마다 다른 개체를 알리는 표시도 들어 있었다. 사람의 목소리 지문과 같다 [2].
마트봉 연구진은 미국 버클리에 있는 하이에나 17마리의 소리를 녹음했다. 그리고 웃음소리의 두 가지 결을 뽑아냈다. 하나는 입과 목의 모양이 만드는 소리의 무늬다. 이를 포먼트라고 부른다. 다른 하나는 소리의 높낮이다. 이를 피치라고 부른다. 높은 자리의 하이에나와 낮은 자리의 하이에나는 이 두 결이 서로 달랐다. 소리만 들어도 누가 힘이 센지 알 수 있었던 것이다.
사람과 가까운 개(Canis lupus familiaris)도 마찬가지다. 미국 미시간 대학교 연구진이 개 소리를 살폈다. 짖음, 으르렁, 낑낑거림을 모았다. 그리고 사람 말을 분석하던 인공지능을 개 소리에 써 보았다. 이 인공지능의 이름은 웨이브투벡(Wav2Vec2)이다. 그 결과 소리가 장난스러운지 사나운지를 가려냈다. 개의 품종과 암수, 나이까지 어느 정도 알아맞혔다. 맞힌 비율은 70%에 이르렀다. 사람의 말을 다루던 도구가 개 소리에도 통한 것이다 [3].
여기서 물음이 하나 생긴다. 앞에서 겔라다와 사람의 박자가 닮은 것은 수렴 진화라고 했다. 조상은 다른데 비슷한 삶을 살다 보니 닮은 것이다. 그런데 사람과 개가 소리를 내는 바탕은 다른 까닭으로 닮았다. 사람과 개는 다 같은 젖먹이동물이다. 먼 옛날 한 조상에서 갈라져 나왔다. 그래서 목과 성대로 소리를 내는 몸의 짜임이 처음부터 닮았다. 이렇게 조상이 같아 뿌리가 닮은 것을 상동이라고 부른다. 손과 앞발이 같은 뼈에서 갈라진 것과 같다. 닮음에는 이렇게 두 가지 길이 있다. 하나는 따로 살다 비슷해진 길이고, 하나는 한 뿌리에서 갈라진 길이다.
[1] Manser, M. B. (2001). The acoustic structure of suricates' alarm calls varies with predator type and the level of response urgency. Proceedings of the Royal Society B, 268(1483), 2315-2324. https://doi.org/10.1098/rspb.2001.1773
[2] Mathevon, N., et al. (2010). What the hyena's laugh tells: Sex, age, dominance and individual signature in the giggling call of Crocuta crocuta. BMC Ecology, 10, 9. https://doi.org/10.1186/1472-6785-10-9
[3] Abzaliev, A., Pérez Espinosa, H., & Mihalcea, R. (2024). Towards dog bark decoding: Leveraging human speech processing for automated bark classification. Proceedings of LREC-COLING 2024. https://aclanthology.org/2024.lrec-main.1432/
5.5 하나의 인공지능이 여러 동물의 소리를 배우다
지금까지는 학자들이 동물마다 따로 소리를 살폈다. 침팬지는 침팬지대로, 겔라다는 겔라다대로 살폈다. 그런데 요즘은 한 인공지능이 여러 동물의 소리를 함께 배운다 [1].
지구종 프로젝트(Earth Species Project)가 그 앞에 서 있다. 이 단체는 인공지능으로 동물의 소리를 풀려 한다. 이들은 네이처LM오디오(NatureLM-audio)라는 모델을 만들었다. 이것은 동물 소리를 듣고 사람의 물음에 답하는 인공지능이다. 2024년 11월에 처음 선을 보였고, 2025년에 누구나 쓰도록 열어 두었다.
이 모델은 수천 종의 소리를 배웠다. 소리만 듣고 어떤 동물인지 알아맞힌다. 암컷인지 수컷인지, 다 자랐는지 새끼인지도 가려낸다. 녹음 속에 동물이 몇 마리 있는지 세기도 한다. 배우지 않은 재주까지 스스로 보이기도 했다.
이 단체는 2024년 10월에 큰 도움을 받았다. 여러 후원자에게서 연구비 1,700만 달러를 받았다. 우리 돈으로 230억 원이 넘는 큰돈이다. 이 돈으로 연구진을 크게 늘렸다. 단체는 2030년까지 동물의 소리를 크게 밝혀낼 수 있다고 본다 [2].
2026년 여름에는 여러 연구진이 함께 쓸 자료 창고도 열었다. 이 창고의 이름은 동물 언어 처리 데이터(alp-data)다. 흩어져 있던 동물 소리 자료를 한곳에 모은 것이다. 지금은 까마귀, 흰돌고래, 코끼리의 소리를 함께 살핀다. 자료가 모일수록 인공지능은 더 빨리 배운다 [5].
이 흐름을 밀어 주는 상도 생겼다. 콜러 돌리틀 상(Coller-Dolittle Prize)이다. 동물의 소리를 푸는 연구에 힘을 실어 준다. 2026년 수상자는 미국 버클리의 줄리 엘리 박사다. 엘리 박사는 금화조(zebra finch)라는 작은 새의 소리를 풀었다. 이 새가 쓰는 기본 소리 11가지를 찾아냈다. 배고픔, 두려움, 인사 같은 뜻이 담겨 있었다. 엘리 박사도 기계학습이라는 인공지능의 도움을 받았다 [3].
인공지능은 동물 소리에서 사람 말과 같은 아낌의 규칙도 찾아냈다. 사람은 자주 쓰는 말을 짧게 줄여 쓴다. 자주 쓸수록 소리가 짧아지는 것이다. 2025년에 한 학자가 고래 16종의 소리를 살폈다. 그리고 이 소리를 사람의 여러 나라 말 51가지와 견주었다. 혹등고래와 흰긴수염고래의 노래에서도 이런 아낌이 보였다. 자주 부르는 소리일수록 짧았다. 소리를 아껴 쓰는 지혜는 사람만의 것이 아니었다. 다만 모든 고래가 그런 것은 아니어서, 학자들은 더 살펴보고 있다 [4].
침팬지의 소리 규칙, 겔라다의 말 박자, 벌거숭이두더지쥐의 사투리를 떠올려 보자. 이 이웃들의 소리는 우리에게 생각할 거리를 준다. 사람 말은 하늘에서 뚝 떨어진 기적이 아니다. 여러 생명이 함께 딛고 선 넓은 바탕 위에서 피어난 것이다.
인공지능은 소리 안의 규칙을 대신 찾아 준다. 사람 혼자서는 몇 해가 걸릴 일을 며칠 만에 해낸다. 덕분에 학자들은 더 많은 소리를 살필 수 있게 되었다. 그러나 인공지능이 동물의 말을 그대로 옮겨 주는 것은 아니다. 소리를 갈래짓고 규칙을 찾는 일을 거들 뿐이다.
동물의 소리를 알아듣는 일은 이들을 지키는 데도 도움이 된다. 어떤 소리가 두려움을 뜻하는지 알면, 동물이 힘들어하는 때를 알아챌 수 있다. 무엇이 이들을 괴롭히는지도 소리로 짐작할 수 있다. 소리를 읽는 힘이 곧 이웃을 돌보는 힘이 되는 것이다.
우리는 그동안 이 소리들을 수풀 속 잡음으로만 여겼다. 그들이 사는 땅을 함부로 파헤치기도 했다. 그러나 이들은 오래도록 소리로 무리의 역사를 이어 왔다. 이제 우리가 할 일은 인공의 소리를 먼저 들려주는 것이 아니다. 그들의 목소리를 겸손하게 듣는 데서 시작해야 한다.
인공지능은 그 듣기를 돕는 좋은 귀가 되어 준다. 사람이 놓치던 작은 결까지 대신 들어 준다. 그러나 무엇을 들을지, 왜 들을지는 사람이 정한다. 좋은 도구를 쥐고 겸손하게 듣는 마음이 함께 가야 한다. 그래야 대지의 이웃들과 오래 나란히 살 수 있다.
[1] Robinson, D., Miron, M., Hagiwara, M., & Pietquin, O. (Earth Species Project). (2024). NatureLM-audio: An audio-language foundation model for bioacoustics. arXiv:2411.07186. https://arxiv.org/abs/2411.07186
[2] Earth Species Project. (2024, October 17). Earth Species Project secures $17M in grants to apply frontier AI to decoding animal communication. https://earthspecies.org/2024/10/17/earth-species-project-secures-17m-in-grants-to-apply-frontier-ai-to-decoding-animal-communication/
[3] Jeremy Coller Foundation. (2026, July 3). Scientists win US$100,000 in 2026 Coller Dolittle Prize. https://www.jeremycollerfoundation.org/news-and-insights/press-releases/scientists-win-us100-000-in-2026-coller-dolittle-prize
[4] Youngblood, M. (2025). Language-like efficiency in whale communication. Science Advances, 11(6), eads6014. https://doi.org/10.1126/sciadv.ads6014
[5] Earth Species Project. (2026, July 22). Introducing alp-data: A shared data layer for animal language processing. https://earthspecies.org/2026/07/22/introducing-alp-data-a-shared-data-layer-for-animal-language-processing/
















