AI 서재
책으로 읽는 AI서재
한 권을 고르고, 목차에서 차례대로 읽을 수 있게 정리했습니다.
PDF 다운로드 책
다국어로 읽는 대학생 교양 인공지능
한국어 원문과 외국어 번역을 함께 실은 유학생용 교재입니다. 각 책 소개 페이지에서 PDF를 받을 수 있습니다.
[AI서재] 인공지능이 여는 생명과학의 새 시대 - 14.2 AI가 제시하는 임상적 발견의 신뢰성, 재현성 위기 극복 및 인간의 최종 책임과 지혜의 몫
인공지능이 여는 생명과학의 새 시대
14.2 AI가 제시하는 임상적 발견의 신뢰성, 재현성 위기 극복 및 인간의 최종 책임과 지혜의 몫
김경진 변호사
96웰 플레이트를 배양기에 넣고 문을 닫습니다. 화면에는 결합 확률 99퍼센트라는 숫자가 떠 있습니다. 사흘 뒤 플레이트를 꺼내 판독기에 올립니다. 아무 일도 일어나지 않았습니다. 대조군과 구분되지 않는 수치가 96개 칸에 고르게 깔려 있습니다. 실험을 다시 짭니다. 시약을 바꾸고, 세포주를 바꾸고, 농도를 바꿉니다. 결과는 같습니다.
이런 밤은 드물지 않습니다. 2016년 네이처가 연구자 1,576명에게 물었습니다. 70퍼센트가 다른 사람의 실험을 재현하는 데 실패한 적이 있다고 답했습니다. 절반이 넘는 사람은 자기 실험을 자기가 재현하지 못한 경험을 털어놨습니다 [1]. 그보다 11년 전, 존 이오아니디스는 출판된 연구 결과의 상당수가 거짓일 수밖에 없는 이유를 통계로 보였습니다 [2]. 재현성 위기라는 말은 인공지능이 오기 전부터 있었습니다. 인공지능은 그 위기를 만들지 않았습니다. 다만 속도를 붙였습니다.
기계학습이 이 위기에 얹는 문제는 성격이 다릅니다. 사람의 실수가 아니라 평가 설계의 허점에서 옵니다. RNA 이차구조 예측을 예로 들겠습니다. 2026년 3월에 나온 연구는 학습 데이터와 시험 데이터를 서열 유사도 기준으로 제대로 갈라 놓았을 때 순위표가 뒤집힌다는 사실을 보였습니다. 기존 벤치마크에서 앞서던 딥러닝 모델과 RNA 기반모델의 일반화 능력이 과대평가돼 있었습니다 [3]. 단일세포 분야에서도 비슷한 일이 벌어졌습니다. 2026년 2월 연구는 학습 파라미터가 하나도 없는 표현 방식이 대규모 기반모델을 여러 하위 과제에서 앞선다고 보고했습니다 [4]. 유전체 언어모델이 유전자 조절의 위치 논리를 정말 배웠는지 검사한 연구도 있습니다. 조절 요소의 위치를 바꾸면 예측도 따라 바뀌어야 하는데, 모델들은 따라 바뀌지 않았습니다 [5]. 상관관계를 외웠을 뿐 작동 원리를 배우지 못한 것입니다.
더 아픈 사례는 이미지 쪽에 있습니다. 극저온 전자현미경(cryo-EM)으로 단백질 구조를 볼 때, 첫 단계는 사진에서 입자 후보를 골라내는 일입니다. 이 작업은 주형 대조나 딥러닝으로 자동화돼 있습니다. 2025년 연구는 순수한 잡음 이미지에 주형을 대고 입자를 고르면 잡음에서 그럴듯한 구조가 만들어져 나온다는 것을 보였습니다 [6]. 없는 것을 본 셈입니다. 찾으려는 모양을 알려 주면 알고리즘은 그 모양을 찾아 옵니다. 확증 편향이 사람의 눈에서 코드로 옮겨 갔습니다.
전처리 단계도 조용한 함정입니다. 대사체 분석에서는 시료를 기계에 넣고 나서 결과표를 만들기까지 정해야 할 항목이 수십 개입니다. 잡음 제거 방식, 정규화 방법, 결측치 처리 기준이 각각 여러 갈래로 갈립니다. 어느 쪽을 골라도 논문에 쓸 수 있는 근거가 있습니다. 연구자는 보통 한 갈래만 고르고 결과를 냅니다. 2026년 7월에 나온 연구는 여러 갈래를 모두 돌려 본 뒤, 어떤 경로를 거쳐도 살아남는 특징만 최종 목록에 올리는 방식을 내놓았습니다 [7]. 답을 하나 내는 대신, 답이 얼마나 흔들리는지를 먼저 재는 방식입니다.
평가 기반 시설 자체를 다시 짓는 움직임도 있습니다. 세포 이미지 프로파일링 분야의 공개 자료 JUMP는 용량이 115테라바이트에 이릅니다. 이 정도 규모면 연구실마다 필요한 부분만 잘라 쓰게 되고, 그러면 서로의 결과를 나란히 놓고 비교하기 어려워집니다. 2026년 8월에 나온 JUMP-lite는 이 자료를 작고 표준화된 평가 묶음으로 줄여, 누구나 같은 조건에서 세포 표현형 모델을 견주도록 만든 시도입니다 [8]. 벤치마크를 작게 만드는 일은 논문 제목으로 화려하지 않습니다. 그래도 이런 작업이 없으면 순위표의 1위는 아무 뜻이 없습니다.
그래서 요즘 좋은 모델은 답과 함께 자신 없음의 크기를 내놓습니다. 유전체 응용에서 여러 불확실성 추정 기법을 나란히 놓고 비교한 2026년 8월 연구는, 기법마다 신뢰도가 크게 다르며 어떤 것은 실제 오차와 잘 맞지 않는다고 보고했습니다 [9]. 독성 예측에서도 과거 성적을 같은 조건으로 다시 돌려 정리한 재현 가능한 순위표가 나왔습니다 [10]. 점수를 올리는 경쟁에서, 그 점수가 무엇을 뜻하는지 따지는 작업으로 무게가 옮겨 가는 중입니다. 확률 0.99와 확률 0.51을 같은 얼굴로 내미는 모델은 실험대 앞에서 쓸모가 적습니다.
실험실을 벗어나는 순간 조건이 달라진다는 문제도 남습니다. 학습에 쓰는 라벨이 정확한 정답이 아니라 대리 지표인 경우가 흔합니다. 세포 생존율로 약효를 대신 재고, 결합 세기로 치료 효과를 대신 잽니다. 그런데 병원이 바뀌고 장비가 바뀌면 그 대리 지표와 실제 결과 사이의 관계도 함께 바뀝니다. 2026년 4월 연구는 이 현상에 감독 표류(supervision drift)라는 이름을 붙였습니다 [11]. 정답의 정의 자체가 환경마다 움직인다는 뜻입니다. 그런 세상에서도 버티는 예측기를 어떻게 학습시킬지가 지금의 숙제입니다.
임상 성적표는 이 이야기를 숫자로 확인해 줍니다. AI로 발굴한 분자들의 임상 1상 성공률은 80에서 90퍼센트로 업계 평균을 크게 웃돕니다. 그런데 2상 성공률은 40퍼센트 안팎으로, 기존 신약과 거의 같습니다 [12]. 1상은 안전성을 봅니다. 분자의 물리화학적 성질을 잘 설계하면 넘을 수 있습니다. 2상은 효능을 봅니다. 이 병의 원인이 정말 이 표적인지를 사람의 몸이 판정합니다. 인공지능은 분자를 빨리 만들었습니다. 표적이 옳은지는 대신 답해 주지 못했습니다. 2026년 현재 임상에 들어간 AI 발굴 프로그램은 173건을 넘었지만, 아직 승인까지 간 약은 없습니다. 발굴 기간은 몇 년씩 줄었습니다. 임상 2상과 3상의 시계는 그대로 흘러갑니다. 사람에게 약을 먹이고 결과를 기다리는 시간은 알고리즘으로 줄일 수 있는 종류의 시간이 아닙니다.
여기서 갈리는 것이 상관관계와 인과관계입니다. 인공지능은 데이터 안의 규칙을 찾아내는 계산기입니다. 데이터에 담기지 않은 개입의 결과를 스스로 알지는 못합니다. 유전자 조절 생물학에서 제대로 된 기반모델을 만들려면 반쯤 기계론적인 모형, 그러니까 알려진 생물학적 작동 방식을 구조 안에 심어 넣은 모형이 있어야 한다는 주장이 이미 나와 있습니다 [13]. 데이터를 아무리 쌓아도 인과의 사다리를 저절로 올라가지는 못한다는 뜻입니다. 그 사다리를 올리는 일은 실험 설계자의 몫입니다. 무엇을 고정하고 무엇을 바꿀지 정하는 사람, 대조군을 어디에 둘지 정하는 사람이 인과를 만듭니다.
실험 설계 회의의 풍경을 떠올려 보겠습니다. 화이트보드에 후보 열 개가 적혀 있습니다. 누군가 손을 들고 묻습니다. 이 중 셋은 같은 회사 화합물 라이브러리에서 왔는데, 그 라이브러리의 용매가 나머지와 다르지 않으냐고요. 그 한마디로 대조군이 하나 늘어납니다. 용매만 넣은 웰이 플레이트 구석에 자리를 잡습니다. 사흘 뒤 그 웰에서 신호가 나옵니다. 후보 셋의 효과는 화합물이 아니라 용매의 것이었습니다. 모델은 이 질문을 하지 않습니다. 라이브러리의 용매 정보는 학습 데이터 어디에도 들어 있지 않았기 때문입니다.
그러니 해자는 코드가 아닙니다. 알고리즘은 논문과 함께 공개되고, 가중치는 몇 달이면 따라잡힙니다. 남는 것은 두 가지입니다. 하나는 오래 쌓아 온 실험 데이터입니다. 실패한 실험까지 형식을 맞춰 기록해 둔 데이터베이스는 돈으로 사기 어렵습니다. 다른 하나는 질문을 고르는 감각입니다. 어떤 병의 어떤 표적을 왜 지금 건드려야 하는지 아는 사람은 모델이 뱉은 만 개의 후보 중에서 열 개를 집어냅니다. 그 열 개를 고르는 손이 연구의 속도를 정합니다.
인공지능은 하루에 수만 개의 가설을 만듭니다. 그중 무엇을 실험대에 올릴지, 어디서 멈출지, 환자에게 줄 것인지를 정하는 자리는 여전히 비어 있지 않습니다. 유럽의 감사 로그 규정이 요구하는 항목 중에 이런 것이 있습니다. 결과를 검증한 자연인의 신원. 조항의 문장은 건조하지만 뜻은 분명합니다. 기계가 낸 판단 옆에 사람 이름을 적으라는 것입니다.
실험 노트의 마지막 줄에는 확인자 서명란이 있습니다. 오늘도 어느 실험실에서 누군가 그 칸에 이름을 적고 날짜를 씁니다. 3차 반복, 음성, 재설계. 볼펜 자국이 종이 뒷장까지 배어납니다. 그 칸에는 모델 이름이 들어가지 않습니다.
근거 및 참고문헌
[1] Baker, M. (2016). 1,500 scientists lift the lid on reproducibility. Nature, 533(7604), 452-454. https://doi.org/10.1038/533452a
[2] Ioannidis, J. P. A. (2005). Why most published research findings are false. PLoS Medicine, 2(8), e124. https://doi.org/10.1371/journal.pmed.0020124
[3] Chen, Z., et al. (2026). Fair splits flip the leaderboard: CHANRG reveals limited generalization in RNA secondary-structure prediction. arXiv preprint arXiv:2603.22330. https://arxiv.org/abs/2603.22330
[4] Souza, H., & Mehta, P. (2026). Parameter-free representations outperform single-cell foundation models on downstream benchmarks. arXiv preprint arXiv:2602.16696. https://arxiv.org/abs/2602.16696
[5] Cheng, B., & Zhang, J. (2026). The Mechanistic Invariance Test: Genomic Language Models Fail to Learn Positional Regulatory Logic. arXiv preprint arXiv:2604.06549. https://arxiv.org/abs/2604.06549
[6] Balanov, A., et al. (2025). Structure from Noise: Confirmation Bias in Particle Picking in Structural Biology. arXiv preprint arXiv:2507.03951. https://arxiv.org/abs/2507.03951
[7] Al-Huraibi, M. S., et al. (2026). A multiverse-consensus pipeline for reproducible feature selection in untargeted LC-MS metabolomics. arXiv preprint arXiv:2607.17345. https://arxiv.org/abs/2607.17345
[8] Muñoz, A. F., et al. (2026). JUMP-lite: Compact, reproducible benchmarking of cell representations. arXiv preprint arXiv:2608.07632. https://arxiv.org/abs/2608.07632
[9] Saran, S., et al. (2026). Uncertainty-Aware Deep Learning for Genomics Applications: Insights from an Empirical Study. arXiv preprint arXiv:2608.11054. https://arxiv.org/abs/2608.11054
[10] Ebner, A., et al. (2025). Measuring AI Progress in Drug Discovery: A Reproducible Leaderboard for the Tox21 Challenge. arXiv preprint arXiv:2511.14744. https://arxiv.org/abs/2511.14744
[11] Shoeibi, M., et al. (2026). Learning Stable Predictors from Weak Supervision under Distribution Shift. arXiv preprint arXiv:2604.05002. https://arxiv.org/abs/2604.05002
[12] Jayatunga, M. K. P., Ayers, M., Bruens, L., Jayanth, D., & Meier, C. (2024). How successful are AI-discovered drugs in clinical trials? A first analysis and emerging lessons. Drug Discovery Today, 29(6), 104009. https://doi.org/10.1016/j.drudis.2024.104009
[13] Kovačević, L., et al. (2025). No Foundations without Foundations -- Why semi-mechanistic models are essential for regulatory biology. arXiv preprint arXiv:2501.19178. https://arxiv.org/abs/2501.19178
















