DNA 변이 90억 개의 영향을 미리 계산했다…알파게놈 아틀라스가 바꾸는 것은 ‘발견의 순서’다
구글 딥마인드가 2026년 9월 8일 공개한 AlphaGenome Atlas는 인간 유전체의 가능한 단일 염기 변이 약 90억 개에 대해 분자적 영향 예측값을 미리 계산한 데이터 자원이다.
핵심은 규모 자체보다 연구자가 수백만 후보에서 실제 실험할 몇 개를 얼마나 빨리 좁힐 수 있느냐다. 다만 이는 예측 지도로서의 가치이지, 질병 원인 판정이나 임상 진단을 곧바로 대신하는 자료는 아니다.
DNA 변이의 영향을 미리 예측한 자료는 연구에서 먼저 볼 후보를 줄이는 데 쓰인다. 구글 딥마인드는 2026년 9월 8일 AlphaGenome Atlas를 공개하며, 인간 유전체에서 가능한 단일 염기 변이 약 90억 개의 분자적 효과를 사전 계산했다고 밝혔다. 함께 제시된 AVI 점수는 어떤 변이가 RNA 스플라이싱, 유전자 발현, 크로마틴 같은 조절 과정에 더 큰 변화를 일으킬 가능성이 있는지 한눈에 비교하도록 설계됐다.
여기서 단일 염기 변이는 DNA 한 글자가 다른 글자로 바뀌는 경우를 뜻한다. 문제는 이런 변화가 너무 많아 실험실에서 하나씩 확인하기 어렵다는 데 있다. AlphaGenome Atlas는 이 병목을 줄이기 위해 만들어진 예측 데이터베이스다. 실제로 90억 개를 전부 실험한 결과가 아니라, 기존 AlphaGenome 모델의 계산 결과를 유전체 전역에 펼쳐 놓은 모음집에 가깝다.
연구 현장에서 먼저 달라지는 일
유전체 연구의 가장 큰 비용은 데이터를 모으는 일만이 아니라, 의미 있는 변이를 골라내는 일이다. 희귀질환 연구든 대규모 코호트 분석이든, 한 사람 또는 한 집단의 유전체에서는 수많은 변이가 동시에 보인다. 이때 연구자는 통계적으로 보이는 후보, 기존 문헌에 나온 후보, 기능적으로 그럴듯한 후보를 겹쳐가며 우선순위를 정한다.
AlphaGenome Atlas와 AVI 점수는 이 과정에서 기능적 단서를 한 층 더 얹는다. 구글 딥마인드가 공개한 사례를 보면 영국 엑서터대 연구진은 원시 후보 526개를 4개 수준으로 좁히는 데 이 자원을 활용했다. 미국 브로드연구소와의 희귀질환 사례에서도 수백만 개 후보 중 실험할 변이를 추리는 보조도구로 쓰였다. 결국 아틀라스가 바꾸는 것은 답 그 자체보다 발견의 순서다.
AVI 점수는 무엇을 한 숫자로 묶나
AVI는 AlphaGenome의 조절 예측과, 단백질 기능 변화에 초점을 둔 AlphaMissense의 강점을 결합한 점수라고 구글 딥마인드는 설명했다. 연구자는 이 숫자로 변이를 빠르게 정렬한 뒤, 포털에서 왜 높은 점수가 나왔는지 분자 수준의 맥락을 다시 본다. 즉 점수는 입구이고, 해석은 그 다음 단계다.
이 구조는 특히 비암호화 영역 연구에서 의미가 있다. 인간 유전체의 약 2%만 단백질 설계도에 직접 해당하고, 나머지 상당수는 언제 어디서 유전자가 켜지고 꺼질지를 조절한다. 질환 연관 신호가 유전자 바깥에 많이 놓여 있는데도, 그 기능을 설명할 도구는 상대적으로 부족했다. 이번 아틀라스는 그 빈칸을 메우려는 시도다.
예측 지도와 임상 판단은 다르다
다만 이 자료를 질병 진단 도구로 읽으면 곤란하다. 분자적 영향 예측은 어떤 변이가 생물학적 과정을 흔들 가능성을 보여줄 뿐, 그것이 실제 환자의 질환 원인인지까지 곧바로 증명하지는 못한다. 세포 종류, 조직 환경, 다른 유전적 배경, 실제 생체 내 조절망이 함께 작용하기 때문이다.
구글 딥마인드 역시 Atlas를 학술 연구용 자원으로 제시하고 있다. 따라서 올바른 사용법은 높은 AVI 점수를 받은 변이를 바로 결론으로 채택하는 것이 아니라, 통계 분석과 기존 생물학 지식, 후속 실험을 연결하는 것이다. 유전체 AI의 가치는 실험을 없애는 데 있지 않다. 어떤 실험을 먼저 할지 더 정교하게 정하는 데 있다.
연구 속도는 빨라지지만, 검증의 시간은 남는다
AlphaFold가 단백질 구조 탐색의 출발점을 바꿨다면, AlphaGenome Atlas는 변이 해석의 출발점을 바꾸려는 도구에 가깝다. 연구자는 이제 변이를 일일이 계산하기보다 미리 계산된 지도를 검색하고, 거기서 나온 가설을 실험으로 검증하는 흐름을 택할 수 있다. 유전체 연구에서 시간이 가장 많이 드는 구간이 후보 압축이라면, 이번 공개의 의미는 90억이라는 숫자보다 그 병목을 줄였다는 데 있다.
남은 과제도 분명하다. 예측 정확도는 평가 설계와 적용 맥락에 따라 달라질 수 있고, 질환별 임상 해석 성능은 별도로 검증돼야 한다. 그래서 AlphaGenome Atlas는 완성된 답안이 아니라, 더 나은 질문을 고르는 도구로 이해하는 편이 정확하다.
