구글 딥마인드, 인간 게놈의 모든 DNA 문자 변화 예측 지도 AlphaGenome Atlas 공개

구글 딥마인드는 2026년 9월 8일 AlphaGenome Atlas를 공개했다. 인간 유전체에서 가능한 모든 단일 염기 변이, 곧 90억 개 한 글자 변화가 분자생물학에 미치는 영향을 미리 계산해 둔 플랫폼이다. 회사는 이를 유전 돌연변이와 분자 기능을 연결한 가장 포괄적인 목록으로 소개했고, 학술 연구는 직관적인 무료 웹 포털에서 바로 조회할 수 있다.

미리 계산된 유전체 지도와 AVI 점수

Atlas의 뼈대는 기존 모델 AlphaGenome이다. 이 모델은 특정 변이가 생물학적 과정에 미치는 영향을 예측해 연구 현장에서 이미 널리 쓰여 왔다. 딥마인드는 그 예측을 유전체 전체 규모로 미리 계산해, 변이를 하나씩 다시 돌리지 않고도 큰 그림을 보게 했다. 지도책 한 권이 고도와 위치를 겹쳐 땅을 보여 주듯, Atlas는 변이의 분자 효과를 유전체 위에 겹쳐 놓은 자원이다. 데이터셋 크기는 1페타바이트로, AlphaFold Database보다 30배를 넘는다.

변이 하나에는 유전자 조절의 여러 측면에 걸친 수천 개의 분자 효과 예측이 달리고, 범위는 수백 종의 인간과 마우스 세포 유형과 조직이다. 영향이 큰 변화를 빨리 고르라고 만든 숫자가 AlphaGenome Variant Impact, 곧 AVI 점수다. AVI는 조절 효과를 보는 AlphaGenome과, 단백질을 바꾸는 DNA 변이의 영향을 예측하는 AlphaMissense를 한 값으로 합친다. 점수는 대립유전자 해상도로 나오며, 염색질 접근성, 스플라이싱, 보존도처럼 해석 가능한 항목이 각각 얼마나 기여했는지로 다시 나뉜다. RNA 스플라이싱이나 유전자 발현처럼, 어떤 분자 과정이 가장 흔들릴지로 읽으라는 장치다.

여기에 유전체에서 되풀이되는 짧은 서열이 연결된다. 딥마인드는 이 서열을 유전체의 단어라 불렀고, 2,500개를 넘는 모티프와 그 위치를 함께 제공한다. 변이와 그 변이가 건드리는 기능 서열을 한 자리에서 이을 수 있다. 공개 당일부터 웹 포털, AlphaGenome API, 그리고 Google Antigravity 안의 스킬로 접근한다. 빠른 순위 매기기부터 기능의 세부 해석까지, 용도에 따라 층을 골라 쓰는 구조다.

코딩 2% 바깥을 읽어야 했던 이유

구글 블로그에 따르면 인간 유전체는 약 30억 개 염기쌍으로 이뤄져 있다. 단백질을 암호화하는 약 2%는 비교적 잘 알려져 있으나, 나머지 약 98%는 지식이 제한적이다. 딥마인드는 이 비코딩 영역이 유전자 활성을 조율하고, 형질과 연관된 변이의 대부분을 품고 있다고 설명한다. 가능한 한 글자 돌연변이가 약 90억 개에 이르러 실험실에서 전부를 시험하는 일은 사실상 불가능하다. AlphaGenome이 비코딩 한 글자 변화가 단백질 생산 같은 과정을 어떻게 흐트러뜨리는지 보여 준 뒤에도, 유전체 전체를 가로지르는 그림은 따로 필요했다.

설계의 선례로 회사가 든 것은 2022년 AlphaFold Database 확장이다. 실험으로 풀린 약 19만 개 단백질 구조에서 2억 개가 넘는 구조 예측으로 넓혀, 과학에 등재된 단백질 거의 전부를 덮고, 코딩 경험이 없는 연구자도 쓰는 포털을 만들었다. Atlas도 같은 방향으로 방대한 예측을 직관적으로 뒤지게 하는 데 초점을 뒀다. 외부 연구 커뮤니티와의 협업이 설계를 이끌었다. 회사의 자체 시험에서는 AVI가 여러 변이 병원성과 희귀질환 벤치마크에서 최고 수준의 성능을 보였고, 점수는 코딩 약 2%와 비코딩 약 98% 모두에서 작동한다.

희귀질환 연구, 인구 유전학, 그리고 누가 쓰나

희귀질환에서는 수천 개 후보 중 원인 변이 몇 개를 집어내는 일이 오래 병목이었다. GREGoR 컨소시엄과 협력한 연구에서 브로드 연구소의 로라 코빌, 앤 오도널-루리아와 동료들은 이전 연구에서 놓친, 희귀질환을 이끄는 변이를 AVI로 순위에 올렸다. 뇌전증성 뇌병증과 강하게 연관된 DNM1 변이가 나왔고, 그 밑의 AlphaGenome 예측은 잘못된 스플라이스 부위가 생겨 단백질이 비정상적으로 길어진다고 짚었다. 실험 스크리닝이 이 예측을 확인했고, 비슷한 효과를 내는 인근 변이도 찾았다. 구글 블로그는 이 분석을, 해당 사례를 해결하는 데 필요한 근거를 보탠 일로 전했다.

인구 집단의 공통 형질은 결이 다르다. 무해한 유전 변화가 너무 많아, 희귀 비코딩 변이가 형질이나 질병과 연결되는 신호는 통계적 잡음에 묻히기 쉽다. 엑서터 대학교 의학연구위원회 펠로 개러스 호크스는 영국 바이오뱅크 참가자 5만 4,000명 이상의 전장 유전체에 Atlas를 적용했다. 예측된 분자 효과끼리 희귀 변이를 묶자 비코딩 유전 연관이 22% 더 나왔고, 그렇지 않았다면 잡음 속에서 잡히지 않았을 신호였다. 몸속을 도는 주요 단백질의 양을 움직이는 조절 변이가 구체화됐고, 노화와 연결된 PLA2G7과 세포의 산소 감지기 EGLN1이 포함됐다. 체질량지수에서는 수억 개의 비코딩 변이 가운데 Atlas가 영향이 크다고 본 상위 1%에 초점을 맞췄다. 유전 영역 19곳이 지목됐고, 딥마인드는 이 영역이 다음 표적 연구의 방향을 잡아 줄 수 있다고 밝혔다.

모티프 목록은 세포 유형과 유전자마다 어떤 짧은 서열이 분자 과정을 이끄는지 가려내는 데 쓰인다. 전사인자가 붙는 자리를 찾고, 비코딩 변이를 추가로 해석하는 단서가 된다. 스토워스 의학연구소의 줄리아 차이트링거와 멜라니 바일레르트는 전사인자 가운데 DNA 접근성만 바꾸는 것과, 유전자를 켜고 끄는 일까지 하는 것을 나누는 데 이 자원을 사용했다. 계산 연구자와 개발자에게는 API와 Antigravity 스킬이 대규모 질의와 연구 워크플로에 붙는 접점이다. 구글 블로그는 웹 포털이 코딩 없이 쓸 수 있어 임상 연구자와 생물학자에게 같은 데이터를 연다고 전했다. 업계에는 새 치료 표적을 찾고, 유전 질환을 더 잘 이해하며, 이어서 할 실험을 어디에 집중할지 좁히는 용도가 제시됐다. 투자 관점에서 지금 열린 층은 임상 판매 상품보다 연구 인프라에 가깝고, 상업 이용 경로는 구글 클라우드 쪽으로 예고돼 있다. 일반 독자에게 당장의 의미는 개인 검사 결과를 스스로 판독하는 앱이 생긴 일이 아니라, 희귀질환과 체중 같은 공통 형질 연구가 후보를 더 빨리 줄일 수 있게 됐다는 점이다.

임상 사용 경계와 곧 열릴 상업 경로

딥마인드는 Atlas가 제공하는 정보가 전문적인 의학적 조언이나 진단, 치료를 대신하지 않으며, 의료를 포함한 전문적 조언에 해당하지 않는다고 밝혔다. AlphaGenome은 어떤 임상 용도로도 검증되지 않았고 승인되지도 않았다. 희귀질환에서 후보의 순서를 정하고, 공통 형질에서 연관 영역을 좁히는 일은 연구를 어디부터 파고들지 고르는 단계다. 진단이나 치료 방침을 이 점수만으로 정하도록 놓인 도구는 아니다.

이용 조건은 둘로 나뉜다. 비상업 이용은 공개일부터 웹사이트에서 가능하고, 상업 이용은 곧 구글 클라우드에서 제공된다. 기반 모델 AlphaGenome은 이미 학술용으로 깃허브와 AlphaGenome API에 올라가 있고, 상업용으로는 클라우드의 모델 가든에서 쓸 수 있다. 회사는 Atlas를 종착점이 아니라 기준선으로 본다. AlphaGenome 같은 모델이 나아지면 인간 유전체 지도도 더 포괄적이고 정밀해질 것이라는 기대다. 이 자원을 Google Antigravity 같은 에이전트 시스템에 넣어, 생물학자를 위한 더 넓은 통합 해결책의 한 단계로 두겠다는 구상도 함께 적혀 있다. 협업으로 이름이 오른 곳에는 엑서터 대학교, 브로드 연구소, 보스턴 아동병원, 스토워스 의학연구소, 하버드 대학교, 메모리얼 슬로언 케터링 암센터, 매사추세츠 종합병원 유전체의학센터, 캔자스 대학교 의료원 등이 있다.

정리

AlphaGenome Atlas가 연구 현장에 더하는 것은 90억 개 변이를 실험으로 대체하는 속도가 아니다. 어디를 먼저 실험할지 고르는 우선순위와, 그 변이가 조절·스플라이싱·단백질에 어떤 흔적을 남기는지에 대한 단서다. 코딩 영역과 그동안 잡음에 가려지기 쉬웠던 비코딩 변이를 같은 점수 위에서 나란히 볼 수 있게 됐고, 풀리지 않은 희귀질환 사례와 바이오뱅크 규모의 형질 분석에서 그 순서가 이미 쓰였다. 앞으로 확인할 부분은 상업 이용이 구글 클라우드에서 어떤 형태로 열리는지, 후속 모델이 이 기준선을 얼마나 정교하게 다시 쓰는지, 그리고 임상 진단과 치료를 대신하지 않는다는 경계가 이후 활용에서도 어떻게 유지되는지다.

출처: Google DeepMind 블로그 — https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/

교차 확인: Google 블로그 — https://blog.google/innovation-and-ai/models-and-research/google-deepmind/alphagenome-atlas/

댓글

이 블로그의 인기 게시물

테슬라, 오스틴에서 핸들 없는 사이버캡 로보택시 투입

구글, 제미나이 앱에 음악 생성 모델 Lyria 3.5 공개

앤트로픽, 페르마의 마지막 정리 형식화 완성