구글 딥마인드가 AI로 설계한 단백질과 생체분자 구조에 식별 신호를 삽입하는 워터마크 기술 ‘신스ID 바이오(SynthID Bio)’를 현지 시각 9월 30일 공개했다. 관련 논문은 국제 학술지 네이처에 게재됐다. 딥마인드는 생물보안과 과학 연구의 신뢰성을 높이기 위한 개념 증명 단계의 기술이라고 소개했다.
신스ID 바이오는 아미노산 서열에 적용하는 방식과 3차원 구조에 적용하는 방식으로 구성된다. 서열 방식은 단백질 설계 도구 프로틴MPNN에 적용되며, 비밀 키와 앞선 아미노산 정보를 이용해 다음 아미노산 선택에 미세한 편향을 준다. 검출할 때는 같은 비밀 키로 점수를 다시 계산해 워터마크 여부를 판별한다. 구조 방식은 알파폴드 3 신경망의 일부를 미세조정해 워터마크를 모델 가중치에 반영한다. 미세조정은 학습을 마친 모델을 특정 목적에 맞게 추가로 훈련하는 기법이다.
서열 방식은 오탐률을 0.1%로 맞춘 기준에서 워터마크를 넣은 설계를 100% 검출했다. 오탐률은 워터마크가 없는 설계를 워터마크가 있다고 잘못 판정하는 비율이다. 구조 방식은 같은 기준에서 99.8% 넘는 검출률을 기록했다.
딥마인드는 바이오 기업 어댑티브 바이오와 함께 VEGF-A, 코로나19 바이러스 스파이크 단백질의 수용체 결합 부위, PD-L1에 결합하는 단백질을 워터마크와 함께 설계하고 실험실에서 검증했다. 워터마크를 넣은 설계는 일반 설계와 같은 수준의 적중률과 결합력, 서열 다양성을 기록했다. 딥마인드는 기능을 갖춘 워터마크 단백질 결합체를 처음 구현했다고 밝혔다. 스탠퍼드대·아크연구소 연구팀과는 AI 모델 이보 2로 설계한 박테리오파지 유전체에도 워터마크를 적용했다. 초기 세균 실험에서 이 박테리오파지가 정상적으로 기능하는 것으로 확인됐으며, 관련 논문은 곧 공개될 예정이다.
딥마인드는 DNA 합성 업체가 주문을 검사할 때 신뢰할 수 있는 모델에서 설계된 서열인지 자동으로 확인하는 용도를 제시했다. 단백질 데이터 뱅크, 유니프롯, 젠뱅크 같은 공개 데이터베이스에서 AI가 생성한 항목을 구분하는 데도 활용할 수 있다. 코드와 실험 데이터는 오픈소스로 공개하고, 모델 가중치는 연구자들에게 제공한다.
딥마인드는 워터마크가 있는지 없는지만 판별할 수 있고 누가 설계했는지는 구분하지 못한다고 밝혔다. 프로틴MPNN으로 서열을 다시 설계하면 워터마크가 제거될 수 있고, 구조 방식의 워터마크는 원자 배치를 에너지가 안정된 형태로 조정하는 구조 이완 과정을 거치면 유지되지 않는다. 딥마인드는 의도적인 변조에 대한 대응력 확보를 다음 과제로 제시했다. 사라 카터 사이언스 폴리시 컨설팅 대표는 “신스ID 바이오는 생물학적 설계의 출처를 추적하는 데 중요한 요소”라고 말했다. 제임스 디건스 트위스트 바이오사이언스 정책·생물보안 부사장은 “워터마킹은 합성 검사를 강화할 수 있는 새로운 생물보안 수단”이라고 평가했다.
자세한 내용은 구글 딥마인드(Google DeepMind)에서 확인할 수 있다.
이미지 출처: 구글 딥마인드
AI Matters 뉴스레터 구독하기




아