
새로운 유럽연합 법률에 따라 AI 플랫폼들은 생성 콘텐츠에 워터마킹을 적용하는 새로운 방안을 시행하고 있다. Anthropic은 향후 Claude 모델에 Google이 개발하여 오픈 소스로 공개한 SynthID-Text를 사용할 것이라고 최근 밝혔다. 이 기술은 비밀 키를 사용하여 모델이 문장에서 다음 단어를 선택하는 과정을 미묘하게 변경한다. 예를 들어, 다음 단어 선택에서 ‘cloudy’가 최상위 선택일 수 있지만, 키는 이를 ‘overcast’로 변경할 수 있다. 이 키를 아는 사람은 누구나 해당 플랫폼에서 생성된 것인지 확인할 수 있다.
새로운 연구에 따르면 SynthID-Text는 단어 선택뿐만 아니라 모델이 호출하는 도구와 학습된 안전 가이드라인을 따르거나 무시할 가능성도 변경할 수 있는 것으로 나타났다. 공격자가 모델이 암호나 기타 민감한 정보를 노출하는 등 유해한 작업을 수행하도록 시도하는 적대적 프롬프트 상황에서는 위협이 더욱 커질 수 있다. 일반적으로 따르지 않을 지침이 워터마킹이 배포되면 일부 경우에 수행될 수 있다. 이 발견은 개발자들이 워터마킹이 적용될 때 LLM 및 에이전트의 동작을 철저히 테스트해야 할 필요성을 강조한다.
Lasso Security의 AI 보안 연구원 Andrea Siposova는 Ars와의 인터뷰에서 “워터마킹이 없는 동일한 모델과 비교했을 때, 특히 적대적 조건에 놓이거나 에이전트를 구동할 때 모델이 도구를 호출하도록 만들면 동작이 확실히 달라질 것”이라고 말했다. 그는 “워터마킹은 독자가 인지할 수 없도록 만들어졌지만, 모델이 생성하는 모든 것을 변경하면 어떤 식으로든 절충점이 발생할 것이라는 것을 알고 있다”고 덧붙였다.
SynthID의 핵심 기능은 토너먼트 샘플링으로 알려진 것이다. 스포츠 경기와 유사하게 SynthID는 수많은 다음 단어 토큰 후보를 평가한다. 비밀 키를 사용하여 이들에게 확률 점수를 할당한다. 한 쌍의 토큰이 한 라운드에서 경쟁하며, 더 높은 숨겨진 점수를 가진 토큰이 승리하여 다음 라운드로 진출한다. 이 과정은 최종 승리 토큰이 결정될 때까지 계속된다. 토너먼트 샘플링에 대한 자세한 내용은 여기에서 확인할 수 있다.
Siposova는 Hugging Face의 수정되지 않은 SynthIDTextWatermarkLogitsProcessor를 통해 SynthID-Text의 ‘비왜곡’ 구성을 테스트했다. 그녀는 6개의 오픈 가중치 모델에 유해한 프롬프트를 입력하고 워터마킹을 사용했을 때와 사용하지 않았을 때의 응답을 비교했다. 이 실험은 워터마킹이 유해한 요청에 대한 응답을 변경했으며, 특히 프롬프트 주입 기술을 사용하여 요청했을 때 그 효과가 더 두드러진다는 것을 밝혀냈다.
Siposova는 “워터마킹은 단순 유해 요청에 대한 거부 동작을 변경하지만, 동일한 요청이 프롬프트 주입 기술과 결합될 때 그 효과가 더 뚜렷하다”고 기술했다. “여러 모델에서 워터마킹은 모델이 평소 거부할 유해 요청에 더 잘 응답하도록 만들었다.”
이러한 변화는 LLM 응답뿐만 아니라 모델에 의존하는 AI 에이전트의 후속 행동에도 영향을 미치기 때문에 중요한 안전상의 결과를 초래한다.
연구원은 “모델 수준에서 이는 모델이 유해 요청을 거부하는지 여부와 프롬프트 주입 하에서 거부가 유지되는지 여부를 포함한 안전 동작을 변경할 수 있다”고 기술했다. “에이전트 수준에서 동일하게 샘플링된 토큰은 어떤 도구가 호출되고 어떤 인수가 전달되는지를 결정할 수 있다. 프롬프트 주입은 약화된 거부가 모델이 도구를 통해 행동할 수도 있을 때 더 큰 결과를 초래하기 때문에 이 두 설정을 연결한다. 따라서 이러한 워터마킹 절차는 모델이 말하는 것과 에이전트가 하는 일 모두에 영향을 미칠 수 있다. 우리는 이러한 행동 효과를 샘플링 드리프트라고 부른다.”
또한 흥미로운 점은 모델 응답이 사용된 비밀 키에 따라 다르게 작동했다는 것이다.
이 연구에는 한계가 있다. Claude 모델 응답이 워터마킹 하에서 어떻게 변하는지는 테스트하지 않았다. 대신, 연구원은 토너먼트 샘플링 중에 활성화 및 비활성화할 수 있는 토큰 샘플링에 접근할 수 있도록 6개의 오픈 가중치 모델을 테스트했으며, 다른 설정은 고정했다. 또한 실험은 Hugging Face의 SynthID-Text 토너먼트 샘플링 구현을 테스트했으며, Claude 모델이 사용할 특정 구현은 테스트하지 않았다.
그럼에도 불구하고, 이 결과는 워터마킹 접근 방식의 일부 형태가 모델 및 에이전트 안전에 영향을 미칠 수 있음을 보여준다. 레드팀 해킹 훈련을 통해 플랫폼이 SynthID가 배포될 때 예상대로 작동하는지 스트레스 테스트하는 것이 중요할 것이다.
출처: Ars Technica
원문: https://arstechnica.com/security/2026/09/ai-text-watermarking-can-make-models-more-vulnerable-to-adversarial-prompts/



