메타가 현지 시각 10월 7일 올해 상반기 페이스북과 인스타그램에서 아동 성착취 콘텐츠 3,320만 건에 조치했다고 발표했다. 이 가운데 97% 이상은 이용자 신고 전에 자체 시스템이 먼저 찾아냈다. 인도에서는 같은 기간 530만 건에 조치했고, 98% 이상을 신고 전에 탐지했다.
메타는 정상 광고처럼 보이지만 이용자를 외부 불법 사이트로 유도하는 광고를 찾는 대형언어모델(LLM) 시스템을 도입했다. 메타는 이 수법을 ‘사인포스팅(signposting)’이라고 부르며, 탐지를 피하려는 이들이 최근 사용하기 시작한 방식이라고 설명했다. 광고 자체에는 불법 콘텐츠가 없어도 아동 성착취물을 게시한 사이트로 연결되는 경우가 있어, 메타는 광고 내용뿐 아니라 광고가 이용자를 보내는 목적지까지 확인한다. 규정을 어긴 목적지는 차단하고 광고를 집행한 계정도 제재한다.
메타는 기존 시스템이 놓친 콘텐츠를 찾기 위해 AI 검사를 추가했고, 자사 안전장치를 직접 공격해 약점을 찾는 ‘레드팀 AI 에이전트’도 운영한다. 레드팀은 공격자 입장에서 시스템의 허점을 점검하는 작업을 말한다. 계정이 삭제된 뒤 새 계정으로 재가입하는 이용자를 찾는 시스템도 개선했다.
메타는 지난 8월 미국 29개 주가 제기한 아동 안전 소송에서 최대 180억 달러(약 24조 1,000억 원)를 지급하기로 합의했고, 9월에는 샌프란시스코시가 AI로 생성한 아동 성착취 광고를 중단하라고 메타에 요구했다. 메타는 올해 메타 AI 보호자 통제 기능과 왓츠앱 저연령 아동용 계정, 10대 자녀가 인스타그램에서 자해 관련 콘텐츠를 검색하면 부모에게 보내는 알림을 도입했다.
자세한 내용은 메타에서 확인할 수 있다.
▶︎ 관련 기사: 샌프란시스코 시, 메타에 AI 생성 아동 성착취 광고 중단 요구
이미지 출처: 메타
AI Matters 뉴스레터 구독하기



