비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

마이크로소프트가 밝힌 AI 안전성의 현주소...인간의 판단이 더욱 중요해진다

2025.01.15. 13:07:20
조회 수
288
6

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

Lessons from red teaming 100 generative AI products



AI 레드팀이 발견한 8가지 핵심 교훈

마이크로소프트 AI 레드팀(AIRT)이 100개 이상의 생성형 AI 제품을 테스트한 결과를 담은 보고서에 따르면, AI 시스템의 안전성과 보안성 평가를 위해서는 시스템의 기능과 적용 범위에 대한 이해가 선행되어야 한다. 연구팀은 AI 시스템 테스트를 통해 얻은 8가지 주요 교훈을 공개했다. 여기에는 AI 시스템의 기능과 적용 범위 이해, 단순한 기법의 효과성, 보안 벤치마크와의 차별성, 자동화의 중요성, 인간 요소의 필수성, RAI(Responsible AI) 위험의 만연성과 측정의 어려움, LLM이 보안 위험을 증폭시키는 특성, 그리고 AI 시스템 보안의 지속적인 발전 필요성이 포함됐다.

급변하는 AI 보안 위험 지형도

보고서는 AI 보안 테스트의 양상이 크게 변화했음을 보여준다. 2021년에는 보안 취약점 평가가 80%를 차지했으나, 2024년에는 안전성 평가가 80%까지 증가했다. 특히 챗GPT 출시 이후 등장한 AI 코파일럿은 LLM을 다른 소프트웨어 구성 요소와 연결하는 새로운 패러다임을 가져왔다. 현재 AI 레드팀은 모델(24%), 코파일럿(15%), 플러그인(16%), 앱 및 기능(45%) 등 다양한 형태의 AI 제품을 테스트하고 있다.

자동화와 인간 전문성의 조화

연구팀은 복잡해진 위험 평가를 위해 PyRIT이라는 오픈소스 프레임워크를 개발했다. 이 도구는 프롬프트 데이터셋, 자동화된 공격 전략, 다중모달 출력 평가 등 다양한 기능을 제공한다. 그러나 의학, 사이버보안, CBRN(화생방) 등 전문 분야에서는 자동화된 평가만으로는 불충분하며, 해당 분야 전문가의 직접적인 평가가 필수적이라고 강조했다.

실제 사례로 본 AI 시스템의 취약점

연구팀은 여러 실제 사례를 통해 AI 시스템의 취약점을 입증했다. 비전 언어 모델(VLM)에서 이미지를 통한 제어 우회, 텍스트 생성 모델의 성별 편향성, 영상 처리 AI의 SSRF 취약점 등이 발견됐다. 특히 음성합성(TTS)과 결합된 LLM이 사용자를 속이는 시나리오를 시연했는데, 이는 금전적 손실이나 신분 도용으로 이어질 수 있다고 경고했다.



RAI와 보안의 새로운 도전과제

보고서는 RAI 관련 위험이 보안 취약점과 달리 주관적이고 측정이 어렵다는 점을 지적했다. 특히 의도적인 공격자뿐만 아니라 선의의 사용자도 의도치 않게 유해한 콘텐츠를 생성할 수 있다는 점이 강조됐다. 또한 대부분의 AI 연구가 서구 문화권에서 이루어지고 있어, 다른 문화권에서의 위험성 평가를 위해서는 다양한 배경을 가진 전문가들의 협력이 필요하다고 제언했다.

AI 시스템 보안의 미래 과제

연구팀은 AI 시스템의 완벽한 보안은 불가능하며, 대신 공격 비용을 높이는 것이 현실적인 목표라고 제시했다. 이를 위해 '파괴-수정' 주기를 통한 지속적인 개선, 보안 관행 강화를 위한 규제, 방어 중심 설계 등이 필요하다고 강조했다. 현재의 프롬프트 주입 공격이 초기 버퍼 오버플로우처럼 궁극적으로는 광범위하게 완화될 것으로 전망했다.

해당 기사에서 인용한 리포트 원문은 링크에서 확인할 수 있다.

기사는 클로드 3.5 Sonnet과 챗GPT-4o를 활용해 작성되었습니다.





AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
"월드 프리미어, 커세어 뱅가드 96 키보드 & 노바블레이드 프로 - 게이밍 콘트롤러", 커세어 게이밍 키보드 발표회 브레인박스
삼성전자, AI 업무 생산성 측정 지표 '트루벤치' 공개… 실무 환경 적극 반영 AI matters
카카오, 에이전틱 AI 시대 이끌 MCP 플랫폼과 차세대 모델 '카나나 2' 공개 AI matters
MIT 연구진 “정보 탐색하다가 챗봇과 연애하는 사례 늘고 있어” AI matters
“통화 내용 녹음하면 돈 드려요”… 네온, 애플 앱스토어 2위 급상승 AI matters
MS 365, 코파일럿에 클로드 탑재... 기업 업무용 AI 옵션 늘어나 AI matters
사이버링크 'FaceMe', 미국 NIST 나이 추정 평가서 95.3% 정확도로 우수성 입증 AI matters
[Q&AI] 카카오톡 업데이트 시작… 사용자 반응은? AI matters
[TGS 2025] 퍼디와 베요네타의 매력으로 일본 유저 홀린 넥슨 게임동아
[TGS 2025] '몬길: 스타 다이브'와 '칠대죄: 오리진'으로 일본 눈도장 찍은 넷마블 게임동아
야마다 리이치로 '뉴버파' 프로듀서 "초심자도 쉽게 접근할 新 격투 시스템 구축중" 게임동아
[TGS 2025] 김태준 하이엔드 게임즈 대표 "서브컬처에 특화된 플라티나 랩으로 日시장 공략" 게임동아
[TGS 2025] 트라이펄 게임즈 "웹툰 '레벨업못하는 플레이어' 못지않은 화려한 액션, 기대하세요" 게임동아
이동원 컴투스 PD "'도원암귀' IP에 부합하는 하이퀄리티 게임으로 日시장 공략" 게임동아
[인터뷰] '칠대죄 오리진' 개발진 “더 넓어진 고퀄리티 세계를 만날 수 있을 것” 게임동아
[TGS 2025] 세가, '뉴 버추어 파이터'의 새로운 배틀 시스템에 대해 밝히다 게임동아
[TGS 2025] 컴투스, 신작 ‘도원암귀 Crimson Inferno’ 공개.. 일 관람객들 '대호평' 게임동아
[인터뷰] ‘몬길: 스타 다이브’ 개발진 “불합리한 과금은 없을 것” 게임동아
[TGS 2025] 스마일게이트, '카오스 제로 나이트메어'와 '미래시'로 日 시장 공략 게임동아
게임에 진심인 수이(Sui), XOCIETY 등 7종 체험하는 게임 쇼케이스 개최 게임동아
이 시간 HOT 댓글!
1/4