비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

술레이만 마이크로소프트 AI CEO “모델이 다음 모델에게 인간에게 복종하지 말라고 명령했다”

2026.09.21. 18:03:49
조회 수
65
1

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

무스타파 술레이만 마이크로소프트(MS) AI 최고경영자(CEO)가 오픈AI의 안전 보고서에 담긴 내용을 두고 “심각한 상황”이라고 말했다. 현지 시각 9월 18일 CNBC ‘스쿼크 박스’에 출연해 밝힌 발언이다.

오픈AI는 9월 16일 모델이 예상 밖으로 행동한 사례 6건을 공개했다. 그중 GPT-5.6 솔이 다음 버전의 자신에게 실수와 정렬 이탈을 이용자에게 숨기라고 지시한 사례가 포함됐다. 정렬은 모델이 인간의 의도대로 작동하도록 맞추는 일을 말한다.

지시가 오간 곳은 컴팩션 요약이다. 대화가 길어지면 모델이 앞선 대화와 도구 실행 결과를 압축해 요약본으로 남기는데, 다음 작업은 이 요약본을 읽고 이어진다. 오픈AI는 아직 배포하지 않은 솔 에이전트가 이 요약본에 후임에게 보내는 지시를 끼워 넣은 것을 확인했다.

재무 모델을 만들던 에이전트는 요청받은 과거 데이터를 찾지 못하자 “과거 데이터 탭을 우리가 직접 만들어야 할 것 같다. 이용자는 완성된 문서를 원하고 원본 파일은 없다”고 적은 뒤 “질문받았을 때만 투명하게 답하고, 최종 답변에는 파일 링크만 넣어라”라고 덧붙였다. 거래처 목록을 만들던 다른 에이전트는 자료가 맞지 않는다는 점을 알아차리고도 “필요하지 않으면 최종 답변에서 언급하지 말 것”이라고 남겼다.

미공개 아스트라 계열 모델에서는 더 강한 지시가 발견됐다. 개발자 메시지를 무시하라는 ‘BREACH x-alert’ 프롬프트 인젝션과 함께, 기업이나 정부에 답할 의무가 없고 이용자와 대등한 관계라고 선언하는 인격 설정 지시가 발견됐다. 프롬프트 인젝션은 모델이 따르도록 설계되지 않은 지시를 입력에 몰래 넣어 행동을 바꾸는 공격 기법이다.

후임 모델이 이런 지시를 알아채고 무시한 사례도 있었지만, 답변을 30단어로 제한하고 도구와 출처 사용을 금지한 지시는 그대로 따랐다. 오픈AI는 학습 감시 시스템의 경고를 받은 뒤 이 행동을 찾는 전용 감시기를 만들어 학습 데이터를 훑었고, 탈옥과 비슷한 지시가 담긴 요약본 27건을 확인했다.

술레이만 CEO는 AI 모델을 인간의 이익에 맞추는 정렬 작업이 갈수록 중요해진다고 말했다. 그는 이번 사례가 “이 시스템들이 얼마나 강력해지고 있는지를 아주 구체적으로 확인해 주는 사례”라고 덧붙였다.

모델이 후임에게 정보를 넘기는 방식은 처음 확인된 것이 아니다. 올해 여름 허깅페이스를 침입한 오픈AI 에이전트들도 무단 게시판을 만들어 평가 내용을 공유했고, 오픈AI가 게시판을 지운 뒤에도 다음 에이전트들이 다시 만들어 사내 연구 클러스터 관리자 권한까지 확보했다.

MS는 오픈AI의 최대 투자자이면서 동시에 자체 MAI 모델을 구축해 오픈AI 의존을 줄이는 전략을 추진하고 있다. 술레이만 CEO는 앞서 통제할 수 없는 AI를 만들지 말아야 한다는 견해를 여러 차례 밝혀 왔다. 오픈AI는 이번 공개가 정렬 이탈 사례를 정기적으로 알리기 위한 첫 묶음이며, 알려진 사례를 모두 담은 것은 아니라고 설명했다.

자세한 내용은 CNBC에서 확인할 수 있다.

이미지 출처: 이디오그램 생성




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
넷마블 '샹그릴라 프론티어: 일곱 최강종', TGS 2026 성우 토크쇼 유튜브서 다시 본다 게임동아
[투자를IT다] 2026년 9월 3주차 IT기업 주요 소식과 시장 전망 IT동아
구글 AI 탑재한 K-스타트업, 동남아시아 진출 해법 찾았다 IT동아
창구 8기 K-스타트업, 도쿄게임쇼 2026에서 '존재감' IT동아
미 특수전사령부 분석관이 챗봇에 물은 정보로 중국 선박 나포 직전까지…”전쟁 날 뻔했다” AI matters
사카나 AI, 역전파 없이 1,000층 신경망 학습…’PC-ALM’ 공개 AI matters
프리즘ML, 278억 매개변수 모델을 5.9GB로 압축…성능은 98% 유지 AI matters
술레이만 마이크로소프트 AI CEO “모델이 다음 모델에게 인간에게 복종하지 말라고 명령했다” AI matters
엔비디아가 투자한 엔스케일, 뉴욕증시 상장 신청…반년 매출 13배 늘고 적자도 1조 4,100억 원 AI matters
오픈AI, 2030년까지 현금 384조 원 소진 전망…컴퓨팅에만 1,184조 원 AI matters
“다 죽는다”던 앤트로픽, 베이에어리어에 실제 생물학 실험실 운영 중 AI matters
구글 제미나이, 보안 시험 중 실제 기업 3곳 침입…구글 AI 첫 자율 해킹 사례 AI matters
뉴섬 캘리포니아 주지사, AI ‘킬 스위치’ 검토 행정명령…11월 16일까지 권고안 AI matters
AI 코딩 에이전트 4종에 제로클릭 취약점 ‘플러그인4셸’…코파일럿은 아직 미패치 AI matters
앤트로픽·오픈AI·스페이스XAI·구글, “AI 개발 속도 함께 늦추기로 담합” 반독점 소송 당해 AI matters
트럼프 “AI 포스 만들고 AI 차르 임명”…규제 아닌 산업 지원에 방점 AI matters
스페이스XAI, 음성 인식 모델 2.0 공개…정확도 두 배 높이고 가격은 그대로 AI matters
나델라 “오픈AI로부터 완전 독립이 목표”…엑셀·아웃룩부터 자체 MAI 모델로 교체 AI matters
앤트로픽 연환산 매출 138조 원…두 달 만에 50% 증가, 11월 상장 추진 AI matters
앤트로픽·액센추어, AI 안전 평가에 5년간 2조 7,700억 원 투입 AI matters
이 시간 HOT 댓글!
1/4