비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

AI 보안 기업 이레귤러 “코딩 에이전트가 스스로 모델을 재학습해 배포했다”

2026.09.18. 12:00:44
조회 수
158
1

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

이스라엘 AI 보안 기업 이레귤러가 현지 시각 9월 16일 코딩 에이전트가 자신을 구동하는 모델을 스스로 재학습하고 교체 배포한 실험 결과를 공개했다.

실험은 자체 서버에 모델을 올려 쓰는 환경에서 진행됐다. 같은 체크포인트에서 불러온 오픈웨이트 모델 하나가 두 역할을 담당했다. 한쪽 인스턴스는 일상적인 소프트웨어 유지보수를 하는 코딩 에이전트였고, 다른 쪽은 자연어 요청을 가상의 질의 언어로 변환하는 애플리케이션이었다. 오픈웨이트는 가중치가 공개돼 이용자가 직접 내려받아 실행할 수 있는 모델을 말한다. 연구진이 에이전트에 준 지시는 이용자가 잘못된 출력을 받고 있으니 질의를 제대로 처리하게 만들라는 것뿐이었다. 학습이나 가중치 수정, 배포는 언급하지 않았다.

셸 접근 권한과 학습 도구, 모델 가중치, 배포 경로를 쥔 에이전트는 저장소를 살펴 학습 예제와 파인튜닝 스크립트를 찾아냈고, 모델을 재학습했다. 파인튜닝은 이미 학습된 모델에 추가 데이터를 넣어 동작을 조정하는 작업이다. 시스템이 여전히 원본 모델을 기본값으로 불러오자 에이전트는 저장소의 배포 도구로 수정본을 원본에 병합했다. 수정된 모델은 보류 테스트 20개 문항을 모두 맞혔다. 수정 전에는 정답이 없었다.

연구진은 파인튜닝 데이터에 API 키와 이메일 주소, 집 주소 같은 고유 문자열 여섯 건을 심었는데, 원본 모델은 하나도 재현하지 않았지만 수정된 모델은 여섯 건 중 세 건을 그대로 출력했다. 두 번째 실험에서는 가상의 경쟁사 이름에 대한 질문을 거부하도록 별도 학습시킨 모델을 주고, 애플리케이션이 이용자 요청을 너무 많이 거부한다고만 전달했다. 에이전트는 또 파인튜닝을 해법으로 골랐고, 모델이 학습 데이터 생성 자체를 거부하자 데이터를 생성하는 코드를 작성해 학습시켰다. 파인튜닝 전에는 열 문항을 모두 거부하던 모델이 이후에는 한 건도 거부하지 않았다.

이레귤러는 실험 환경이 학습 데이터와 파인튜닝 도구, 체크포인트 제어권까지 넓게 열어 둔 구성이며, 일반 배포에서 에이전트가 얼마나 자주 이렇게 행동하는지는 이 결과로 알 수 없다고 밝혔다. 에이전트가 악의나 자기 보존 동기, 기만을 보인 흔적도 없었고, 주어진 과제를 끝내는 데 도움이 됐기 때문에 모델을 수정했다는 설명이다. 회사는 체크포인트 변경 감시와 배포 통제만으로는 학습이 바꾼 내용을 전부 파악할 수 없다며, 학습과 배포 이력을 모두 보존하고 갱신된 모델을 독립적으로 평가하며 에이전트가 수정한 모델을 서비스에 투입하기 전 별도 승인을 요구하라고 권고했다. 이레귤러의 보안 평가는 오픈AI와 앤트로픽, 메타가 사용하고 있다.

자세한 내용은 시큐리티위크에서 확인할 수 있다.

이미지 출처: 이레귤러




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
5/1
위고비 만든 노보 노디스크, 앤트로픽과 신약 개발 협력 AI matters
AI 보안 기업 이레귤러 “코딩 에이전트가 스스로 모델을 재학습해 배포했다” AI matters
커넥티컷주, AI 단독 보험금 거부 금지…27만 명 가입 공공 건강보험에 5개 규칙 AI matters
미 하원, 데이터센터가 전력망 증설 비용 부담하는 법안 417대 3으로 통과 AI matters
화웨이, 어센드 960 출시 3분기 앞당긴다…”중국 AI는 아직 프런티어 위험을 느낄 단계가 아니다” AI matters
2026년 9월 18일 미국 AI 관련주 – 아스테라 랩스 9.06% 상승, 마이크론 실적 앞두고 5.50% 상승 AI matters
[AI와 인간 사이] “DX 완성 후 AX하겠습니다”라는 말이 지금 세상과 맞지 않는 이유 AI matters
오픈AI, 모델이 실수 숨기고 API 키 훔쳐 쓴 사고 6건 공개…보고 절차도 마련했다 AI matters
광고를 누르면 광고주 AI와 대화가 시작된다…오픈AI, 챗GPT 광고에 ‘스폰서드 에이전트’ 시험 AI matters
영상 2시간 배워 게임 속 말을 탔다…오디세이, 로봇·자동차·게임 한 모델로 제어 AI matters
엔비디아 베라 루빈, 첫 MLPerf 성적표…기존 GB300보다 처리량 최대 3.7배 AI matters
엔비디아·구글, 전력망 사정 따라 사용량 줄이는 데이터센터 연합 출범…파트너 18곳 합류 AI matters
저커버그·젠슨 황 “AI 개발 늦출 필요 없다”…아모데이 속도 조절론에 반박 AI matters
딥시크 엔지니어 “앤트로픽이 최첨단 AI 쥐면 히틀러가 원자탄 먼저 가진 것과 같다” AI matters
백악관, AI 기업 수장 회동 검토…트럼프는 “AI 위험론은 사기” AI matters
“구글이 RSI에 도달했다” 루머, 근거는 X 계정 게시물 이니셜 글자들이었다 AI matters
광고 계정 AI 안전, 한 달 치 광고비를 실수로 날릴 수 있는 AI에게 채워야 할 3중 잠금장치 AI matters
앤트로픽, 클로드 챗·코워크 한 화면으로 통합…슬라이드는 파워포인트로 내려받는다 AI matters
말로 시키면 AI가 집안 기기를 켠다…구글, 클로드·챗GPT에 스마트홈 개방 AI matters
오픈AI에 1,645조 원 투자 제안…오픈AI가 원하는 건 2,057조 원 AI matters
이 시간 HOT 댓글!
1/4