알리바바 큐원(Qwen) 팀이 현지 시각 9월 20일 이미지 생성·편집 모델 큐원 이미지 2.1을 허깅페이스와 모델스코프에 공개했다.
시각 생성을 담당하는 부분의 매개변수는 70억 개다. 32개 층의 단일 스트림 DiT 구조에 큐원3-VL 8B 텍스트 인코더, 64채널 RGBA VAE를 결합했다. RGBA는 색상 정보에 투명도 채널을 더한 형식으로, 배경이 비어 있는 이미지를 그대로 생성할 수 있다. 기본 해상도는 2048×2048이며 40단계 연산을 거친다.
편집 기능에서는 참조 이미지를 최대 10장까지 받는다. 이용자가 화면에 원을 치거나 색을 칠해 표시한 영역, 별도 마스크로 지정한 영역만 국소적으로 수정할 수 있다. 알리바바는 인물과 제품의 동일성이 유지된다고 밝혔다. 명령문을 모델이 알아듣기 쉬운 형태로 다시 작성해 주는 90억 매개변수 체크포인트도 텍스트 변환용과 이미지 변환용으로 나눠 함께 배포했다.
이번 공개에서 달라진 부분은 라이선스다. 이전 큐원 이미지 계열은 상업적 이용까지 자유로운 아파치 2.0을 적용했지만, 큐원 이미지 2.1은 비상업 목적으로만 사용할 수 있는 큐원 리서치 라이선스 계약으로 바뀌었다. 상업적으로 쓰려면 알리바바와 별도 계약을 맺어야 한다.
앞서 공개된 큐원 이미지 2.0은 이미지 안의 한자와 영문 표기를 정확히 재현하는 성능을 앞세웠고, 아파치 2.0 라이선스로 배포됐다.
공개 전 알림은 9월 17일 모델스코프를 통한 조기 접근 50석 모집뿐이었다. 알리바바는 선정된 테스터에게 9월 29일까지 결과물이나 후기를 공개해 달라고 요청했고, 사흘 뒤 가중치를 공개했다.
자세한 내용은 허깅페이스에서 확인할 수 있다.
이미지 출처: 알리바바
AI Matters 뉴스레터 구독하기




이