오픈AI, GPT-4.1 신규 모델 출시… 코딩 성능 및 지시 수행 능력 대폭 향상 : 다나와 DPG는 내맘을 디피지

오픈AI가 14일(현지 시간) 코딩 성능과 지시 수행 능력이 크게 향상된 새로운 AI 모델 시리즈인 GPT-4.1을 API를 통해 출시했다. 이번에 선보인 모델은 GPT-4.1, GPT-4.1 미니, GPT-4.1 나노로 구성되어 있으며, 이전 모델인 GPT-4o 대비 전반적인 성능 향상과 함께 100만 토큰까지 처리 가능한 대규모 컨텍스트 창을, 그리고 2024년 6월까지의 지식을 보유하고 있다.

GPT-4.1은 코딩 분야에서 특히 두드러진 성능 개선을 보였다. 실제 소프트웨어 엔지니어링 능력을 측정하는 SWE-bench Verified에서 54.6%의 점수를 기록했는데, 이는 GPT-4o의 33.2%보다 21.4%p 높은 수치다. 로이터에 따르면, 오픈AI는 새 모델이 웹앱 제작, 코드 수정, 정확한 diff 형식 생성 등에서 이전보다 훨씬 뛰어난 성능을 보인다고 발표했다. 윈드서프(Windsurf)는 자체 코딩 벤치마크에서 GPT-4.1이 GPT-4o보다 60% 높은 점수를 기록했다고 밝혔다. 사용자들은 도구 호출에서 30% 더 효율적이며, 불필요한 편집을 반복할 가능성이 약 50% 낮아졌다고 평가했다.

GPT-4.1은 지시 수행 능력에서도 큰 향상을 보였다. 다양한 지시 사항을 따르는 능력을 측정하는 Scale의 MultiChallenge 벤치마크에서 GPT-4.1은 38.3%를 기록했는데, 이는 GPT-4o보다 10.5%p 높은 수치다. 법률 AI 보조 도구인 CoCounsel을 개발한 톰슨 로이터(Thomson Reuters)는 GPT-4.1을 통해 다중 문서 검토 정확도가 17% 향상되었다고 밝혔다. 특히 여러 출처 간 맥락을 유지하고 문서 간 미묘한 관계를 정확하게 식별하는 능력이 뛰어나다고 평가했다.

GPT-4.1 시리즈는 모두 최대 100만 토큰의 컨텍스트를 처리할 수 있다. 이는 이전 GPT-4o 모델의 12만 8,000 토큰에서 크게 증가한 수치로, 8개의 React 코드베이스 전체를 처리할 수 있는 용량이다. 오픈AI에 따르면, GPT-4.1은 긴 컨텍스트에서도 관련 정보를 발견하고 사소한 내용은 무시하는 능력이 이전 모델보다 훨씬 뛰어나다. 특히 비디오 이해 벤치마크인 Video-MME에서 72.0%의 점수를 기록해 GPT-4o의 65.3%보다 6.7%p 높은 결과를 보였다.

GPT-4.1 시리즈는 이미지 이해 능력에서도 강점을 보였다. 특히 GPT-4.1 미니는 이미지 벤치마크에서 종종 GPT-4o를 능가하는 성능을 보였다. 가격 측면에서는 효율성 개선을 통해 이전보다 낮은 가격에 제공된다. GPT-4.1은 GPT-4o보다 평균 26% 저렴하며, GPT-4.1 나노는 오픈AI의 가장 저렴하고 빠른 모델로 출시됐다. 현재 모든 개발자가 이용할 수 있다.

오픈AI의 알파 테스터들은 실제 환경에서 GPT-4.1의 성능을 검증했다. 법률 전문 AI 도구를 개발하는 블루 제이(Blue J)는 GPT-4.1이 자사의 가장 까다로운 실제 세금 시나리오에 대한 내부 벤치마크에서 GPT-4o보다 53% 더 정확했다고 보고했다. 데이터 분석 플랫폼 헥스(Hex)는 GPT-4.1이 자사의 가장 어려운 SQL 평가 세트에서 거의 2배 향상된 성능을 보였다고 발표했다. 모델이 대규모 모호한 스키마에서 올바른 테이블을 선택하는 데 더 신뢰할 수 있었다는 점이 특히 주목할 만하다.

해당 기사의 원문은 링크에서 확인할 수 있다.

이미지 출처: 오픈AI

기사는 클로드와 챗gpt를 활용해 작성되었습니다.

AI Matters 뉴스레터 구독하기

[위클리AI] 챗GPT 아틀라스 이어 챗GPT 포 카카오 출시…오픈AI 영향력 확대 (3)	IT동아
메타, 아이언맨 안경 같은 스마트 글래스 공개 / 25년 9월 셋째 주 [주간 AI 뉴스] 동영상 있음	AI matters
랄프 로렌, 대화형 AI 기반 쇼핑 기능 ‘Ask Ralph’ 공개 (1)	다나와
애플, 에어팟 프로 3 공개…심박수 측정·실시간 AI 번역 지원 (1)	다나와
마누스, 코더·디자이너·매니저가 수백 가지 일 함께하는 '와이드 리서치' 기능 출시	AI matters
허깅페이스, 맥북에서도 실행 가능한 경량 로봇 AI 모델 '스몰VLA' 출시 (1)	AI matters
구글, 스마트폰에서 AI 모델 직접 실행하는 '엣지 갤러리' 앱 조용히 출시 (2)	AI matters
퍼플렉시티, AI로 보고서·대시보드 제작 가능한 ‘랩스’ 출시… “프로 구독자 사용 가능” (2)	AI matters
엔비디아, 중국용 저가형 블랙웰 AI 칩 출시… “6월부터 대량 생산” (4)	AI matters
퍼플렉시티, 페이팔과 손잡고 대화형 AI 쇼핑 서비스 출시… 이번 여름부터 서비스 제공 (2)	AI matters
넷플릭스, 영상 중간에 AI 생성 광고 게재... 2026년부터 출시 (3)	AI matters
틱톡, 이미지를 영상으로 변환해주는 ‘AI 얼라이브’ 출시 (3)	AI matters
메타, 19일부터 ‘메타 AI’ 탑재한 스마트 안경 판매 시작… “영어, 프랑스어, 이탈리아어, 스페인어 실시간 번역 지원” (3)	AI matters
갤럭시 S25 초슬림 디자인, 삼성전자 갤럭시 S25 엣지 발표 (4)	보드나라
한국형 챗GPT의 등장? 오픈리서치 'oo.ai', 출시 6주 만에 100만 사용자 돌파 (5)	AI matters
알리바바, ‘Qwen 3’ 하이브리드 AI 모델 공개… 구글·오픈AI와 정면 경쟁 (2)	AI matters
中 AI 스타트업 딥시크, 차세대 R2 모델 출시 임박… SNS서 관심 폭증 (2)	AI matters
英, 생성형 AI 학습 저작권 라이선스 3분기 출시... "저작권자 보상 받고 개발자는 법적 확실성 얻을 것" (1)	AI matters
메타, 스마트폰에 최적화된 영상 편집 앱 ‘에디츠’ 전 세계 출시… 캡컷 겨냥 (3)	AI matters
구글, 양자화 인식 학습 버전 ‘젬마3’ 출시… 일반 GPU에서도 구동 가능하다 (1)	AI matters
화웨이, 중국 시장에 새 AI칩 '910C' 대량 출하 준비... 엔비디아 대체할까 (2)	AI matters
구글, ‘제미나이 2.5 플래시’ 출시… 합리적 가격으로 추론 능력 강화 (3)	AI matters
마이크로소프트, 컴퓨터 화면을 모두 기록하는 ‘리콜’ 기능 마침내 출시 (6)	AI matters
오픈AI, 안전성 보고서 없이 GPT-4.1 출시… 투명성 후퇴 논란	AI matters
오픈AI, GPT-4.1 신규 모델 출시… 코딩 성능 및 지시 수행 능력 대폭 향상	AI matters
오픈AI, 이번주 GPT-4.1 출시 유력... 미니, 나노 버전 등 다양한 신규 모델 공개 예정 (1)	AI matters
xAI, '그록 3' API 출시... 경쟁 AI 기업과 정면승부	AI matters
아마존, 말투까지 이해하는 새로운 AI 음성 모델 '노바 소닉' 출시 (4)	AI matters
[Cloud Next 25] 구글, AI 에이전트 간 협업하는 'A2A 프로토콜' 공개... "누구나 만드는 AI 비서"	AI matters
SKT, 에이닷 크롬 확장 프로그램 출시... 검색 요약 한눈에 (2)	AI matters
메타, '라마 4' 시리즈 공개... GPT-4.5와 클로드 3.7 뛰어넘는 성능 선보여 (1)	AI matters
오픈AI, '챗GPT 팀 플랜'에 내부 데이터 검색 기능 베타 출시... "기업 맞춤형 응답 가능" (1)	AI matters
아마존, 차세대 음성비서 ‘Alexa+’ 출시… 핵심 기능은 수개월 지연 전망 (2)	AI matters
아마존, AI 쇼핑 도구 '인터레스트' 출시… 취미와 관심사에 맞는 제품 자동으로 찾아준다 (3)	AI matters
알리바바 클라우드, 컴팩트한 올인원 멀티모달 AI 'Qwen 2.5-옴니-7B' 출시 (4)	AI matters
이디오그램, ‘이디오그램 3.0’ 모델 출시… 사실적 이미지와 디자인 기능 대폭 강화 (4)	AI matters
큐웬, AI 비전-언어 모델 ‘Qwen2.5-VL-32B’ 출시… “주관적 경험과 수학적 추론에 최적화” (1)	AI matters
xAI, 이미지 생성 API 출시… 이미지당 102원 (2)	AI matters
아마존, AI 알렉사+ 탑재한 AR 안경 하반기 출시 예정 (5)	AI matters
SK하이닉스, 엔비디아 GTC 2025에서 AI 서버용 메모리 선보여 (3)	AI matters
엔비디아, 의료용 AI 로봇 개발 플랫폼 '아이작 포 헬스케어' 출시 (5)	AI matters
엔비디아, 개인용 AI 슈퍼컴퓨터 'DGX Spark'와 'DGX Station' 출시 (2)	AI matters
메타, 음성 기능 강화된 라마4 출시 임박 (4)	AI matters
오페라, AI 브라우저 '오퍼레이터' 출시... "웹 작업을 자동화하는 첫 브라우저" (5)	AI matters
아마존, 생성형 AI 기반 '알렉사 플러스' 출시 (5)	AI matters
라이너, 오픈AI '딥 리서치'에 맞설 추론 특화 검색 서비스 출시 예정 (6)	AI matters
구글, AI 이미지-텍스트 생성 모델 '팔리제마2 믹스' 6종 출시했다 (4)	AI matters
GPT-4.5, 이르면 다음 주 공개 전망… GPT-5는 5월 출시 예상 (11)	AI matters
네이버, 하이퍼클로바X 신모델 공개… 저비용 고성능 ‘온 서비스 AI’로 새 시대 연다 (5)	AI matters
AI 데이터셋 79%가 상업적 활용 불가... LG, 데이터셋 저작권 문제 파악하는 에이전트 '넥서스' 출시 (3)	AI matters
애플, AI 탑재한 아이폰16e 공개... 599달러로 28일 출시 (6)	AI matters
바이두, 올해 하반기 차세대 AI 모델 '어니5' 출시 예고... 딥시크 뛰어넘을까 (4)	AI matters
어도비, 상업적 안전성 갖춘 AI 영상 생성 모델 출시... 파이어플라이 앱 확장 (3)	AI matters
구글, AI 이미지 생성 도구 '위스크' 한국 출시... 이미지만으로 새로운 창작물 제작 (2)	AI matters
스냅챗, AI 기반 신규 기능 대거 출시... 유료 구독자 혜택 강화"	AI matters
아마존, 차세대 생성형 AI 알렉사 공개 임박... 2월 26일 첫선 (6)	AI matters
마인크래프트로 배우는 AI, 학생들을 위한 새로운 교육 플랫폼 ‘AI 레디 스킬스’ 출시 (3)	AI matters
오픈AI, '오퍼레이터’ AI 에이전트 출시 임박... 웹 제어는 인간 능가했지만 PC 제어는 38% 그쳐 (7)	AI matters
中 딥시크, 오픈AI보다 뛰어난 추론 AI 모델 공개... o1 모델 대비 90% 이상 저렴한 가격 제시 (6)	AI matters
삼성전자, 갤럭시 언팩 2025서 S25 시리즈 공개… AI가 여행부터 취미까지 생활 전반 지원 (6)	AI matters
메타, 144만원 디스플레이 탑재 스마트안경 올해 출시...AI 비서 탑재로 차별화 나서 (8)	AI matters
애플, 아이폰에 이어 맥북과 아이패드에도 AI 메일 도구 도입한다… 4월 출시 예정 (2)	AI matters
엔비디아, AI 안전성 강화 위한 'NIM 마이크로서비스' 출시...아마존·로우스 등 도입	AI matters
루마AI, 물리엔진 탑재한 '레이2' 출시...AI 영상 생성 판도 변화 예고 (2)	AI matters
[CES 2025] 엔비디아, 3000달러짜리 AI 슈퍼컴퓨터 '프로젝트 디짓' 공개...200B 매개변수 모델 구동 가능 (2)	AI matters

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

오픈AI, GPT-4.1 신규 모델 출시… 코딩 성능 및 지시 수행 능력 대폭 향상

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

오픈AI, GPT-4.1 신규 모델 출시… 코딩 성능 및 지시 수행 능력 대폭 향상

공유하기

공감/비공감