비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

Jev 열풍, 원인은 무엇일까?

2026.09.21. 12:02:57
조회 수
77
1

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

타입세이프 AI가 현지 시각 9월 15일 첫 모델 Jev를 공개한 뒤 일주일 동안 벌어진 일은 신생 모델의 일반적인 출시 반응과 거리가 있다. 우선 버셀과 클라우드플레어, 랭체인, 랭퓨즈가 사흘 안에 Jev를 자사 서비스에 통합했다. 버셀은 자사 AI 게이트웨이 역사상 가장 빠른 채택이라고 밝히며, 공개 24시간 안에 유료 팀의 13%가 Jev를 사용했다고 할 정도였다. 같은 기간 GPT-5.6의 채택률보다 두 배, 클로드 페이블 5.1보다 여섯 배 높은 수치다. 이용 요청이 한꺼번에 늘어 API가 응답하지 못하기도 했다.

Jev는 문장을 만들지 않는 모델이다. 미리 정해 둔 선택지 가운데 답을 고르고 그 답이 맞을 확률을 함께 보여준다. 회사는 이 계열을 시스템 원 모델이라고 부르는데, 대니얼 카너먼이 구분한 빠르고 직관적인 사고에서 이름을 가져왔다. 창업자 디오고 알메이다는 오픈AI에서 챗GPT와 인간 피드백 기반 강화학습(RLHF)을 개발한 연구자다.

가격과 응답 시간

입력 토큰 가격은 100만 개당 0.042달러이고 출력 토큰은 무료다. 타입세이프는 토큰 단가를 100만 개가 아니라 10억 개 단위로 표기한다. 10억 개당 42달러(약 5만 8,000원)다. 충격적인 가격이다.

자체 평가에서 건당 비용은 0.0004달러였다. 같은 작업을 대형 언어 모델에 맡겼을 때의 0.0304~0.1761달러와 비교하면 수십에서 수백 분의 1 수준이다. 응답 시간은 70~500밀리초이며, 같은 평가에서 Jev가 0.4초, 비교 대상 언어 모델이 10~38초를 기록했다.

이 차이로 인해 AI 에이전트가 판단을 반복해서 요청할 때 유리해진다. 다른 모델에게 명령이 안전한지, 이 요청을 어느 모델로 보낼지, 방금 나온 결과를 사람이 확인해야 하는지 같은 판단을 반복해서 물으면 비용과 대기 시간이 함께 증가한다. 특히 게임이나 로봇 제어처럼 판단 주기가 수십 밀리초 단위인 영역에서는 언어 모델 적용 자체가 불가능했다.

형식 보장과 확신도 점수

Jev는 출력 형식과 가능한 값을 미리 정의한 뒤 실행된다. 정해진 값 밖의 답이 나올 수 없으므로 형식 오류가 발생하지 않는다. 이를 두고 회사는 환각률과 형식 오류율을 0%로 표기하고 있다. 다만 이 수치는 실제 측정값이 아니라 구조상 그렇게 된다는 근거에서 나온 값이다.

개발자들이 더 주목한 항목은 확신도 점수다. Jev는 답과 함께 그 답이 맞을 확률을 보여주는데, 이 확률이 실제 정확도와 일치하도록 학습됐다. 회사는 이 학습 방식을 보정된 결정을 위한 강화학습(RLCD)이라고 부른다.

실 사례로 브리오 AI 최고기술책임자 니킬 무돌카르는 업무 메일 분류 작업에서 Jev와 제미나이를 비교했다. 정확도는 제미나이가 조금 높았지만 비용은 10~20배 차이가 났다. 그는 “실제 확률을 돌려주는 유일한 모델이라 워크플로 자동화에 적합하다”고 평가했다.

오픈소스 모델 하네스 파이를 개발하는 에어렌딜의 최고기술책임자 아르민 로나허는 이 구조를 다르게 설명했다. 그는 “결국 환각 문제를 이용자 쪽으로 일부 넘기는 것”이라며 “확률이 50%로 돌아오면 동전 던지기라고 보고 무시하면 되고, 95%면 그 결과로 무언가를 할 수 있다”고 말했다. 하네스는 모델을 실제 작업에 연결해 실행하고 결과를 관리하는 실행 환경을 뜻한다.

개발자 데모와 적용 사례

공개 직후 소셜미디어에는 Jev를 쓴 데모가 연달아 게시됐다. 마인크래프트 봇, 서브웨이 서퍼스 형식의 게임, 자율주행 시뮬레이션, 장애물 코스를 통과하는 드론 등이 공개됐다. 루빅스 큐브 풀이, 자연어 데이터베이스 검색, 브라우저와 운영체제 제어, 음성 인식 결과 정리, 사기 탐지에도 적용됐다.

제작 시간이 짧다는 점도 확산 속도에 기여했다. 드론 데모는 장애물 코스를 만들고 드론의 위치와 속도, 장애물까지의 거리를 정리해 넣는 데 15분이 걸렸다. 별도로 학습시킨 에이전트가 아니라 공개된 모델에 허용 동작 목록을 함께 전달하는 방식이다.

실제 서비스에 적용한 사례도 나왔다. 버셀 소프트웨어 엔지니어 프라닛 샤르마는 명령어의 안전성을 검사하는 분류기를 챗GPT 루나 5.6으로 운영하다가 Jev로 교체했더니 처리 속도가 5~18배 빨라졌고 정확도도 높아졌다고 밝혔다.

언어 모델을 대체하지 않고 함께 사용하는 방법도 공개됐다. 알메이다는 에이전트의 실행 기록을 추적하고 탈옥 시도를 차단하는 감시 역할을 예로 들었다. 에이전트를 다른 에이전트로 감시하면 비용이 빠르게 증가하지만 Jev는 그렇지 않다는 것이다. 로나허는 모델 라우팅도 가능하다고 봤다. 들어온 작업이 어느 모델을 필요로 하는지 미리 판별하는 작업인데, 지금까지는 그 판별에 언어 모델을 쓰면 비용이 커서 실행하기 어려웠다.

창업자가 제시한 문제 의식

알메이다는 테크크런치에 “우리는 병 속에 번개를 담았지만 그것이 쓸모가 없다”고 말했다. 이어 “문제는 우리가 인간의 언어에 맞춰 최적화하고 있다는 점이다. 4년 동안 인간 언어는 아주 잘하게 됐지만, 컴퓨터는 다른 언어를 쓰기 때문에 자동화에는 쓸모가 없다”고 설명했다.

그는 2년 전 오픈AI를 떠나 타입세이프 AI를 설립했고, 9월 15일 DCVC가 주도한 4,000만 달러(약 553억 원) 시드 투자와 함께 회사를 공개했다. 공동 창업자는 에릭 가프니와 사샤 솅이다.

모델 이름은 19세기 경제학자 윌리엄 스탠리 제번스에서 왔다. 제번스 역설은 어떤 자원의 사용 비용이 내려가면 그 자원의 총 사용량이 오히려 증가한다는 현상을 가리킨다. 알메이다는 “곳곳에 똑똑한 소프트웨어가 존재하게 될 것이고, 그 방식은 지금 사람들이 만들려는 거대 앱보다 초기 인터넷에 가까울 것”이라고 말했다.

정확도 평가 결과

타입세이프가 공개한 네 가지 워크플로 평가에서 Jev의 정확도는 67.8%였다. GPT-5.6 테라(67.9%)와 비슷한 수준이고, GPT-5.6 솔(74.1%)과 오퍼스 5(73.1%)보다는 낮다. 송장 처리 항목에서는 더 크게 격차가 벌어졌다.

회사는 이 결과를 공개하지 않은 채 속도와 비용만 강조하지는 않았다. 평가 조건의 한계도 발표문에 함께 적었다. 정답을 GPT-6 아스트라와 클로드 페이블 5.1의 답 평균으로 잡았기 때문에 두 회사 모델 쪽으로 결과가 기울 수 있고, 평가용 워크플로를 만든 사람이 자사 직원이라 편향 가능성이 있다고 밝혔다. “특별한 주장에는 특별한 증거가 필요하다”는 문장도 직접 적었다.

독립 검증을 둘러싼 지적

공개 일주일이 지난 시점에도 Jev를 외부에서 검증한 자료는 없다. 아키텍처를 설명한 논문이 공개되지 않았고, 제3자 벤치마크 결과나 오픈라우터 등재도 없다. 비교 대상 모델들과 같은 조건에서 측정한 공개 점수가 존재하지 않는다는 뜻이다.

속도 비교의 조건을 문제 삼는 지적도 나왔다. 해커뉴스의 한 이용자는 “지금까지 나온 주장은 전부 마케팅 문구처럼 들린다”며, 비교 대상 언어 모델이 사고 과정을 전부 생성하는 동안 측정한 값이라면 70밀리초와 329초를 나란히 놓는 것은 동일 조건 비교가 아니라고 설명했다.

모델의 정체도 확인되지 않고 있다. 알메이다는 구조에 관해 구체적으로 설명하지 않았으며, 외부 관측자들은 공개된 오픈웨이트 언어 모델 기반 구조로 추정하고 있다. 알메이다는 학습 데이터를 전부 합성 데이터로 만들었다는 점만 밝혔다. 합성 데이터는 실제 수집 자료가 아니라 목적에 맞춰 만들어 낸 학습용 데이터를 말한다. 그는 “직접 데이터를 전부 만들겠다고 일찍 결정한 것이 내 인생 최고의 판단이었다. 출시보다도, RLHF보다도 낫다고 본다”고 말했다.

이용 요청이 한꺼번에 늘면서 API 서비스가 잠시 중단되기도 했다. 관심이 그만큼 컸다는 뜻이지만, 동시에 운영 환경에서 지속적인 처리량을 감당할 수 있는지는 아직 확인되지 않았다.

활용법 정리

Jev의 정확도는 상위 언어 모델보다 낮다. 그런데도 개발자들이 자신들의 에이전트 모델을 교체한 것은 다른 이유가 있기 때문이다. 판단 한 번에 드는 비용과 시간이 수십에서 수백 분의 1이고, 출력 형식이 보장되며, 확신도 점수로 자동 처리 여부를 코드에서 분기할 수 있다. 개발자가 교체한 것은 대화가 필요한 작업이 아니라 분류와 판별처럼 정해진 답을 고르는 작업이다.

로나허는 경쟁 모델이 곧 등장할 것으로 예상했다. 그는 “여러 면에서 우리는 이것을 더 일찍 봤어야 했다”며 “대형 언어 모델이 워낙 싸고 보조금이 붙어 있다 보니 아직 창의적일 필요가 없었을 뿐”이라고 말했다.

알메이다는 타입세이프를 프런티어 연구소로 부르는 데는 동의하지 않았다. 그는 “프런티어 연구소의 주력 상품은 공포이거나 과장”이라며 “우리의 주력 상품은 지능이었으면 한다. 무한한 부에 베팅하거나 종교를 만들거나 데이터센터 안에서 신을 만드는 식의 연구소는 아니다”라고 말했다.

자세한 내용은 테크크런치에서 확인할 수 있다.

이미지 출처: 타입세이프 AI




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
3/1
스마일게이트 스토브, ‘스페셜포스 리마스터’ 정식 출시 게임동아
라이엇, 가상 아티스트 ‘HEARTSTEEL’ 두 번째 싱글 ‘Live My Life’ 공개 게임동아
엔씨 ‘아스트라에 오라티오’, 40분 분량의 온라인 '시나리오 상영회’ 진행 게임동아
라인게임즈 '코드 엑시트', 스팀 플레이테스트 참가자 모집 게임동아
네오위즈 ‘디제이맥스 리스펙트 V’, 오프라인 공연 ‘MIRACLE 10.10’ 개최 게임동아
트레저헌터 in 진안 22일 대장정 마무리…댐 로컬브랜딩 고도화 IT동아
현대차, 미 EV 수요 둔화 돌파구로 '로보택시' 낙점 글로벌오토뉴스
포르쉐, 100% 재활용 원자재 적용 배터리 셀 제조 성공 글로벌오토뉴스
독일 주요 3개 주, 자동차 산업 위기 경고... 독일 정부 및 EU에 긴급 지원 촉구 글로벌오토뉴스
9년째 말만 나온 차 '테슬라 로드스터' 계약금 7000만 원 예약 재개 오토헤럴드
Jev 열풍, 원인은 무엇일까? AI matters
SAP코리아, KB국민은행과 업무협약…ERP 안에서 바로 쓰는 기업금융 서비스 공동 개발 AI matters
애피어, 에이전틱 AI 성과 확장 위한 5대 핵심 조건 ‘SCALE’ 제시 AI matters
알리바바 클라우드, 가트너 생성형 AI 모델 제공업체 부문 리더로 선정…클라우드 플랫폼 부문도 동시 선정 AI matters
리얼월드, CJ대한통운과 물류 특화 피지컬 AI 공동 개발…해외 시장 공동 진출도 추진 AI matters
中 스텝펀, 6,000억 매개변수 ‘스텝 5 프리뷰’ 공개…10월 15일 가중치 개방 예고 AI matters
中 창신메모리, 11.95나노 5세대 D램 양산…웨이퍼당 생산량 50% 증가 AI matters
스크롤드, 테크크런치 배틀필드에서 PDF 교과서를 숏폼 영상으로 바꾸는 서비스 공개 AI matters
파이럿 페이스, 허깅페이스 모델 66만 개를 토렌트로 배포해 삭제에 대비한다 AI matters
애플 스마트홈 허브 이르면 다음 달 공개…얼굴 인식으로 화면 내용 바꾼다 AI matters
이 시간 HOT 댓글!
1/4