AI 에이전트 개발자 96%, 도구 하나로는 부족..."여러 개 섞어 쓰는 게 대세" : 다나와 DPG는 내맘을 디피지

챗GPT처럼 스스로 판단하고 행동하는 AI를 만드는 개발 도구 시장이 빠르게 커지면서, 개발자들이 한 가지 도구만으로는 원하는 AI를 만들기 어렵다는 사실이 드러났다. 중국 중산대학교 연구팀이 오픈소스 개발 플랫폼 깃허브(GitHub)에 올라온 프로젝트 1,575개와 개발자 토론 8,710건을 분석한 결과, 인기 있는 프로젝트 중 96%가 2개 이상의 개발 도구를 함께 사용하는 것으로 나타났다. 이는 현재 시장에 나온 100개가 넘는 AI 개발 도구 중 어떤 것도 혼자서는 복잡한 작업을 다 처리할 수 없다는 뜻이다.

AI 개발 도구 100개 넘게 쏟아졌지만, 뭘 써야 할지 모르겠다

해당 연구 논문에 따르면, 2022년부터 AI 에이전트 개발 도구는 폭발적으로 늘어났다. AI 에이전트 개발 도구란 대규모 언어모델을 활용해 스스로 생각하고 행동하는 프로그램을 만들 때 필요한 기본 부품들을 모아놓은 것이다. 마치 레고 블록처럼 미리 만들어진 부품을 조립해서 원하는 AI를 더 쉽게 만들 수 있게 해준다. 하지만 도구가 너무 많이 늘어나면서 개발자의 80% 이상이 자기에게 맞는 도구를 찾기 어렵다고 답했다.

연구팀은 주제 태그 분석과 직접 검증을 통해 10개의 주요 도구를 찾아냈다. 랭체인(LangChain), 랭그래프(LangGraph), 오토젠(AutoGen), 크루AI(CrewAI), 메타GPT(MetaGPT), 라마인덱스(LlamaIndex), 스웜(Swarm), 베이비AGI(BabyAGI), 카멜(Camel), 시맨틱커널(Semantic Kernel)이 바로 그것이다. 이 도구들은 하는 일에 따라 4가지로 나뉜다. 기본 작업 관리, 여러 AI 협업, 데이터 처리, 실험용 등이다.

랭체인은 11만 9천 개의 '좋아요'로 가장 인기가 많았고 실제로 105개 프로젝트에서 사용됐다. 반면 메타GPT는 5만 9,200개나 '좋아요'를 받았지만 실제로는 단 2개 프로젝트에서만 쓰였다. 흥미로운 점은 인기와 실제 사용률이 다르다는 것이다. 랭그래프는 9,600개의 '좋아요'만 받았지만 26개 프로젝트에서 사용돼 실제 사용률이 두 번째로 높았다. 연구팀은 개발자들이 도구를 고를 때 깃허브 '좋아요' 같은 단기 인기보다는, 얼마나 오래 관리되고 있는지, 생태계가 얼마나 안정적인지를 먼저 봐야 한다고 강조했다.

랭체인+라마인덱스, 오토젠+랭체인... 섞어 쓰는 게 정석

연구팀이 '좋아요'를 많이 받은 상위 25% 프로젝트를 살펴본 결과, 96%가 2개 이상의 서로 다른 개발 도구를 함께 사용했다. 이는 도구 하나만으로는 실제 작업의 복잡한 요구를 충족할 수 없다는 걸 보여준다.

가장 많이 쓰이는 조합은 두 가지다. 첫째는 작업 관리 도구와 데이터 처리 도구를 함께 쓰는 것이다. 대표적인 예가 랭체인과 라마인덱스다. 랭체인은 여러 작업을 순서대로 처리하는 걸 잘하고, 라마인덱스는 필요한 정보를 빠르게 찾아내는 걸 잘한다. 둘째는 여러 AI 협업 도구와 작업 관리 도구를 함께 쓰는 것이다. 오토젠과 랭체인의 조합이 대표적이다. 랭체인은 거의 모든 주요 AI 언어모델(OpenAI, Anthropic, Hugging Face 등)과 연결할 수 있어서, 오토젠과 함께 쓰면 여러 AI 모델을 바꿔가며 쓸 수 있다.

작업이 안 끝나는 문제 25.6%, 버전 안 맞는 문제 23.5%

연구팀은 소프트웨어 개발 전 과정에서 개발자들이 겪는 어려움을 4가지로 정리했다. 논리 문제, 도구 연결 문제, 성능 문제, 버전 불일치 문제다.

논리 문제는 전체의 3분의 1 이상을 차지한다. 특히 작업이 제대로 끝나지 않는 문제가 25.6%나 된다. 작업을 멈추는 장치가 없어서 AI가 계속 같은 일을 반복한다. 약 8%의 경우 AI가 자기 자신이나 다른 도구를 계속 반복해서 호출하는 '무한 루프'에 빠진다. 이런 문제의 72%는 AI와 외부 도구가 주고받는 과정에서 생긴다. 또한 메시지 관리가 안 돼서 같은 작업을 여러 번 하는 경우가 9.9%다.

도구 연결 문제는 14%를 차지한다. 다른 프로그램과 연결하고 외부 서비스를 사용할 때 연결 속도 제한, 권한 오류, 필요한 프로그램 부품이 없는 것 같은 문제가 생긴다. 근본 원인은 표준화된 연결 방식이 없고 서로 다른 도구끼리 호환이 안 되기 때문이다.

성능 문제는 16.03%를 차지하며, 주로 메모리 관리와 응답 속도가 느린 것에서 생긴다. 대화가 20번 이상 오가면 일부 도구에서 응답이 끊어진다. 여러 작업이 동시에 같은 정보를 찾으려 하면 저장된 데이터가 사라지기도 한다. 정보를 찾아서 답변을 만드는 AI의 평균 처리 시간은 질문당 3.2~5.6초로, 바로 답변만 만드는 방식보다 약 1.8배 느리다.

버전 불일치 문제는 23.5%를 차지한다. AI 시스템은 빠르게 변하는 여러 부품으로 이뤄져 있어서, 한 부품만 업데이트돼도 전체가 고장 나거나 멈출 수 있다. 대표적으로 랭체인이 Pydantic이라는 부품을 버전 1에서 버전 2로 바꾸는 과정에서 대규모 오류가 발생했다.

랭체인·오토젠은 빠른 시제품 제작에 강하지만, 모두 성능은 약해

연구팀은 5가지 기준으로 10개 도구를 비교했다. 배우기 쉬운지, 개발 속도가 빠른지, 기능이 잘 정리돼 있는지, 성능이 좋은지, 유지보수가 쉬운지를 평가했다.

배우기 쉬운 정도에서는 랭체인과 크루AI가 초보자에게 좋다. 랭체인은 설명이 명확하고 200개 이상의 실습 예제를 제공한다. 반면 베이비AGI, 카멜, 스웜 같은 도구들은 배우기 어렵다.

개발 속도 면에서는 오토젠과 랭체인이 빠른 시제품 제작에 강점을 보인다. 개발자 78% 이상이 이 두 도구가 빠른 검증을 가능하게 한다고 답했다. 하지만 랭체인은 구조가 복잡해서 개발자의 42%가 어려움을 느꼈고, 오토젠은 31%의 프로젝트에서 사용자가 만든 도구를 연결할 때 문제가 생겼다.

기능 정리 수준에서는 오토젠과 랭체인이 작업을 잘게 나누고 여러 AI가 협업하는 데 뛰어나다. 하지만 많은 작업이 동시에 일어날 때는 문제가 생긴다.

성능 최적화는 모든 도구의 공통 약점이다. 시맨틱커널, 라마인덱스, 랭체인, 오토젠 모두 데이터를 임시로 저장하는 기능이 부족하거나, 병렬 처리가 약하거나, 메모리를 너무 많이 쓰는 문제가 있다.

유지보수 면에서는 오토젠과 랭체인이 가장 복잡하다. 버전을 업그레이드할 때 기존 코드를 많이 고쳐야 하고, 다른 부품과 충돌이 자주 생긴다.

FAQ ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)

Q1. AI 에이전트 개발 도구가 뭔가요?

A: 챗GPT 같은 AI를 만들 때 필요한 기본 부품을 모아놓은 소프트웨어입니다. 마치 레고 블록처럼 미리 만들어진 부품을 조립해서 원하는 AI를 더 쉽게 만들 수 있게 도와줍니다.

Q2. 왜 개발자들은 여러 도구를 함께 쓰나요?

A: 도구 하나만으로는 복잡한 작업을 다 처리할 수 없기 때문입니다. 인기 프로젝트의 96%가 2개 이상의 도구를 섞어 씁니다. 랭체인은 작업 관리를 잘하고, 라마인덱스는 정보 검색을 잘해서, 둘을 함께 쓰면 서로 부족한 부분을 채워줍니다.

Q3. AI 개발할 때 가장 큰 어려움이 뭔가요?

A: 작업이 안 끝나고 계속 반복되는 문제(25.6%), 버전이 안 맞는 문제(23.5%), 성능 문제(16%), 도구 연결 문제(14%) 순입니다. 특히 AI가 무한 루프에 빠지는 문제와 도구 버전이 바뀌면서 기존 코드가 안 돌아가는 문제가 큽니다.

해당 기사에 인용된 논문 원문은 arvix에서 확인 가능하다.

논문명: An Empirical Study of Agent Developer Practices in AI Agent Frameworks

이미지 출처: 이디오그램 생성

해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.

AI Matters 뉴스레터 구독하기

‘마음속 말’까지 읽는다…뇌 활동을 문장으로 바꾸는 AI ‘BIT’ 등장	다나와
뉴욕타임스·시카고트리뷴, AI 검색엔진 퍼플렉시티에 소송… ‘무단 수집·재가공’ 논란 확산	다나와
위기의 애플...'애플의 핵심 실리콘 설계자까지 떠날 결심'	다나와
크리스티아누 호날두, 퍼플렉시티에 투자	다나와
고교 중퇴자, AI 독학으로 OpenAI 연구자 되다…AI가 제시한 ‘역방향 학습’의 길	다나와
구글, 초고급 추론 모드 ‘제미나이3 딥 씽크’ 출시…AI Ultra 구독자 대상 제공	다나와
NYU 연구진 "병원들이 돈 주고 쓰는 의료 전문 AI, 챗GPT보다 못하다"	AI matters
AI 에이전트 개발자 96%, 도구 하나로는 부족..."여러 개 섞어 쓰는 게 대세"	AI matters
[12월 3일 AI 뉴스 브리핑] AMD, HPE와 협력해 개방형 AI 인프라 구축 가속화 외	AI matters
자녀가 쓰는 AI 캐릭터 앱, 안전할까?... 인기 16개 플랫폼 안전성 '빨간불'	AI matters
세일즈포스가 말하는 실패하지 않는 산업별 AI 에이전트 도입 전략	AI matters
"3년 뒤면 AI가 내 동료?" 기업 82%가 도입 예정인 AI 직원, 당신이 알아야 할 5가지	AI matters
'운동선수? 근육질의 남자가 제격!' AI도 성별과 인종에 대한 편견 있다 (5)	다나와
‘의사’ 역할 맡은 AI, 97%가 자신이 AI인 걸 숨긴다... 금융 상담 땐 정반대	AI matters
AI가 쓴 인도 이야기 10편 중 9편이 '가짜 문화'... 음식·의상·축제 모두 틀렸다	AI matters
AI뉴스 ZImage, Flux 2, 클로드 오퍼스 4.5, 오픈AI 광고, 쇼핑, DeepSeekMathV2, Fara7B, HunyuanOCR 등 동영상 있음	조코딩 JoCoding
"정확도 90%?" 도박 중독 막는다던 AI, 실제로는 제대로 작동하는지 아무도 몰라	AI matters
AI가 쓴 시가 시인이 쓴 시보다 높은 점수... 'AI 작품'이라 알려주니 평가 급락	AI matters
LLM의 고질병 ‘첫 단어 집착증’ 개선... 알리바바, '뉴립스' 최고 논문상 수상	AI matters
네이버웍스 ‘AI 스튜디오’ 출시…직장인 보고·검색·정리 업무도 AI로 자동화한다	다나와
'AI 콘텐츠는 걸러서 보여 드려요' 인터넷을 챗GPT 이전으로 되돌리는 '슬롭 이베이더' (3)	다나와
국민 47%만 정부 AI 신뢰... 공공서비스 혁신엔 '경험 중심 설계' 필수 (2)	AI matters
AI 정신병으로 입원·사망까지… 사례 분석한 연구진들 "공통 패턴 찾았다" (1)	AI matters
"AI로 쇼핑하니 반품이 줄었다"… 어도비가 말하는 5가지 AI 트렌드 (1)	AI matters
'탈모도 AI로 해결한다' 탈모시장의 정보 비대칭을 해결하고픈 MyHair AI’ (4)	다나와
"눈으로 보고, 글로 계산"… AI 추론 능력 끌어올리는 해법 찾았다 (1)	AI matters
"여기 어디야?" 사진 한 장에 위치 맞추는 AI 등장… 간판, 건물 모양, 표지판 분석해 장소 찾는다 (3)	AI matters
건설 현장 사망사고 20%가 '추락'… AI가 안전모 미착용까지 잡아낸다 (2)	AI matters
'즐거운 쇼핑은 내가, 지루한 업무는 AI가'… 일본인들의 생성형 AU 사용 실태 조사 보니	다나와
퍼플렉시티, '이용자 중심'의 대화형 쇼핑 어시스턴트 기능 공개	다나와
AI에 "넌 가난한 학생이야" 역할 줬더니… 취향 물을 땐 역할 충실, 시험 보면 본색 드러내	AI matters
"역대 대통령 순서대로 나열해봐"... AI에게 시켜봤더니 생긴 일	AI matters
AI한테 마피아 게임 시켰더니… 최신 AI 12개 전부 거짓말쟁이 못 찾아	AI matters
AI가 '희망'이라는 감정을 이해할까? AI 희망 감지 대결서 구형 AI 모델이 압승	AI matters
AI가 준 조언, 심각한 문제에도 62%가 실천했지만... 2주 후 효과는 '제로'	AI matters
중소기업 직장인이 가장 위험하다… AI 시대, 한국 직무 교육 참여율 OECD 꼴찌	AI matters
[위클리AI] 퍼플렉시티, 코멧 안드로이드 버전 출시…챗GPT 쇼핑 기능 도입 (5)	IT동아
AI뉴스 구글 나노바나나 Pro, Gemini 3, 그록 4.1, GPT‑5.1CodexMax, Meta SAM 3D, AI TOP 100, Sunday Robotics 등 (2) 동영상 있음	조코딩 JoCoding
'굿바이, GPT-4o' OpenAI, GPT-4o API 접속 2026년 2월 종료 발표	다나와
MS AI 수장 “AI가 시시하다고? 그게 더 놀랍다”...윈도우·코파일럿 논란 속 반발에 공개 반박	다나와
이제 챗GPT가 고른 식당만 성공한다? 100곳 중 17곳만 추천받는 AI 시대 마케팅 전략 (1)	AI matters
AI는 답 모르면 무조건 "아니요"… 서울대 연구진, 챗GPT의 숨겨진 습관 발견	AI matters
챗GPT에 1,000번 물어봐도 비슷한 답변뿐... 베이징대 연구진이 해결책 찾았다	AI matters
한국 AI 스타트업, 개인정보보호법 규제로 혁신 난항… 데이터 활용 간극 여전	다나와
중국, ‘AI 플러스’ 전략으로 산업과 일상 전면 재편 추진	다나와
인간형 로봇 경쟁 본격화… 기술 진전 속 노동시장과 경제 구조 변화 우려 (2)	다나와
북한, AI 활용한 기상예측 시스템 구축… 자연재해 대응력 강화 노려	다나와
AWS, 문제 풀 때마다 학습하는 AI 개발... 경험 쌓을수록 저렴하고 정확해 (1)	AI matters
AI가 교수보다 더 깐깐해… AI한테 채점 맡겼더니, 학생 10명 중 4명 점수 떨어져 (5)	AI matters
"이전 답변 틀렸다" 한마디에 무너지는 AI... 같은 질문도 ‘대화 형식’으로 하면 답 달라져	AI matters
'불수능'이었다는 2026학년도 수능시험, 최신 AI들에게 풀게 한다면?	다나와
'최고의 아첨꾼AI' Grok, “엘론 머스크는 오타니를 제외하면 가장 뛰어나”	다나와
"AI가 버블이라고?ㅋㅋ" 엔비디아, 3분기 실적 '어닝 서프라이즈'...뉴욕증시 급등세로 마감 (2)	다나와
오픈AI, 장시간 코딩에 특화된 ‘GPT-5.1-Codex-Max’ 모델 공개 (2)	다나와
AI로 곰 출몰 위험 한눈에…日 조치대, 19개 지역 ‘곰 조우 예측 지도’ 공개	다나와
AI에 코딩 도구 주면 정답률 19%↑…풀이 과정은 41% 더 형편없어져	AI matters
챗GPT에게 "어느 나라가 더 나쁜가?" 물었더니... AI도 국가 차별한다 (6)	AI matters
긴 문서 속 숨은 해킹 명령어, 이제 AI가 스스로 찾아 차단한다	AI matters
디노티시아, SC25서 VDPU 기반 FPGA로 'AI 반도체' 성능 알린다	IT동아
AI 여러 개 쓰면 답 정확해진다더니... 토큰비용 5배에 정답률은 제자리	AI matters
챗GPT가 원전을 부른다… 데이터센터 전력 수요 폭증에 기업들 원전에 '올인'	AI matters
구글 CEO, “AI 맹신 금물”… 급격한 확산 속 과열 우려 제기	다나와
윈도우 11, AI 비서 기능 강화되지만… 새 악성코드 위협도 동반 (1)	다나와
폭스뉴스, 팔란티어와 손잡고 AI 기반 뉴스룸 구축… “미래 뉴스 절반은 AI가 만든다” 전망도 (1)	다나와
인도, AI 확산 영향으로 초보 개발자 일자리 최대 25퍼센트 감소	다나와
"AI가 CCTV 속 폭력 포착"... 제미나이가 ‘주먹 드는 순간’ 95% 정확도로 잡는다	AI matters
"챗GPT도 속았다"... AI에게 '답 없는 질문'하자 60% 이상 틀려	AI matters
'의학 드라마'로 AI 진단 실력 측정했더니... 희귀질환 진단 정확도 38% 그쳐	AI matters
AI 설득 실험, 챗GPT는 유연한 반면 제미나이는 상당한 고집불통	AI matters
구글 딥마인드 "AI도 사람처럼 소송 걸 수 있다"...중세 해양법 법에서 찾은 해법	AI matters
AI 과학자 '코스모스', 6개월 연구를 하루 만에 완료	AI matters
구글, AI 여행 도구 전면 확장…‘플라이트 딜스’ 글로벌 출시와 개인화 예약 기능 강화 (2)	다나와
마이크로소프트, 대기 예측용 AI ‘오로라’ 공개…극한 기상 대응 능력 높인다	다나와
AI 데이터센터 폭증 속 재생에너지 활용 가능성 주목… 지속가능성 논의 본격화 (1)	다나와
고어 버빈스키 감독, “생성형 AI가 영화 제작을 잠식 중”… 창작자 역할 약화 우려	다나와
미국서 성인·노년층 대상 AI 교육 프로그램 출범… 디지털 격차 완화 시도 본격화	다나와
중국, 2025 컴퓨팅 글로벌 컨퍼런스 개최… AI 생태계 중심 전략 부각	다나와
인도 기술 노동시장, AI 확산 속 구조 전환… 엔트리 직군 수요 20퍼센트 이상 감소	다나와
구글 딥마인드, 가상 3D 환경에서 협업·추론·학습하는 AI 에이전트 ‘SIMA 2’ 공개	다나와
유방암 치료와 연구에 AI 도입 가속… 디지털 헬스케어 혁신 본격화	다나와
챗GPT, 그룹 채팅 기능 시범 도입…함께 계획하고 결정하는 ‘공동 작업 공간’ 열린다	다나와
'쇼핑, 말로 합시다' 구글, AI 기반 ‘스마트 쇼핑’ 대규모 업그레이드 공개	다나와
한국, 국방 AI 고도화 필요성 제기… “더 빠르고 스마트한 시스템이 국가안보 핵심”	다나와
비자, AI 기반 커머스 확산 속 안전장치 필요성 강조… 아태 지역 중심으로 가드레일 구축 나서	다나와
Qualigen Therapeutics, AI와 Web3 중심의 AIxCrypto Holdings로 사명 변경… 사업 방향 대전환 선언	다나와
오라클 채권 매도 압력 확대… AI 투자 확대가 재무 리스크 우려로 번져	다나와
생성형 AI 사용자는 늘지만 클릭은 정체... 제로 클릭 시대 본격화	AI matters
"영업사원 절반이 사라진다"... AI가 바꾸는 세일즈의 미래 (6)	AI matters
"AI가 해킹 작업 80~90% 수행"… 앤트로픽, '최초 AI 자율 사이버 공격' 적발	AI matters
생성형 AI에 대한 사회적 인식 확대… 언론 신뢰와 윤리 논의도 가속	다나와
아마존, 운영 혁신 위한 에이전트형 AI와 로봇 기술 공개… 내부 프로세스 자동화 본격화	다나와
기업의 AI 스케일 확산, 여전히 느린 속도… 실제 적용은 4분의 1 수준	다나와
Moonshot AI, Kimi K2 Thinking 공개… GPT5 능가 주장으로 경쟁 구도 흔들다	다나와
Baidu, ERNIE 5.0 공개… GPT5와 Gemini 2.5 Pro 능가 주장	다나와
데이터 사일로가 AI 도입의 최대 걸림돌로 부상	다나와
인간 들어있냐는 평가 받던 로봇 샤오펑 아이언, 내부 기계 몸체 공개/ 25년 11월 2주차 / [주간 AI 뉴스] (1) 동영상 있음	AI matters
“SEO는 죽지 않았다” 시밀러웹이 말하는 구글 AI 모드 최적화 전략 10가지	AI matters
AI 도구 쓰는 마케터 82% "생산성 올랐다"… 2026 소셜 미디어 마케팅 지형도 (1)	AI matters
AI가 실험 없이 만든 가짜 논문, AI 심사위원에게 보여주자 최대 82% 통과 (4)	AI matters
작곡가도, 가수도 AI인 컨트리곡, 빌보드 컨트리 차트 정상 등극 (7)	다나와

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

AI 에이전트 개발자 96%, 도구 하나로는 부족..."여러 개 섞어 쓰는 게 대세"

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

AI 에이전트 개발자 96%, 도구 하나로는 부족..."여러 개 섞어 쓰는 게 대세"

공유하기

공감/비공감