95%의 AI 투자가 성과를 내지 못한 이유

MIT 보고서가 밝힌 ‘GenAI Divide’와 HBR이 지적한 ‘워크슬롭’ 현상, 생성형 AI 시대의 기대와 현실

2025년 현재, 생성형 인공지능(Generative AI)은 글로벌 기업 환경에서 가장 강력한 화두로 자리잡고 있다. 컨퍼런스와 보도자료, 투자자 프레젠테이션에서 빠지지 않는 단어가 되었고, 각종 보고서와 연구에서는 산업 전반에 걸친 파급력을 강조한다. 실제로 다국적 기업부터 중견·중소기업에 이르기까지 업무 전반에 AI를 접목하려는 시도가 활발히 전개되고 있다. 그러나 화려한 담론과 달리 실제 성과는 기대에 크게 못 미친다. MIT 미디어랩 산하 프로젝트 난다(Project NANDA) 연구팀이 2025년 7월 발표한 보고서 『The GenAI Divide: State of AI in Business 2025』는, 전 세계적으로 3천억~4천억 달러 규모의 투자가 이루어졌음에도 불구하고 95%의 조직이 실질적 성과를 내지 못했다고 지적한다.

이 보고서는 기업들이 겉으로는 AI 도입을 확대했으나, 실질적으로는 극소수(약 5%)만이 통합형 파일럿 프로젝트를 통해 수백만 달러 규모의 가치를 창출하는 데 성공했다고 분석한다. 나머지 대다수는 “도입은 했으나 변화를 만들어내지 못한 상태”에 머물러 있으며, 이 현상은 ‘GenAI Divide(생성형 AI 격차)’라는 개념으로 규정되었다. 흥미로운 것은 이러한 분석이 HBR의 최근 연구와도 연결된다는 점이다. HBR은 직원들이 AI를 활용해 겉보기에만 그럴듯한 산출물, 즉 ‘워크슬롭(workslop)’을 양산함으로써 오히려 생산성이 하락하는 부작용을 보고했다. 두 보고서는 서로 다른 차원에서 연구되었지만, 공통적으로 “투자는 늘었지만 성과는 부재하다”는 결론을 내리고 있다.

생성형 AI 투자, 왜 성과로 이어지지 못했나

보고서가 밝힌 가장 두드러진 특징은 “도입은 많지만, 변혁은 적다”는 점이다. 기업들은 챗GPT, 코파일럿과 같은 범용 LLM을 개인 생산성 도구로 활용하는 데는 적극적이지만, 실제 비즈니스 프로세스에 통합해 손익(P&L)에 변화를 주는 데는 실패하고 있다. 예컨대, 응답 기업의 80% 이상이 범용 LLM을 시범 운영했고, 40%는 실제 업무에 배치했으나, 이는 대부분 문서 작성·요약·코드 초안 작성 등 제한적 업무에 그쳤다. 반면 기업 맞춤형 AI 시스템은 60%가 검토했지만, 파일럿 단계까지 진행한 곳은 20%에 불과했고, 실제 도입에 성공한 곳은 5% 수준에 그쳤다. 즉, 조직의 열정과 투자에도 불구하고 AI는 아직 ‘파일럿의 벽’을 넘지 못하고 있는 것이다.

프로젝트 난다는 산업별 변화를 계량화하기 위해 ‘AI 시장 파괴 지수(Market Disruption Index)’를 개발했다. 이 지수에 따르면 기술(Tech)과 미디어(Media & Telecom) 산업만이 뚜렷한 구조적 변화를 보였으며, 나머지 7개 산업에서는 실질적 변혁이 나타나지 않았다. 기술 산업에서는 새로운 AI 네이티브 기업들이 빠르게 성장하며 기존 강자에 도전하고 있다. 미디어 산업은 AI 기반 콘텐츠 제작과 광고 생태계 변화가 뚜렷하다. 전문 서비스, 금융, 헬스케어, 제조, 에너지 등은 여전히 파일럿에 머물러 있으며, 구조적 변화를 일으키지 못하고 있다. 이처럼 산업별 차이는 AI가 범용적 기술임에도 불구하고, 실제 도입 과정에서 맥락과 구조적 장벽이 얼마나 큰 영향을 미치는지를 보여준다.

빌드 vs 바잉: 실패를 가르는 조직 전략

보고서가 지적하는 또 하나의 특징은 내부 구축(Build)과 외부 구매(Buy) 전략의 성패 차이다. 기업 내부에서 독자적으로 시스템을 개발하는 경우 실패 확률이 높았으며, 외부 벤더와 협업해 맞춤형 솔루션을 도입한 경우 성공률이 두 배 가까이 높았다. 이유는 명확하다. 내부 개발은 비용과 시간이 많이 들고, 실제 워크플로와의 통합 과정에서 취약점을 드러내기 쉽다. 반면 외부 벤더와 협력하면 이미 검증된 기술과 경험을 바탕으로 빠르게 커스터마이징이 가능하다. 결국 성공적인 기업들은 “단순한 툴 구매자”가 아니라 “파트너십을 통한 공동 설계자”로 움직이고 있었다.

이제 시선을 HBR의 연구로 옮겨보자. 이 연구는 AI 도입이 왜 성과를 내지 못하는지, 조직 내부의 구체적 현상을 보여준다. 연구진은 ‘워크슬롭(workslop)’을 “겉보기에만 그럴듯해 보이지만, 실제로는 업무를 진전시키지 못하는 AI 생성 산출물”로 정의한다. 예를 들어, 깔끔한 형식의 보고서 초안이나 코드가 빠르게 만들어지지만, 맥락과 핵심이 결여되어 있어 결국 동료들이 이를 다시 해석·수정·재작업해야 하는 상황이 벌어진다. 조사에 따르면, 미국 내 1,150명의 직장인 중 40%가 최근 한 달 내 워크슬롭을 받았다고 답했으며, 전체 업무 콘텐츠의 평균 15.4%가 워크슬롭에 해당한다고 추산된다. 이로 인해 직원들은 사건당 평균 1시간 56분을 허비했고, 이는 직원 1만 명 규모의 기업에서 연간 약 9백만 달러의 생산성 손실로 이어진다.

광고
대학

워크슬롭은 단순한 시간 낭비를 넘어 신뢰와 협업을 훼손한다. 연구 결과, 동료에게서 워크슬롭을 받은 직원의 42%는 그 동료를 덜 신뢰하게 되었고, 37%는 지적 역량이 낮다고 평가했다. 이는 결국 조직 문화와 협업 기반을 무너뜨리는 또 다른 비용으로 작용한다.

공통된 문제: 학습하지 못하는 도구, 준비되지 않은 조직

MIT 보고서의 ‘GenAI Divide’와 HBR의 ‘워크슬롭’은 서로 다른 차원을 분석하지만, 공통된 원인을 지적한다. AI 시스템이 학습하지 못하고, 조직이 이를 적절히 통합하지 못한다는 점이다. 범용 LLM은 유연하지만 기억과 학습이 부족해 매번 동일한 맥락을 입력해야 하고, 기업 맞춤형 툴은 워크플로에 통합되지 못해 ‘과잉 설계’ 혹은 ‘실험용 시연품’에 머문다. 결국 이는 현장 직원들이 AI를 무분별하게 사용하거나, 관리자는 성과 없는 투자를 이어가게 만든다. 즉, AI의 한계와 조직 설계의 미숙함이 맞물리며, 기대와 현실의 괴리가 증폭되고 있는 것이다.

그렇다면 5%의 성공 기업은 어떻게 다른가? MIT 보고서와 HBR 연구는 공통적으로 다음과 같은 교훈을 제공한다. 맞춤형 통합: 성공 기업은 범용 툴이 아니라 특정 프로세스에 깊이 맞춤화된 시스템을 도입했다. 학습과 피드백: 단순한 산출이 아니라, 지속적으로 맥락을 학습하고 개선하는 기능을 강조했다. 현장 중심: 도입 결정은 중앙이 아니라 현장 관리자와 파워 유저가 주도했다. 협업적 활용: HBR이 지적한 ‘파일럿(pilot) 마인드셋’을 가진 직원들은 AI를 회피가 아닌 창의적 보완 도구로 사용했다. 즉, “빠르고, 가볍고, 맞춤화된 도입”과 “인간과 AI의 협업적 사용”이 성패를 가른 것이다.

MIT 보고서는 향후 기업 AI 도입의 핵심 키워드로 ‘에이전틱 웹(Agentic Web)’을 제시한다. 이는 메모리·학습·적응 기능을 갖춘 에이전트들이 네트워크상에서 자율적으로 협력하는 생태계다. 즉, 지금까지는 정적 툴 중심이었다면, 앞으로는 지속적으로 학습하고, 상호작용하며, 스스로 최적화하는 시스템이 시장을 주도하게 될 것이라는 전망이다. 이는 단순히 워크슬롭을 줄이는 차원을 넘어, AI와 인간이 협력하는 방식 자체를 바꿀 가능성을 제기한다.

생성형 AI는 이미 기업 현장에 깊숙이 들어와 있다. 그러나 MIT 보고서가 보여주듯, 투자의 대부분은 성과로 이어지지 못하고 있으며, HBR 연구가 보여주듯, 현장에서는 오히려 협업과 신뢰를 해치는 ‘워크슬롭’이 양산되고 있다. 이 괴리를 해소하기 위해서는 “모든 곳에 AI를 적용하라”는 무분별한 접근이 아니라, 학습 가능한 시스템, 맥락에 맞춘 맞춤형 도입, 인간과 AI의 협업을 강화하는 조직 설계가 필요하다. 결국 생성형 AI 시대의 성패는 “얼마나 많이 도입했는가”가 아니라 “어떻게 활용했는가”에 달려 있다. 지금 필요한 것은 양적 확산에서 질적 내실로의 전환이다.

#GenAI #워크슬롭 #MIT보고서 #HBR #AI도입 #생산성 #AgenticWeb #스포트라이트유

Social Share

함께 읽어보세요

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다