Strategy

인텔리전스 투자 수익 극대화

읽는 데 6분

David Pan

지난해 말, 에이전틱 엔지니어링이 마침내 제대로 작동하기 시작했습니다. 그리고 작동하자마자 모든 것이 한꺼번에 늘어났습니다. 더 많은 엔지니어가 도구를 도입했습니다. 더 많은 작업에 도구를 사용하기 시작했습니다. 더 많은 추론과 도구 호출이 필요해지면서 작업당 비용도 늘어났습니다. 이 세 가지는 서로 곱해지기 때문에 많은 엔지니어링 팀의 AI 지출은 J 커브를 그리며 치솟았습니다.

이 팀들은 그 지출이 그만한 가치가 있었다고 말합니다. 더 빠르게 배포하고 실질적인 가치를 얻고 있습니다. 하지만 가치가 있든 없든 2026년 예산을 훌쩍 넘어서고 있으며, 이제 우리가 만나는 거의 모든 고객은 비슷한 지침을 내리고 있습니다. 계속 가속하되 비용도 철저히 관리하라는 것입니다.

말처럼 쉽지는 않습니다. 자주 나오는 몇 가지 질문에 대한 제 견해를 말씀드리겠습니다.

1. 더 저렴한 모델을 사용해야 할까요?

Fable과 Opus가 꽤 비싸다는 것은 누구나 알기에, 당연히 더 저렴한 모델을 사용할 수 있는지가 첫 번째 질문이 됩니다. 하지만 합리적인 의구심도 충분히 있습니다. 저렴한 모델이 결국 다시 해야 할 결과물을 내놓는다면 아무것도 절약한 것이 아닙니다. 비용은 두 번 들고 시간까지 낭비하게 됩니다.

지난해 말만 해도 Opus 4.5는 중요한 엔지니어링 작업을 믿고 맡길 수 있는 유일한 모델이었습니다. 오늘날에는 12개 모델이 이를 능가합니다. 최상위 모델 간 지능의 차이는 이제 상당히 좁은 반면, 가격과 속도의 차이는 매우 큽니다. 적절한 모델을 선택하면 동일한 작업을 훨씬 적은 비용으로도 똑같이 잘 수행할 수 있는 경우가 많습니다.

관건은 제대로 선택하는 것입니다. 모든 작업에서 최고인 모델은 없으며, 프런티어는 몇 주마다 바뀝니다. 엔지니어에게 그 모든 조합을 머릿속에 담아 두라고 요구하는 것은 합리적이지 않습니다. 알고 보니 이 역시 AI가 맡을 일입니다. 이를 위해 정확히 설계된 맞춤 학습 모델로 구동되는 모델 라우터를 만들었습니다. 주어진 작업을 어떤 모델이 확실하게 처리할 수 있는지 파악한 다음, 기준을 충족하는 가장 저렴한 모델로 라우팅합니다. Cursor의 라우터는 68% 낮은 비용으로 Fable 수준의 사용자 만족도를 제공합니다.

그러니 그렇습니다. 더 저렴한 모델은 실질적인 비용을 절감합니다. 다만 엔지니어가 직접 라우팅하게 하지는 마세요.

2. 오픈 웨이트 모델을 사용해야 하나요?

원칙적으로는 그렇습니다. 특정 작업에서 오픈 웨이트 모델이 달러당 최고의 성능을 제공한다면, 다른 모델과 마찬가지로 라우터 뒤에 두고 모델 구성에 포함하는 것이 좋습니다.

하지만 이 글을 작성하는 시점에서 오픈 웨이트 모델은 파레토 프런티어에 속하지 않습니다. eval을 실행하고 단순한 표시 가격이 아닌 토큰 효율성까지 고려하면, 선도적인 클로즈드 모델이 여전히 달러당 더 높은 지능을 제공합니다.

좋은 소식은 오픈 웨이트 모델을 직접 실행하지 않아도 그 혜택을 누릴 수 있다는 점입니다. 주요 연구소들은 모두 오픈 웨이트 생태계를 면밀히 주시하고 있으며, 이는 클로즈드 모델의 가격 책정에도 분명 영향을 미칩니다. 그러니 계속 오픈 웨이트를 응원하세요. 어느 쪽이든 여러분에게 이득입니다.

3. 클라우드 에이전트를 사용해야 할까요? 비용이 많이 들지 않나요?

요즘 클라우드 에이전트 군이 24시간 소프트웨어를 생산하는 '소프트웨어 공장'에 대한 기대가 큽니다. 엔지니어링 리더들은 흔히 이렇게 반응합니다. 좋아 보이지만, 이미 비용을 너무 많이 쓰고 있습니다.

그럴 수 있습니다. 하지만 클라우드 에이전트 도입으로 발생할 수 있는 비용의 상당 부분은 이미 회사에서 매일 발생하고 있습니다. 엔지니어들은 이미 에이전트를 사용해 코드 리뷰, 병합 충돌, CI 실패 등을 처리하고 있습니다. 다만 현재는 이러한 작업에도 상당한 엔지니어링 시간이 들고, 엔지니어마다 일관되지 않게 수행됩니다.

코드 리뷰를 예로 들어 보겠습니다. 모든 비용을 포함한 엔지니어의 시간당 비용이 50입니다. Bugbot 리뷰는 1달러도 들지 않으며, 계속 개선되고 있습니다. 최신 버전은 3배 이상 더 빠르고, 22% 더 저렴하며, 버그를 10% 더 많이 찾아냅니다. 이 정도 계산에 복잡한 ROI 모델은 필요하지 않습니다.

Cost of one PR reviewIllustrativeHuman review30 minutes at a $100 fully loaded hour$50Bugbot reviewOne PRUnder $1
A half hour of human review costs about $50 at a $100 fully loaded engineer hour, while a Bugbot review of the same pull request costs under $1.

모든 클라우드 에이전트 워크플로우에는 간단한 원칙이 있습니다. 먼저 작동하게 만들고, 그다음 더 잘 작동하게 만들고, 마지막으로 비용을 낮추세요. 시간은 여러분의 편입니다. 시간이 갈수록 AI 비용은 계속 낮아질 것입니다.

4. 어떤 지표를 추적해야 하나요?

달성하려는 목표에 맞는 지표를 선택하세요. 일반적으로 세 단계로 나뉩니다. 먼저 도입률을 살펴보세요. 사람들이 실제로 도구를 사용하고 있나요? 다음으로 엔지니어링 지표를 측정하세요. 더 빠르게 배포하고 있나요? 효율적으로 배포하고 있나요? 이를 입증한 후에야 그 성과를 비즈니스와 연결해 볼 수 있습니다.

도입률을 측정할 때는 코드 줄 수와 토큰 사용량은 제외하세요. 둘 다 부풀리기 쉽고, 오히려 비생산적인 행동을 유도할 수 있습니다. 대신 매일 도구를 사용하는 엔지니어 수와 사용 수준을 측정하세요.

엔지니어링 지표로는 다음이 효과적입니다. 성과가 다른 영역에서 손실을 초래하고 있지는 않은지 파악할 수 있도록 가드레일 지표와 함께 사용하세요.

  • 속도: PR 처리 속도, 티켓 완료율, 스토리 포인트 소진율. AI 도입 전 기준선 대비 프로젝트를 처음부터 끝까지 제공하는 속도입니다.
  • 효율성: 반복 작업 자동화로 절감한 시간과 해당 워크플로우의 작업당 요금.
  • 가드레일: 버그 수, 되돌리기 비율, 코드 변경률.

비즈니스에 미치는 효과를 측정하는 일은 어렵습니다. 쉬운 답이 있다고 말하지는 않겠습니다. AI 지출이 늘어날수록 이를 비즈니스 성과와 연결해야 한다는 압박도 커질 것입니다. 그럴 만한 이유도 있습니다. 기업 이사회는 엔지니어링 지표에 관심이 없습니다. 매출과 수익에 미치는 효과를 보고 싶어 합니다.

5. 엔지니어별로 지출 예산을 설정해야 하나요?

아마 그렇습니다. 예산을 어떻게 설정할지는 기업마다 크게 다르며, 모든 기업에 맞는 단일한 정답은 없습니다. 대체로 적용할 수 있는 몇 가지 팁을 소개합니다.

하드 캡 대신 상향 조정할 수 있는 소프트 캡을 사용하고, 첫 번째 증액은 쉽게 승인할 수 있도록 하세요. 그러면 지출에 대한 인식을 높이면서도 결정권은 대부분 엔지니어에게 맡길 수 있습니다. 이후 증액 규모가 커질수록 더 면밀히 검토하세요. AI 지출은 계약직 인력을 고용하는 것과 크게 다르지 않으며, 그렇다고 백지수표를 발행하지는 않을 것입니다.

또한 파워 법칙을 예상하세요. 일부 엔지니어는 다른 사람보다 훨씬 더 많이 지출할 수 있으며, 그것이 반드시 나쁜 것은 아닙니다. 사용량 데이터에 따르면 파워 사용자와 그 외 사용자 간에는 큰 격차가 있으며, 지출이 가장 많은 사용자는 회사 전체에서 AI를 가장 효율적으로 사용하는 사용자에 속하는 경우가 많습니다.

6. AI 지출을 어떻게 검토해야 하나요?

마음에 들지 않을 답변일 수 있습니다. 지출은 정기적으로 재무 팀과 함께 검토해야 합니다. 대부분의 소프트웨어 조직은 이미 클라우드 지출을 철저하게 추적하고 최적화합니다. 이 글을 읽고 있다면 AI 지출도 같은 수준으로 관리할 필요가 있을 만큼 충분히 클 가능성이 높습니다. 재무 팀도 이를 반길 것입니다. 이 문제는 CFO들의 주요 관심사이기 때문에, 이를 함께 논의하기 위해 CFO Council도 출범시켰습니다.

사용량 데이터를 팀별, 프로젝트별, 워크플로우별, 작업 유형별 네 가지 방식으로 분류하세요. 필요한 수준의 가시성을 확보했는지 확인하는 좋은 기준은 다음과 같은 질문에 답할 수 있는지입니다.

  • 지출 중 상위 세 가지 제품 이니셔티브에 각각 얼마나 투입되고 있나요?
  • 우리 팀의 한 엔지니어가 지난달 토큰에 $10k를 지출했습니다. 생산적인 지출이었나요?
  • 버그 하나를 수정하는 데 드는 토큰 비용의 중앙값은 얼마이며, 그 추세는 어떤가요?

이상치와 규모가 큰 "알 수 없는" 지출 항목을 추적하세요. 모든 항목을 이해하고, 이것이 비즈니스에 어떤 가치를 제공하는지 확신이 들 때까지 자세히 살펴보세요.

그런 다음 확인한 내용을 바탕으로 조치하세요. AI가 실제로 효과를 내는 영역에는 더 투자하세요. ROI가 높은 사용자에게는 예산을 줄이지 말고 더 배정하세요. 마지막으로 예산 변경은 가능한 한 제로섬에 가깝게 유지하세요. 한 영역에서 크게 초과해야 한다면, 그 재원은 다른 곳에서 마련해야 합니다.

7. 팀을 어떻게 코칭해야 하나요?

비용을 직접 부담하지 않으면 나쁜 습관에 빠지기 쉽고, 많은 조직에서는 팀이 청구서를 아예 보지도 못합니다. 따라서 비용 투명성부터 확보하세요.

그런 다음 관리 체계 전반에 걸쳐 책임을 부여하세요. 일선 엔지니어링 관리자는 채용 결정이나 대규모 기술 부채 해소 투자와 마찬가지로, 팀의 AI 지출이 그만한 가치가 있는지 확인하는 것을 자신의 업무 일부로 여겨야 합니다.

이 두 가지만 제대로 하면 대부분의 코칭은 저절로 이루어집니다. 엔지니어는 최적화에 능합니다. 비용과 결과에 대한 책임을 명확히 보여주면, 스스로 효율적인 방법을 찾아낼 것입니다.

분류: Strategy