오영웅

연구노트읽기 3분

한 달간 AI에 개발을 맡겼더니 내 프로젝트를 설명하지 못하게 됐다

AI로 더 빨라졌다는 체감과, 특정 조건에서 작업 시간이 19% 더 길었던 측정 결과. 바이브 코딩이 무엇을 팔았는지 마케팅으로 밥 먹는 사람이 뜯어봤다.

수정

2026-09-06 덧붙임: 2026년 7월에 쓴 회고다. METR 연구의 적용 범위와 2026년 후속 측정의 한계는 개정한 이해의 부채 글에 정리했다.

나는 마케팅으로 밥을 먹는다. 그래서 바이브 코딩을 볼 때도 기술보다 파는 방식이 먼저 보였다.

파는 방식만 놓고 보면 잘 만든 마케팅이었다.

바이브 코딩은 프롬프트 친 직후의 5분을 팔았다

바이브 코딩의 약속을 내가 받아들인 말로 적으면 이렇다. 상상이 현실이 된다. 무능력이 생산이 된다. 프롬프트를 치면 화면에 뭔가 나타나고, 그 순간 뇌에서 뭔가 터지는 것 같다. 내가 만들었다.

도파민 주도 개발(Dopamine-Driven Development) — 개발자 에세이에서도 다루는 표현이다. 여기서는 화면에 뭔가 뜨는 그 순간을 계속 다시 찾게 되는 느낌을 빗대어 쓴다. 생리적 원인을 확인했다는 뜻은 아니다.

나는 직업이 직업이라 마케팅으로 읽힌다 — 내 눈에는 이런 순서가 보인다. "10분 만에 앱을 만들었다"는 사례가 카테고리 전체의 약속처럼 들린다. 체험의 첫 5분을 제품의 전부처럼 보여준다. 그리고 측정을 기분에게 맡긴다.

METR가 16명에게 246개 과제를 시켜 시간을 쟀다

숫자가 있다.

METR의 2025년 초기 연구에서는 숙련된 오픈소스 개발자 16명이 익숙한 저장소에서 246개의 실제 과제를 수행했다. 그 조건에서는 AI 도구를 사용할 때 작업 시간이 평균 19% 더 길었다. 반면 참가자들은 사용 후에도 자신이 더 빨라졌다고 추정했다. 대상과 과제, 도구와 측정 시점이 정해진 결과이지, 모든 AI 개발 업무의 효과를 뜻하는 것은 아니다.

Stack Overflow 2025 설문에서는 AI 도구를 쓰며 겪은 불편을 묻는 문항의 응답자 중 66%가 "거의 맞지만 완전히 맞지는 않는 결과"를 골랐다. 여러 답을 고를 수 있는 문항이었다. 전체 개발자의 비율이나 AI 코드의 오류율로 읽을 수는 없다.

거의 맞다는 게 내게는 핵심이었다. 화면에 뭔가 그럴듯한 게 뜨면, 충분히 확인하지 않고 다음으로 넘어가기 쉬웠다.

이 실험에서는 시간이 더 걸렸다

작업 시간 지수 · AI 미사용 조건 = 100

AI 미사용
100비교 기준
AI 사용 허용
119같은 연구에서 19% 더 긴 작업 시간
개발자 16명·246개 과제를 다룬 2025년 초 연구. 시간 비율을 지수로 옮겼으며 실제 소요 분이나 현재 AI 전체의 효과가 아니다.METR · 2025.07.10 연구

지난달, 내 프로젝트를 내가 설명하지 못했다

2026년 6월 이야기다. 나는 한 달 동안 자동 실행에 개발을 전부 맡겼다. 화면에 결과가 계속 나타났고, 나는 계속 괜찮다고 판단했다. 브라우저에 보이는 게 멀쩡했으니까.

그러다 어느 날 알았다. 내 프로젝트인데 이해가 0이었다. 어디서부터 잘못됐는지 몰랐고, 내가 뭘 모르는지는 더 몰랐다.

매일 뭔가 만들어지고 있었으니 잘 굴러가는 것처럼 느껴졌다. 정작 얼마나 굴러갔는지는 잴 수가 없었다. 당시에는 코드로 확인하는 데서 막혔다.

이게 도파민 주도 개발의 청구서다. 코드는 한 달 내내 나왔다. 그동안 줄어든 건 그중 어디가 틀렸는지 짚을 수 있는 범위였다.

그래도 AI로 계속 만든다 — 규칙을 몇 개 걸고

오해하지 말 것. 결론이 "AI를 쓰지 마라"면 이 글은 러다이트 잡문이다. 나는 지금도 AI와 함께 거의 모든 것을 만든다. 이 블로그도 그렇게 만들었다.

차이는 하나다. 어느 커뮤니티에서 받은 조언 중에 버릴 수 없는 문장이 있었다. 내가 기억하는 요지는 이렇다.

AI는 확률적으로 설명한다. 하지만 브레이크포인트, 실패하는 테스트, 네트워크 로그는 이번, 이 코드에서 실제로 참인 것을 말한다. 목표는 AI를 끊는 게 아니라, AI가 말로 빠져나갈 수 없는 근거를 항상 하나는 쥐고 있는 것이다.

그래서 나는 규칙을 몇 개 만들어서 나에게 적용하는 중이다. 실행하기 전에 결과를 예측해서 먼저 적는다 — 맞으면 이해한 것이고, 틀리면 거기가 공부할 자리다. AI와 일한 날은 최소 한 번, 내 손으로 확인한 사실 하나를 만들고 끝낸다. 설명 못 하는 코드는 그때그때 장부에 적어둔다.

한 달 동안 내가 본 계기판은 브라우저 화면 하나였다. 화면에 뭐가 뜨는 것 말고는 잘 되고 있는지 볼 방법이 없었다. 위의 세 규칙은 그 화면 옆에 볼 것을 하나씩 늘리는 장치다.

마케터의 결론

바이브 코딩은 기분에 이름을 붙여서 팔았다. 다음에 뭐가 팔릴지는 모르겠고, 내가 지금 할 수 있는 건 숫자에 출처를 붙이는 것 정도다. 그래서 체감과 실측을 갈라 적는다 — 더 빨라졌다는 추정과, 해당 조건에서 작업 시간이 평균 19% 더 길었던 측정 결과.

METR 참가자 16명은 자기가 빨라졌다고 느꼈고, 스톱워치는 반대로 나왔다. 나는 그 한 달 동안 스톱워치를 아예 안 들고 있었다.