← Back to Blog
AI · AX Article · 2026.10.10

AI로 끝낸 업무가 곧 팀의 실력은 아니다

AI의 도움으로 완성한 결과와 사람에게 남은 이해·오류 진단 능력을 구분하고, 코딩·수학 실험을 바탕으로 조직의 온보딩에서 보존할 연습을 살펴본다.

ai-axorganizational-learningskill-formationhuman-ai-collaborationwork-design

완성된 푸른 다리 옆에서 사람이 AI의 도움을 받으며 구조 부품을 직접 조립하는 개념 이미지

AI 보조와 숙련 형성의 관계를 표현한 생성 이미지이며, 실제 실험이나 업무 현장의 기록사진이 아니다.

신입 담당자가 AI의 도움으로 낯선 코드를 완성했다. 테스트도 통과했다. 이제 이 담당자에게 비슷한 코드의 검토를 맡겨도 될까. 도입 교육을 설계할 때 충분히 마주칠 수 있는 가상의 장면이다. 결과물은 눈앞에 있지만, 무엇을 이해했고 어떤 오류를 스스로 알아볼 수 있는지는 아직 드러나지 않았다.

AI를 켠 상태에서 일을 잘하는 능력은 중요하다. 조직이 모든 일을 도구 없이 수행하게 만들 이유는 없다. 다만 마지막에 사람이 확인하도록 정했다면, 그 사람이 확인할 능력을 어디에서 배우는지도 함께 설계해야 한다. 산출물의 승인과 담당자의 숙련 판정은 서로 다른 일이다.

이 차이는 막연한 기술 불안만으로 제기되는 문제가 아니다. 낯선 프로그래밍 도구를 배우는 개발자와 수학을 연습하는 학생을 대상으로 한 실험에서는, 도움을 받으며 과제를 수행한 결과와 이후 혼자 풀어 본 결과가 갈라졌다. 두 연구의 범위와 한계를 살펴보면 조직의 AI 교육에서 무엇을 따로 확인해야 하는지 구체화할 수 있다.

코드를 완성한 뒤 무엇이 남았는가

Anthropic이 2026년 공개한 연구는 Python 경험이 있지만 비동기 프로그래밍 라이브러리 Trio는 써 본 적 없는 개발자 52명을 대상으로 했다. 참가자는 AI 보조가 있는 집단과 없는 집단에 무작위로 배정됐고, 새로운 라이브러리로 코딩 과제를 수행한 뒤 관련 개념·코드 읽기·디버깅 등을 평가하는 퀴즈를 치렀다.[1][2]

공식 연구 설명에 제시된 직후 퀴즈 평균은 AI 집단 50%, 비교 집단 67%였다. 평균의 차이는 17%포인트다. AI 집단의 과제 완료 시간은 조금 짧았지만 그 차이는 통계적으로 유의하지 않았다. 집단 간 점수 차이는 디버깅 문항에서 가장 컸다.[1]

이 결과를 “AI가 개발자의 능력을 17% 떨어뜨렸다”로 옮기면 두 가지를 놓친다. 우선 비율과 퍼센트포인트가 다르다. 또 이 실험은 이미 갖고 있던 능력이 오랜 사용 끝에 사라지는지를 측정한 연구가 아니다. 참가자들이 낯선 도구를 배우는 짧은 과정에서 무엇을 익혔는지, 과제 직후의 평가로 비교했다. 직장 전체의 생산성이나 장기적인 숙련 상실로 일반화할 수 없다.

연구진은 AI를 사용한 방식도 관찰했다. 설명을 요청하거나 개념을 질문하며 이해를 확인한 참가자들은 과제 해결을 폭넓게 맡긴 참가자들과 다른 학습 양상을 보였다. 그러나 이 사용 패턴은 연구진이 각각 무작위로 배정한 처치가 아니다. 설명을 요청하는 습관 자체가 성적 차이의 원인이라고 단정하거나, “설명 프롬프트만 넣으면 학습 문제가 해결된다”고 처방할 근거는 부족하다.[1][2]

조직이 여기서 가져갈 질문은 더 좁고 실용적이다. 처음 배우는 업무에서 AI가 해결한 부분을, 담당자도 배운 것으로 집계하고 있지는 않은가. 코드를 실행할 수 있다는 증거와 코드가 잘못됐을 때 이유를 설명할 수 있다는 증거는 구분해서 모아야 한다.

정답을 주는 도구와 학습을 돕는 설계

2025년 PNAS에 실린 수학 교육 연구는 도움의 설계를 비교한다. 연구진은 2023년 가을 튀르키예의 한 고등학교에서 약 1,000명의 학생을 대상으로 수업을 진행했다. 학급별로 일반적인 대화형 보조 도구인 GPT Base, 학습용 보호장치를 넣은 GPT Tutor, AI를 사용하지 않는 비교 조건을 배정했다. 연습 뒤에는 모든 조건에서 자료와 AI 없이 시험을 치렀다.[3]

두 AI 조건은 보조를 받는 연습 문제에서 비교 집단보다 좋은 성과를 보였다. 하지만 이어진 무보조 시험에서 GPT Base 집단의 성과는 비교 집단보다 상대적으로 17% 낮았다. 여기의 17%는 앞선 코딩 연구의 17%포인트와 다른 수치다. GPT Tutor 집단은 무보조 시험에서 비교 집단과 통계적으로 유의한 차이가 없었다.[3]

GPT Tutor의 설계를 “정답 대신 힌트를 주었다”는 한 문장으로 압축해서도 안 된다. 이 도구에는 힌트를 제공하도록 하는 지시와 함께, 교사가 준비한 문제별 정답·흔한 오개념·피드백 정보가 들어갔다. 연구에서 비교한 것은 이 요소들이 결합된 도구다. 어느 한 지시문이 혼자 효과를 냈다고 분리해 해석할 수 없다.

무보조 시험의 차이가 유의하지 않았다는 결과도 정확히 읽어야 한다. 해당 조건에서 GPT Base의 부정적 효과가 완화됐다고 볼 수 있지만, GPT Tutor가 비교 집단보다 더 큰 학습 효과를 냈다는 증거는 아니다. 연구는 한 학교의 수학 교육과 단기 결과를 다뤘다. 최신 모델을 쓰는 기업의 온보딩에 같은 효과가 생길지는 별도로 확인해야 한다.[3]

그럼에도 설계상의 차이는 남는다. AI가 답을 잘 만들도록 준비하는 일과 사람이 그 답을 이해하도록 돕는 일은 목표부터 다르다. 업무 교육에서도 완성 예시만 제공할지, 자주 틀리는 지점과 그 이유까지 준비할지에 따라 학습자가 마주하는 과제가 달라진다.

온보딩에서 없애지 말아야 할 연습

다음은 두 연구의 결과를 조직에 그대로 적용한 결론이 아니라, 그 결과를 바탕으로 제안하는 운영 방식이다. 모든 업무에 AI 금지를 걸기보다, 검토 책임을 맡길 사람에게 필요한 판단을 먼저 정하고 그 판단을 연습할 자리를 남기는 것부터 시작한다.

예를 들어 고객에게 보낼 규정 안내를 작성하는 업무라면 문장 전체를 외우는 능력보다 적용 조건을 찾고 예외를 알아채는 능력이 중요할 수 있다. 가상의 교육 사례에 일부러 적용 기간이 다른 규정을 섞어 둔다고 하자. AI는 안내문을 매끄럽게 만들 수 있다. 교육 담당자가 확인하려는 것은 문장의 매끄러움이 아니라, 학습자가 왜 그 규정으로 답하면 안 되는지 근거를 짚을 수 있는가다.

이때 교육용 과제와 실제 고객 업무를 분리해야 한다. 실제 고객에게 잘못된 답변을 보내며 학습 효과를 시험하는 방식은 적절하지 않다. 공개 자료나 사용 권한이 확인된 비식별 사례로 연습하고, 실제 업무의 승인·보안·안전 절차는 그대로 유지한다.

교육 기록도 완성 파일 하나에 몰아넣지 않는 편이 낫다.

확인하려는 것남길 수 있는 증거그 증거만으로 말할 수 없는 것
AI를 사용하며 과제를 수행했는가허용된 도구와 도움의 범위, 승인된 결과물담당자가 같은 판단을 혼자 할 수 있는가
결과가 맞는 이유를 이해했는가적용 근거와 예외를 자기 말로 설명한 기록다른 유형의 문제로 옮겨 갈 수 있는가
잘못된 결과를 독립적으로 진단하는가답을 보여 주지 않은 새 사례에서 찾은 오류와 수정 이유시간이 지난 뒤에도 능력이 유지되는가
이후에도 필요한 판단이 남아 있는가일정 기간 뒤 달라진 사례에서 다시 확인한 결과모든 업무와 예외를 맡길 준비가 됐는가

이 표는 사람을 점수로 서열화하기 위한 평가표가 아니다. 어느 도움은 유지하고 어느 연습은 보강해야 하는지 정하는 기록이다. 무보조 확인에서도 실제로 필요한 능력만 평가해야 한다. 업무에서 늘 검색하는 규정을 암기하지 못했다는 이유로 실무 역량이 없다고 판정하면, 평가가 다른 능력을 재고 있는 셈이다. AI를 잠시 제외하더라도 문서 검색이나 사전처럼 허용할 자료는 평가 목적에 맞춰 명시할 수 있다.

학습자가 실패했다면 곧바로 도구를 금지하기보다 실패 지점을 살핀다. 개념을 모르는지, 근거 문서를 못 찾는지, AI의 설명을 이해한 것으로 착각했는지에 따라 필요한 연습이 다르다. 이런 운영안의 효과 역시 팀에서 확인해야 한다. 위 연구들이 특정 온보딩 순서나 재평가 간격의 효과까지 검증한 것은 아니다.

검토자는 자동으로 길러지지 않는다

조직이 AI에게 초안을 맡기고 사람에게 최종 검토를 남기는 방식은 그럴듯하다. 하지만 초안을 만들며 익히던 판단까지 사라진다면, 앞으로 검토자가 어떻게 자랄지는 별도의 문제가 된다. 오늘의 숙련자는 오래 해 온 경험으로 오류를 잡아낼 수 있어도, 새 담당자에게 같은 학습 경로가 남아 있다고 가정할 수는 없다.

그렇다고 도움 없이 해내는 일만 진짜 실력이라고 규정할 필요도 없다. AI와 협업하며 결과를 내는 능력, 근거를 찾아 검증하는 능력, 도구가 틀렸을 때 멈추는 능력은 함께 필요하다. 다만 한 능력의 증거를 다른 능력의 증거로 대신하지 않아야 한다.

개인의 활용법을 동료가 재현할 수 있는 교재로 바꾸는 일 다음에는, 그 교재가 무엇을 대신해 주고 무엇을 직접 해 보게 하는지 살펴볼 차례다. 교육을 마친 뒤 남겨야 할 것은 잘 나온 파일만이 아니다. 담당자가 이제 어떤 오류를 알아보고, 무엇을 근거로 승인하며, 어디에서 도움을 요청해야 하는지 보여 주는 증거도 필요하다.

AI 도입 교육의 마지막 질문을 바꿔 볼 수 있다. “무엇을 완성했는가”를 확인한 다음, “이제 무엇을 판단할 수 있게 됐는가”를 묻는 것이다.

참고 자료

  1. Anthropic, How AI assistance impacts the formation of coding skills, 2026년 1월 29일. 코딩 실험의 설계·평균 점수·사용 패턴·한계를 설명한 공식 연구 소개다.
  2. Judy Hanwen Shen·Alex Tamkin, How AI Impacts Skill Formation, arXiv:2601.20245v2. 같은 코딩 연구의 논문이며, 위 소개와 별개의 실험으로 세지 않는다.
  3. Hamsa Bastani 외, Generative AI without guardrails can harm learning: Evidence from high school mathematics, PNAS, 2025. 본문에 인용한 실험은 2023년 가을 시행됐으며 단일 학교·수학·단기 결과라는 한계가 있다.