← Back to Blog
AI · AX Article · 2026.10.11

AI가 부서의 경계를 넘을 때, 팀에 남겨야 할 일

P&G의 생성형 AI 협업 실험을 바탕으로 직무 간 관점을 넓히는 효과와 후보 선택의 한계를 구분하고, 팀에 남겨야 할 검토·판단·인계 절차를 제안한다.

ai-axorganizational-designcross-functional-collaborationhuman-ai-collaborationevaluation

기술과 시장을 나타내는 파란색과 호박색 재료가 공유 작업대에서 여러 시제품으로 이어지는 개념 이미지

GPT Image 2로 생성한 개념 일러스트레이션이다. 실제 기업의 사무실이나 연구 실험을 촬영한 이미지가 아니다.

기술 담당자와 사업 담당자가 신제품 제안을 함께 준비한다고 하자. 한쪽은 구현할 수 있는 기능부터 설명하고, 다른 쪽은 고객이 돈을 낼 이유부터 묻는다. AI에 두 관점을 넣어 달라고 요청하면, 기능과 시장을 고르게 다룬 문서가 금방 나온다. 이제 두 사람이 만날 이유가 줄어든 것일까. 아니면 회의에서 해야 할 일이 달라진 것일까.

이 질문을 실제 조직 안에서 시험한 연구가 있다. P&G의 제품 혁신 업무를 대상으로 한 「The Cybernetic Teammate」다. 연구진은 AI를 쓰는 개인이 AI 없이 일하는 두 사람 팀과 견줄 만한 품질의 제안을 만들었다고 보고했다. 다른 직무의 관점까지 담는 데에도 AI가 도움을 줬다.[1] 여기까지만 읽으면 동료를 AI로 바꾸면 된다는 결론으로 가기 쉽다.

그런데 같은 논문에는 다른 결과가 나란히 있다. AI의 이점은 주로 좋은 아이디어를 만들어 내는 단계에서 나타났고, 후보 중 가장 좋은 것을 고르는 능력이 함께 좋아진 것은 아니었다. 팀의 일을 생성과 선택으로 나눠 보면, AI 도입 뒤 어디에 사람의 시간을 남겨야 하는지가 달라진다.

P&G 실험이 비교한 것은 무엇인가

이 글은 2025년 작업논문보다 뒤에 나온 2026년 《Organization Science》 게재본을 기준으로 읽는다. 연구는 2024년 5월부터 7월 사이 P&G에서 진행됐다. 연구개발과 사업 부문 직원들이 하루짜리 온라인 제품 개발 워크숍에서 자기 사업부의 실제 과제를 다뤘다. 분석 대상은 무작위 배정된 참가자 791명이다. 초기에 널리 소개된 776명은 사후 설문까지 완전한 자료를 제공한 사람 수이며, 게재본은 이 차이를 주석에서 설명한다.[1][2]

설계는 개인과 팀, AI 사용과 미사용을 교차한 네 조건이었다. 팀은 연구개발 직원과 사업 부문 직원이 한 명씩 짝을 이뤘다. AI 사용 조건에는 도구 사용 교육이 제공됐고, 실험은 Microsoft Azure를 통한 GPT-4 기반 도구를 사용했다. 7월 워크숍에서는 GPT-4o를 썼다는 주석도 있다. 따라서 결과를 현재 모든 모델의 성능으로 읽거나, 준비 없이 계정만 나눠 준 조직의 효과로 옮길 수는 없다.[1, §3.2 및 주석 13]

참가자들은 실제 업무와 관련된 아이디어를 내고 제안으로 발전시켰다. 제출물의 품질은 어느 조건에서 누가 만들었는지 모르는 전문가들이 평가했다. AI 없는 개인, AI 없는 팀, AI를 쓰는 개인, AI를 쓰는 팀의 결과를 같은 평가 체계에서 비교한 것이다. 연구진은 AI를 쓰는 개인의 제안 품질이 AI 없는 팀과 비슷한 수준이라고 해석한다.[1, §4.2–5.1]

여기서 무엇을 성과로 측정했는지 놓치면 해석이 커진다. 평가한 것은 초기 제품 개발 제안의 품질이다. 같은 인원이 출시까지 모든 일을 해냈다는 뜻도, 팀의 인원을 줄여도 장기 성과가 유지된다는 뜻도 아니다. 연구 역시 하루짜리 원격 협업으로는 지속적인 조율, 반복 수정, 이미 관계가 형성된 팀의 복잡성을 충분히 담지 못했다고 명시한다.[1, §6]

그래도 이 실험은 조직 설계에 유용한 질문을 남긴다. 지금 다른 부서 사람을 부르는 이유가 모르는 관점을 얻기 위해서인지, 특정 조건을 확인하고 결정하기 위해서인지 구분해 볼 수 있다. AI가 앞의 일을 일부 도와준다면, 뒤의 일을 더 분명하게 드러낼 필요가 있다.

다른 부서의 관점이 문서에 들어오는 변화

AI 없이 혼자 일할 때 연구개발 직원은 기술 쪽으로, 사업 부문 직원은 시장 쪽으로 치우친 제안을 내는 경향이 있었다. AI를 사용한 개인들의 결과에서는 직무에 따른 차이가 줄었고, 기술과 시장 관점을 더 균형 있게 다루는 양상이 나타났다. 논문은 이를 직무 사이의 경계를 넘는 전문성 통합의 가능성으로 읽는다.[1, §5.2]

이 결과를 실무에 옮겨 생각하면, AI의 역할은 문장을 빨리 써 주는 것보다 넓다. 기술 담당자가 자신에게 익숙한 사양만 길게 늘어놓기 전에 고객의 사용 맥락을 검토하고, 사업 담당자가 판매 문구를 만들기 전에 구현상의 질문을 떠올리도록 도울 수 있다. 다른 부서의 어휘를 빌려 초안을 만들고, 무엇을 물어야 할지 준비하는 용도다. 이것은 실험 결과에서 도출한 적용 가능성이지, P&G가 전사적으로 채택했다고 확인된 운영 방식은 아니다.

다만 문서의 균형과 조직의 합의는 다른 상태다. 예컨대 AI가 기술적 가능성과 고객 가치를 모두 언급하더라도, 생산 일정이 실제로 가능한지, 조달 조건이 맞는지, 그 비용을 어느 부서가 부담할지는 남는다. 해당 조직의 최신 정보가 없거나 책임자의 확인을 거치지 않은 설명은 토론할 가설이다. 다른 부서의 관점을 잘 흉내 낸다고 그 부서의 결정권까지 생기지는 않는다.

그래서 AI에 다른 부서의 역할을 맡기는 요청도 조금 바꿀 수 있다. 곧바로 동의를 얻은 듯한 통합안을 만드는 대신, 상대 부서에 확인할 질문과 현재 자료로 답할 수 없는 조건을 먼저 적게 하는 것이다. 이렇게 만든 초안은 회의를 생략하기 위한 근거가 아니라, 회의에서 설명에 쓰던 시간을 판단으로 옮기는 준비물이 된다.

팀원의 역할 역시 자료 제공자로만 축소되지 않아야 한다. AI가 정리한 관점 중 실제 현장과 어긋나는 것을 짚고, 충돌하는 조건에서 무엇을 우선할지 결정하는 사람이 필요하다. 그 판단을 남기지 않으면, 다음 담당자는 매끄러운 문서만 보고 합의가 끝났다고 오해할 수 있다.

후보가 좋아져도 선택은 따로 살펴야 한다

게재본의 과정 분석은 이 문제를 더 구체적으로 보여 준다. 참가자들은 처음에 아이디어 다섯 개를 만들고, 그중 하나를 골라 상세한 제안으로 발전시켰다. 아이디어 수를 같게 두었기 때문에 단순히 더 많이 만들어서 좋은 결과를 얻는 효과와는 구분해 볼 수 있었다.[1, §5.4.1]

AI를 사용한 조건은 처음 만든 아이디어들의 평균 품질이 높았다. 그러나 자신이 만든 후보 가운데 평가상 가장 좋은 것을 선택하는 비율은 AI 없는 팀이 약 50%, AI 사용 조건은 약 37%로 보고됐다. 이 수치는 실제 제품의 시장 성공률이 아니라, 각자 만든 다섯 후보 안에서 최고 평가 아이디어를 고른 비율이다. AI 사용 조건의 최종 선택안은 절대적인 품질에서 더 좋았지만, 그 이점은 선택 정확도가 올라가서라기보다 출발하는 후보들의 품질이 높아진 데서 나왔다.[1, 그림 8]

이 관찰만으로 AI의 아첨이 원인이라거나, AI를 쓰면 사람의 판단력이 반드시 떨어진다고 단정할 수는 없다. 논문은 동조적인 피드백, 비판적 검토의 약화 등을 가능한 설명으로 논의한다. AI 사용 조건의 참가자가 실제 선택 단계에서도 AI를 사용했는지는 단정하지 않는다. 이 연구를 AI 단독 심사와 인간 단독 심사의 정면 비교로 소개해서도 안 된다.[1, §5.4.1]

실무에서 가져올 만한 교훈은 원인을 과장하지 않아도 분명하다. 초안이 좋아졌는지와 선택 과정이 좋아졌는지를 별도로 관찰해야 한다. 결과 하나만 평가하면 더 나은 후보를 버린 사실은 드러나지 않는다. 반대로 최선의 후보를 놓쳤다고 해서 AI가 만든 후보 전체의 가치가 없었다고 말할 수도 없다.

편안한 대화 경험도 따로 봐야 한다. 연구에서는 AI 사용 후 긍정적인 감정이 늘어나는 자기보고 결과가 나왔다. 그러나 연구진은 이것이 장기적인 팀 관계를 측정한 것은 아니라고 경계한다. 긴장이 줄었다는 사실이 항상 더 좋은 협업을 뜻하지도 않는다.[1, §5.3 및 §6] 중요한 반론을 어렵지 않게 지울 수 있는 환경이라면, 매끄러운 회의가 잘못된 안을 더 빨리 통과시키는 자리가 될 수 있다.

회의에서 지우지 말아야 할 검토

다음은 연구의 실험 절차를 복제한 것이 아니라, 그 결과를 조직 업무에 옮기기 위한 제안이다. 가상의 교육 서비스 팀이 새로운 기업 교육 과정을 기획한다고 하자. 교육 담당자는 학습 내용과 운영 난도를 알고, 사업 담당자는 고객의 구매 과정과 예산 조건을 안다. AI는 두 관점을 함께 고려한 과정 후보를 만드는 데 쓸 수 있다.

시작할 때 두 담당자가 각자 아는 제약을 먼저 적는다. 교육 담당자는 실습 환경과 강사의 준비 범위를, 사업 담당자는 고객이 요구한 결과와 계약상의 제한을 기록한다. 서로 다른 자료가 충돌하면 AI에게 적당히 절충하라고 맡기지 않는다. 어떤 제약을 누가 확인했는지 남기고, 확정되지 않은 조건은 미확인으로 표시한다. AI에는 공개하거나 처리하도록 허용된 자료만 제공한다.

후보가 나오면 생성 대화와 별개의 검토 시간을 둔다. AI가 어떤 안을 자신 있게 추천했는지 보기 전에, 담당자가 같은 기준으로 후보를 읽고 선택 이유를 적도록 한다. 학습 목표에 맞는지, 실제로 운영할 수 있는지, 고객이 요구한 결과를 확인할 수 있는지가 이 예시의 기준이다. 각 기준은 한꺼번에 합산할 점수뿐 아니라 탈락이나 보류의 이유가 될 수 있어야 한다.

검토 대상팀이 남길 기록다음 단계로 넘기지 않을 조건
다른 직무의 관점해당 관점을 확인한 담당자와 근거AI의 추정만 있고 담당자의 확인이 없음
후보 선택선택안과 버린 안의 차이, 핵심 반론추천 이유를 설명하지 못하거나 중요한 제약을 위반함
실행 가능성준비 범위, 담당 역할, 확인할 자료비용·일정·책임의 미확인 사항을 확정 사실로 적음
최종 인계채택 이유와 남은 조건, 변경 책임자문서만 완성됐고 실행 담당자가 결과를 인수하지 않음

이 과정에서 반드시 의견을 하나로 매끈하게 합칠 필요는 없다. 사업 담당자가 수요를 낙관하고 교육 담당자가 실습 난도를 우려한다면, 두 의견을 함께 남겨야 한다. AI의 역할은 반론을 없애는 편집자가 아니라, 같은 조건을 놓고 검토할 수 있도록 자료를 정리하는 보조자가 된다. 마지막에 무엇을 채택할지는 그 결과를 실행하고 책임지는 사람이 결정한다.

작은 시험에서도 최종 문서만 보관하지 않는 편이 좋다. 처음 나온 후보, 사람이 고른 안, 검토 후 바뀐 안을 함께 남기면 문제가 생성 단계에 있었는지 선택 단계에 있었는지 구분할 수 있다. 이 기록을 같은 유형의 기존 업무와 비교해 보면, 회의가 짧아졌지만 후속 수정은 늘었는지, 반대로 초안 설명이 줄고 실질적인 검토가 늘었는지 살펴볼 수 있다. 여기에 필요한 검토 시간도 업무 비용으로 계산해야 한다.

P&G 연구는 초기 제안 작성에서 AI가 동료의 일부 기능을 수행할 수 있다는 근거를 준다. 그렇다고 동료의 모든 기능을 같은 것으로 묶을 이유는 없다. 다른 관점을 떠올리는 일, 후보를 가려내는 일, 실행 조건을 확인하는 일은 서로 다르다. AI 도입 뒤 회의에서 가장 먼저 바꿀 질문은 “누가 더 빨리 썼는가”보다 구체적이어야 한다. 이 안에서 아직 누구의 판단이 빠져 있는가.


참고 자료와 해석 범위

[1] Fabrizio Dell’Acqua 외, The Cybernetic Teammate: A Field Experiment on Generative AI and Teamwork, 《Organization Science》 37(4), 1217–1242, 2026. 온라인 공개 2026-06-12. 실험 설계는 §3, 평가 방법은 §4.2, 직무 경계는 §5.2, 생성·선택 분해는 §5.4.1, 일반화의 한계는 §6을 참고했다. 연구비 지원과 P&G 관련 이해관계 공개는 논문 말미의 감사문에서 확인할 수 있다.

[2] 같은 연구의 NBER Working Paper 33641, 2025년 4월. 초기 판본과 게재본의 표본 표기를 구분하기 위해 함께 확인했다. 두 문헌은 독립된 재현 연구가 아니다.

이 글의 교육 서비스 팀과 검토표는 저자의 적용 예시다. 해당 조직의 실제 도입 성과나 P&G의 공식 운영 지침을 뜻하지 않는다. 특정 시점의 한 기업, 초기 제품 개발 과제, 하루짜리 원격 협업에서 얻은 결과를 모든 조직과 장기 협업에 일반화하지 않았다.