AI가 대부분 알아서 한다면, 인간은 언제 개입해야 할까?

핵심 요약: AI가 더 많은 일을 스스로 처리하게 될수록 인간이 모든 단계에 개입하는 방식은 비효율적이 될 수 있습니다. 앞으로 중요한 것은 ‘항상 개입하는가’가 아니라 어떤 순간을 중요한 예외로 보고 사람이 들어와야 하는가를 판단하는 능력입니다.

이 글은 ‘AI 시대에 인간은 어떤 능력을 가져야 하는가?’라는 질문을 따라가며 진행 중인 휴먼 디렉팅 연구의 네 번째 기록입니다. 앞선 글에서는 인간의 역할이 세부 지시에서 위임으로, 다시 결과를 받아들이는 검증 기준으로 이동하는 흐름을 살펴봤습니다.

그렇다면 이제 다음 질문이 남습니다. 인간은 언제 개입해야 할까?

모든 단계에 사람이 들어가는 것이 안전할까?

항상 그렇지는 않습니다. AI가 수행하는 모든 행동을 사람이 하나씩 승인하면 통제권은 높아 보이지만, 실제로는 승인 피로가 생길 수 있습니다.

Anthropic은 Claude Code의 사용 데이터를 통해 사용자가 권한 요청의 약 93%를 승인했고, 승인 요청이 많아질수록 각 요청에 기울이는 주의가 떨어질 수 있다고 설명합니다. 이후 샌드박스와 자동 승인 구조를 도입하면서 권한 요청 수를 크게 줄였습니다.

OpenAI 역시 에이전트가 모든 단계에서 멈추도록 하기보다, 낮은 위험의 행동은 명확한 경계 안에서 자율적으로 수행하고 구매, 데이터 전송, 파괴적 변경처럼 영향이 큰 행동은 사용자 확인을 남기는 방식을 권장합니다.

이 흐름은 중요한 질문을 만듭니다. 인간의 역할은 ‘항상 승인하는 사람’이 아니라, 어디에서만 반드시 멈춰야 하는지를 정하는 사람으로 이동하는 것 아닐까요?

휴먼 디렉팅에서 ‘예외 판단’이 중요해지는 이유

휴먼 디렉팅 연구를 진행하면서 반복해서 등장한 요소 중 하나가 ‘중요한 차이와 예외를 감지하는 능력’이었습니다.

AI가 대부분의 일반적인 상황을 잘 처리하게 되면, 사람이 매번 평범한 결과를 다시 확인하는 것은 점점 의미가 줄어듭니다. 대신 드물지만 중요한 순간을 알아차리는 능력이 더 중요해질 수 있습니다.

  • 평소와 다른 조건이 들어온 경우
  • 결과가 맞아 보이지만 영향이 큰 경우
  • 실패했을 때 되돌리기 어려운 행동
  • 기존 규칙으로 판단하기 어려운 새로운 상황
  • AI가 확신하고 있지만 사람이 보기엔 뭔가 이상한 경우

이런 상황에서는 AI가 평균적으로 얼마나 잘하는가보다, 이 한 번의 예외가 얼마나 중요한가가 더 중요합니다.

실제 업무에서는 모든 확인이 같은 가치가 없었습니다

실제 업무 시스템을 설계하면서도 비슷한 문제를 자주 만났습니다. 모든 단계마다 사람의 승인을 넣으면 안전해 보이지만, 승인 단계가 너무 많아지면 작업 흐름이 느려지고 결국 확인 자체가 형식적인 절차가 되기 쉽습니다.

반대로 모든 것을 자동화하면 문제가 생겼을 때 뒤늦게 발견하게 됩니다. 그래서 실제로 중요한 것은 승인 횟수를 늘리거나 줄이는 것이 아니라, 어떤 조건에서 자동 흐름을 멈추고 사람에게 다시 판단을 돌려줄 것인가를 설계하는 일이었습니다.

예를 들어 반복적이고 되돌리기 쉬운 작업은 AI에 더 맡길 수 있습니다. 하지만 외부 공개, 금전, 계약, 중요한 데이터 변경, 고객에게 직접 영향을 주는 행동처럼 결과의 영향이 큰 작업은 다른 기준이 필요합니다.

‘중요성’과 ‘예외’를 함께 봐야 합니다

여기서 휴먼 디렉팅의 또 다른 가설이 생깁니다.

AI가 일반적인 업무를 더 잘 처리할수록 인간의 역할은 모든 결과를 확인하는 데서, ‘중요한 차이’와 ‘예외 상황’을 골라내고 그때만 개입하는 쪽으로 이동할 수 있다.

이때 중요한 것은 단순한 오류 여부가 아닙니다. 같은 오류라도 영향이 작고 쉽게 복구할 수 있다면 자동으로 처리해도 될 수 있습니다. 반대로 확률이 낮은 오류라도 한 번 발생했을 때 피해가 크다면 사람의 개입이 필요할 수 있습니다.

즉, 인간의 판단은 점점 ‘틀렸는가?’에서 ‘중요한가?’로 이동하는 것일 수 있습니다.

언제 사람이 개입해야 할까?

현재까지의 연구와 실제 사용 경험을 기준으로 보면 다음과 같은 경우는 사람의 개입 후보가 될 수 있습니다.

  • 되돌리기 어려운 경우: 공개, 삭제, 결제, 계약처럼 실행 후 복구가 어렵다.
  • 영향이 큰 경우: 고객, 조직, 금전, 평판에 직접 영향을 준다.
  • 새로운 예외인 경우: 기존 규칙이나 데이터로 충분히 판단하기 어렵다.
  • 불확실성이 큰 경우: AI 스스로도 여러 가능성 사이에서 확신이 낮다.
  • 목표 충돌이 있는 경우: 속도, 비용, 품질, 안전 같은 기준이 서로 충돌한다.

반대로 영향이 작고 되돌리기 쉽고 반복적인 업무라면 사람의 개입을 줄이는 편이 오히려 더 나을 수 있습니다.

앞선 세 글과 연결하면

지금까지 휴먼 디렉팅 연구에서 인간 역할의 이동은 이렇게 보입니다.

  1. 지시: AI에게 무엇을 어떻게 시킬 것인가
  2. 위임: 무엇을 어디까지 맡길 것인가
  3. 검증 기준: 언제 결과를 충분하다고 인정할 것인가
  4. 예외 판단과 개입: 언제 자동 흐름을 멈추고 사람이 다시 들어갈 것인가

이 흐름이 맞다면 인간의 역할은 AI가 하는 모든 일을 따라가는 사람이 아니라, AI가 계속 일해도 되는 조건과 멈춰야 하는 조건을 설계하는 사람에 가까워지고 있습니다.

이 가설 역시 앞으로 약해질 수 있습니다

AI가 앞으로 예외 상황까지 더 잘 탐지하고, 위험도를 스스로 계산하고, 필요할 때 사람에게 자동으로 판단을 요청하게 된다면 인간이 직접 예외를 찾아내는 역할도 줄어들 수 있습니다.

그때는 다시 질문해야 합니다. 사람이 예외를 직접 발견하지 않아도 된다면, 인간은 무엇을 결정해야 할까요?

휴먼 디렉팅 연구는 특정 능력을 ‘인간만의 영역’으로 지키려는 시도가 아닙니다. AI가 발전할수록 인간 판단의 위치가 실제로 어디로 이동하는지 계속 추적하는 것이 목적입니다.

자주 묻는 질문

사람이 모든 AI 결과를 검토하면 가장 안전하지 않나요?

반드시 그렇지는 않습니다. 확인이 너무 많아지면 승인 피로가 생겨 중요한 순간의 주의가 오히려 떨어질 수 있습니다. 중요한 행동에 검토를 집중하는 구조가 더 효과적일 수 있습니다.

AI에게 완전히 맡겨도 되는 작업은 무엇인가요?

영향이 작고 되돌리기 쉽고 반복적인 작업부터 자동화하기 좋습니다. 반대로 외부 공개나 금전, 중요한 데이터 변경처럼 영향이 큰 작업은 별도의 개입 기준을 두는 편이 안전합니다.

휴먼 디렉팅에서 ‘예외 판단’이란 무엇인가요?

평범한 흐름에서 벗어난 중요한 상황을 식별하고, AI에게 계속 맡길지 사람이 다시 판단할지를 결정하는 능력입니다. 단순한 오류 탐지보다 결과의 영향과 중요성을 함께 봅니다.

참고한 자료

현재의 가설: AI가 일반적인 업무와 판단을 더 많이 맡을수록 인간의 역할은 모든 단계를 확인하는 데서, 영향이 크거나 예외적인 순간을 식별하고 그때만 개입하는 쪽으로 이동하고 있습니다.

답글 남기기