• 기술

AI 지원 조종사들이 능력 문제가 아니라 신뢰 문제로 주춤하는 이유

  • Felix Rose-Collins
  • 3 min read

소개

고객 지원을 위해 AI를 테스트하는 대부분의 기업은 똑같은 벽에 부딪힙니다. 시스템은 몇 주 동안은 잘 작동합니다. 그러다 어느 날 한 고객에게 확신에 찬, 그러나 완전히 틀린 답변을 내놓습니다. 환불 기한에 관한 것일 수도 있고, 지난 분기에 변경된 정책에 관한 것일 수도 있습니다. 고위 관리자가 이를 눈치채면, 대기열의 대부분을 처리할 예정이었던 시스템 도입은 그 일부에 그친 채 조용히 중단됩니다.

업계 데이터는 이러한 패턴이 얼마나 흔한지를 뒷받침합니다. OpenText, Capgemini, Sogeti가 공동으로 발표한 ‘2025 세계 품질 보고서(2025 World Quality Report)’에 따르면, 조사 대상 조직의 60%가 AI 도입의 가장 큰 장벽으로 신뢰성과 ‘환각 현상’에 대한 우려를 꼽았습니다. Gong의 별도 연구에 따르면, 기업의 58%가 AI 프로젝트를 중단한 상태였으며, 계획된 AI 투자 중 거의 절반이 예산 문제보다는 신뢰 문제로 인해 보류된 것으로 나타났습니다. 도구 자체는 충분히 능력이 있습니다. 뒤처지는 것은 바로 그 도구에 대한 신뢰입니다.

한 번의 잘못된 답변 뒤에 숨은 수학적 원리

지원 업무는 평균 정확도를 평가 지표로 삼을 경우 오히려 불리하게 작용하는 비대칭적인 특성을 지닙니다. 정답은 몇 분을 절약해 주지만, 오답은 절대 지급되어서는 안 될 환불을 승인하거나, 존재하지도 않는 정책을 만들어내거나, 누구도 승인하지 않은 약속을 하게 만들 수 있습니다. 단 한 번의 실수로 인한 부정적 영향이 백 번의 정답으로 얻는 이득을 상쇄한다면, 평균 사례를 최적화하는 것은 완전히 잘못된 목표입니다.

더 은밀한 비용도 있습니다. AI의 오류를 한 번이라도 포착한 지원 팀장은 그 이후 모든 내용을 재확인하기 시작하며, 이로 인해 AI가 절약해 주어야 할 시간의 대부분이 사라집니다. 신뢰는 대화마다 점수로 매겨지는 것이 아닙니다. 신뢰는 쌓이거나 무너질 뿐이며, 일단 무너지면 팀은 시스템이 대부분의 경우 정답을 내놓더라도 더 이상 신뢰하지 않게 됩니다.

환각은 사라지지 않는다, 관리될 뿐이다

가장 강력한 언어 모델조차 적절한 조건에서는 허구를 만들어내며, 실제 수치는 대부분의 사람들이 생각하는 것보다 더 높습니다. 자체 도움말 문서를 바탕으로 답변하는 작업과 본질적으로 동일한 ‘근거 기반 요약(grounded summarization)’에서, Vectara의 환각 발생률 순위표에 따르면 최고의 모델은 약 3% 수준이며, 잘 알려진 주력 모델들은 6%에서 15% 사이에 몰려 있습니다. 일부 추론 집약적인 모델들은 동일한 과제에서 20%를 넘어서는 경우도 있는데, 이는 더 심층적인 추론이 원본 텍스트에 전혀 없는 주장을 도입할 여지를 더 많이 제공하기 때문입니다. 모델을 근거로 삼을 수 있는 자료가 전혀 없는 개방형 질문에 적용하면 수치는 훨씬 더 나빠집니다. 스탠포드 연구진은 원본 문서가 제공되지 않았을 때, 주요 모델들이 특정 법률 질문의 대다수에서 환각을 일으키는 것을 발견했습니다.

이 모든 것이 특정 모델이 나쁘다는 뜻은 아닙니다. 이는 어떤 단일 모델도, 단독으로 사용될 경우 이를 감독하는 장치 없이는 유료 고객에게 제시하기에 충분히 신뢰할 수 없다는 것을 의미합니다.

지능과 통제는 서로 반대 방향으로 작용한다

단일 모델이 이 문제를 스스로 해결할 수 없는 데에는 구조적인 이유가 있습니다. 시스템이 모호하거나 생소한 사례를 처리하는 능력이 향상될수록, 그 시스템을 완전히 예측하기는 더 어려워집니다. 아무도 시나리오로 작성하지 않은 사례를 처리할 수 있게 해주는 바로 그 추론이, 때로는 시스템이 가서는 안 될 곳으로 이끌기도 하기 때문입니다. 능력이 더 뛰어난 모델이 자동으로 더 안전한 모델은 아닙니다. 이러한 상충 관계 때문에 신뢰성은 모델 자체에서 기대하기보다는 모델 주위에 하나의 계층으로 설계되어야 합니다.

Aissist는 단일 기법이 아닌 네 가지 계층적 기법을 통해 이 문제를 해결합니다. 프롬프트 엔지니어링은 모든 작업이 따르는 기본 규칙을 설정하는데, 이는 단일 고객 요청이 동일한 안전 장치를 준수해야 하는 12개 이상의 하위 작업으로 확장될 수 있는 에이전트 기반 시스템에서 더욱 중요합니다. 부스터 단계는 불확실한 결정을 여러 번 실행하고, 추가적인 연산 비용을 감수하면서 대다수의 에이전트가 동의하는 답변을 채택합니다. 자체 검사 단계에서는 어떤 결과도 고객에게 전달되기 전에 시스템이 자체 출력을 검토하거나, 다른 역할을 맡은 두 번째 모델에 이를 전달합니다. 그리고 이 모든 것 위에 중첩된 거버넌스 계층이 위치하여, 출력이나 행동이 외부로 전달되기 전에 정책에 부합하는지 확인하며, 필터라기보다는 전체 시스템을 감독하는 관리자 역할을 수행합니다.

이러한 조합을 통해 플랫폼은 AI 오류율을 1% 미만으로 유지하고 있는데, 이 수치가 주목할 만한 이유는 이 분야의 벤더 중 이를 공개하는 곳이 극히 드물기 때문이다.

답변하지 말아야 할 때 판단하기

지원 담당자에게 있어 가장 가치 있는 행동은 더 많은 질문에 정확하게 답변하는 것이 아닙니다. 혼자서 답변해서는 안 될 질문을 식별하는 것입니다. 까다로운 청구 분쟁을 초기 단계에서 전체 맥락을 첨부하여 상급자에게 에스컬레이션하는 시스템은, 무턱대고 추측하며 진행하는 시스템보다 훨씬 적은 피해를 입힙니다. 또한 이는 해결 방법을 설명하는 담당자와, 실제로 주문을 조회하고 변경을 적용한 뒤 고객에게 확인까지 해주는 담당자를 구분 짓는 요소이기도 합니다.

신뢰성은 단순히 구축하는 것이 아니라 지속적으로 유지되어야 한다

출시 당일에 정확했던 시스템도 이를 감시하는 장치가 없다면 그 정확성을 유지할 수 없습니다. 제품은 변하고, 정책은 업데이트되며, 고객이 묻는 질문도 이에 따라 변화합니다. 지속적인 측정은 이러한 변화를 불만의 물결이 아닌 데이터로 포착하며, 체계적인 평가, 테스트, 배포 주기를 통해 발견된 격차를 지속적으로 메워나갑니다. 물론 실제 변경이 적용되기 전에는 여전히 사람이 최종 승인을 해야 합니다.

공급업체를 신뢰하기 전에 실제로 확인해야 할 사항

자사의 AI가 절대 실수하지 않는다고 주장하는 공급업체는 의심스럽게 여겨야 합니다. 대개는 그 사실을 확인할 만큼 면밀히 측정하는 사람이 없다는 뜻이기 때문입니다. 진지하게 고려할 만한 업체는 오류율을 공개하고, 고객이 오류를 발견하기 전에 어떻게 정확히 포착하는지 설명하며, 시스템이 추측 대신 사람에게 업무를 인계하는 시점을 솔직하게 밝힙니다. 이는 “AI를 믿으세요”라는 말과는 완전히 다른 접근 방식이며, 실제 티켓 처리량이 쏟아졌을 때 실제로 통하는 방식입니다.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

랭크트래커 사용 시작하기... 무료로!

웹사이트의 순위를 떨어뜨리는 요인이 무엇인지 알아보세요.

무료 계정 만들기

또는 자격 증명을 사용하여 로그인

Different views of Ranktracker app