JAX Lab · 프로젝트 기록

// 프로젝트 기록 · 의약품 유통 CS · 2026.08–09

의약품 유통 CS 판단 규칙 체계화 및 상담 보조 에이전트 PoC

약국을 상대로 의약품을 유통하는 B2B 플랫폼의 고객상담(CS) 팀과 5주 동안 진행한 PoC 기록입니다. 가장 큰 문의 갈래인 「주문이 안 돼요」의 판단 순서를 규칙으로 정리했습니다. 그 위에 상담사가 한 화면에서 조회·판정·답변 초안까지 받는 상담 보조 에이전트를 올렸습니다.

AX PoC · 5주 JOSHUA & COMPANY 프로젝트 · FDE 박정근(JAX Lab)
20 / 20현장 비교 정답 (운영팀 채점)
약 5초문의 입력부터 답변 초안까지
52% → 85%기준 부합 답변 (과거 문의 328건 재채점)
12분 → 1분신규 상담사의 답변 채택 시간 (첫날 → 닷새째)

개요

항목내용
고객약국 대상 B2B 의약품 유통 플랫폼의 고객상담 팀
기간2026년 8월 18일 착수 – 9월 21일 마감 보고 (5주)
과제「주문이 안 돼요」 문의의 판단 규칙 체계화 및 상담 보조 에이전트 구축
원칙자동 발송 없음 — 에이전트는 초안을 내고, 보내는 결정은 상담사가 합니다

첫 미팅에서 고객사가 먼저 선을 그었습니다.

「고객이 뭔가를 찾아서 해야 된다고 하면, 작동되지 않을 거예요.」
「AI가 하는지 모르게.」— 고객사 참석자, 첫 미팅

그래서 목표를 챗봇이 아니라 상담사 옆에 앉는 도구로 잡았습니다.

현장에서 확인한 것

  1. 상담사의 시간은 판단보다 찾기·넘기기·기록에 쓰이고 있었습니다.문의 한 건에 화면 9종을 오갔고, 추가 확인이나 이관으로 넘어가는 비율이 64.6%였습니다(운영팀 자체 측정).
  2. 가장 많은 하위 유형이 매뉴얼에 없었습니다.수량 제한 문의가 그랬고, 매뉴얼에 없는 업무가 여섯 가지 더 나왔습니다.
  3. 틀린 답의 대부분은 판정이 아니라 고객 말을 해석하는 순서에서 나왔습니다.실사용 9건에서 이슈 31건을 모아 원인을 네 가지로 좁혔습니다.
  4. 암묵지는 현장의 한마디에서 나왔습니다.「담당자를 고르는 기준」 같은 것이 현장 발언에서 규칙·문구·기능으로 바뀐 사례가 열 번이었습니다.
  5. 느렸던 것은 답이 아니라 확신이었습니다.신규 상담사가 에이전트의 답을 받고도 보내기까지 첫날 12분이 걸렸습니다. 근거를 읽을 수 있게 되자 닷새째 1분 이내가 됐습니다.

구축 내용

흐름도. 고객 문의, 발화 해석, 규칙 판정, 답변 초안을 거쳐 마지막 상담사 채택 단계에서 사람이 확인 후 발송한다. 결과: 현장 비교 20건 전건 정답, 답변 초안까지 약 5초, 기준 부합 답변 52%에서 85%, 신규 상담사 채택 시간 12분에서 1분.
도식 — 판단은 규칙이 하고, 보내는 결정은 상담사가 합니다.
확인한 것그래서 만든 것
찾기·넘기기·기록상담사용 판단 보조 화면 — 조회와 판정을 한 화면에, 이관 기록이 남는 구조
매뉴얼 밖의 업무표준 룰북 — 판정 룰 18개 · 분기 75개 · 응답 코드 40개. 5주간 27판 개정
해석 순서의 오류「판단은 규칙이, 해석은 보조」 구조로 재설계
현장의 암묵지관리자 모드 — 운영팀이 배포 없이 문구·지식 카드를 직접 고침 (문구 편집 · 커스텀 문구 · 미등재 품목 추출 · 판단 내역 조회 · 대시보드)
확신의 부족판단 근거 풀이와 채택 기록 — 저연차도 근거를 읽고 판단할 수 있게

이 밖에 안내 문구집, 지식 카드 34장, 검증 케이스 32장, 반영 경로표(무엇을 어디서 누가 고치는지), 이용 가이드, API·DB 정의서와 소스, 클라우드 계정 이관까지 인계했습니다. 관리자 모드는 당초 범위에 없었지만, 현장에서 가장 필요한 것이라는 게 확인돼 인도물이 됐습니다.

성과

지표결과기준
현장 비교 정확도20건 중 20건 정답현장 측정, 운영팀 채점
기준 부합 답변52.4% → 84.5%, 내용 오답 0건과거 문의 328건 재채점
답변 초안 생성약 5초문의 입력부터 초안 표시까지

표본이 작은 PoC 수치입니다. 건수를 함께 적었습니다. 1차 범위는 해당 문의 갈래의 15.1%, 전체 상담의 3.9%였습니다(운영팀 구분).

추진 경과

주차내용
1주차상담 로그 2,970건과 녹화 98분 분석. 병목이 「찾기·이관·기록」임을 확인.
2주차상담 원문 12,439행 전수 재검, 판단 구조 확정.
3주차중간 점검, 실제 문의 테스트, 고객 말 해석 순서 재설계.
4주차검수 기준 다섯 가지 합의, 관리자 모드 추가, 완성본 인도.
5주차계정 이관, 현장 측정, 마감 보고.

이 기간 동안 배포는 91회, 현장 방문은 8회였습니다. 마감 보고 사흘 전, 고객사는 이번 결과와 함께 처음 제시했던 과제 전체를 어떻게 넓혀 갈지에 대한 제안을 서면으로 요청했습니다.

시사점

AI가 일한 두 층. 1층 AI로 만든다: 제조 문서 14종 대조와 판단 기준 73건 추출, CS 상담 로그 2,970건·녹화 98분·매뉴얼 201조항 분석. 2층 AI가 들어간다: 제조 판단 기준 질의 챗봇과 분석 리포트, CS 상담 보조 에이전트.
도식 — AI는 두 층에서 일했습니다. 문제 정의를 가능하게 한 1층이 먼저입니다.

하루 만에 상담 로그 2,970건을 다시 읽고, 녹화 98분을 260여 장의 화면으로 쪼개고, 매뉴얼 201조항을 추출했습니다. 이 첫 층, AI로 만드는 일이 없었다면 5주 안에 룰북은 나오지 않았습니다. 상담 화면 안의 에이전트는 그 위에 올라간 두 번째 층입니다.

좋은 CS 에이전트의 조건은 모델이 아니라 규칙이었습니다. 규칙은 매뉴얼이 아니라 현장에 있었습니다.

프로젝트 문의

상담 로그와 매뉴얼은 있는데 판단 기준이 사람마다 다르다면, 로그에서 먼저 시작합니다.

AX 진단 문의 →