WEBBOOK CHAPTER

AI 활용 바이블: 20장. 데이터 분석은 질문과 데이터의 단위를 먼저 맞춘다

20장. 데이터 분석은 질문과 데이터의 단위를 먼저 맞춘다

“매출이 왜 줄었지?”는 분석 질문이 아니다. 기간, 비교 기준, 채널, 제품, 환불, 통화, 데이터 지연이 빠져 있다. AI는 질문을 구체화하고 탐색 SQL을 제안할 수 있지만 데이터 의미를 조직 대신 결정하지 못한다.

분석 계약 예:


question: 7월 순매출이 6월 대비 감소한 원인 후보
grain: 주문 항목 1행
timezone: Asia/Seoul
currency: KRW
net_revenue: 결제 - 환불 - 할인, 부가세 포함
exclude: 테스트 계정
checks: 원천 총계 대사, 중복 주문, 지연 환불

AI가 작성한 쿼리는 읽기 전용 환경에서 실행한다. 첫 실행에는 날짜 범위와 row limit을 둔다. 예상 행 수를 기록한다. 집계 결과에서 표본 원시 행으로 돌아가 확인한다.

차트는 축, 단위, 0 기준 여부, 표본 수, 출처를 표시한다. 이중 축과 잘린 축으로 차이를 과장하지 않는다. 상관관계를 원인이라고 쓰지 않는다. “캠페인 이후 증가”와 “캠페인 때문에 증가”는 다르다.

개인정보가 필요하지 않은 분석에는 비식별 집계를 사용한다. 모델에 원시 고객 데이터를 넣기 전에 공급자 데이터 정책과 조직 승인을 확인한다. 분석 결과에도 소수 집단이 재식별될 정보를 노출하지 않는다.

SQL 검토 영수증


query_id: revenue-drop-v3
environment: read-only replica
date_range: 2026-06-01..2026-07-31 KST
expected_grain: order_item
row_limit_on_first_run: 1000
checks: source total, duplicate order_id, refund lag, test accounts
reviewer: data owner

AI가 여러 쿼리를 실행하는 에이전트라면 허용 테이블과 최대 스캔량, timeout을 제한한다. SELECT *와 무제한 기간을 거절한다. 결과가 비어 있을 때 0으로 해석하지 말고 필터, 권한, 데이터 지연을 확인한다. 데이터가 없는 것과 값이 0인 것은 다르다.