데이터 분석은 코드를 작성하는 것부터 시작하지 않습니다.

먼저 무엇이 궁금한지 질문을 정하고,
그 질문에 답하기 위해 어떤 데이터가 필요한지 확인해야 합니다.

이번 학습에서는 AI를 활용해 막연한 질문을 분석 가능한 질문으로 바꾸고,
AI가 제안한 내용과 코드를 직접 검증하는 과정을 학습 합니다.

이번 학습에서 다룬 내용

이번 학습에서는 본격적으로 데이터를 분석하기 전에 알아야 할 기본적인 분석 관점과 AI 활용 방법을 정리했습니다.

  • 막연한 업무 질문을 분석 가능한 질문으로 구체화하기
  • 데이터 분석이 진행되는 전체 과정 이해하기
  • 데이터 분석에서 AI가 잘하는 일과 사람이 해야 하는 일 구분하기
  • AI가 작성한 코드와 해석을 직접 검증해야 하는 이유 알아보기
  • 실습에 사용할 가상 쇼핑몰 데이터의 구성과 연결 관계 이해하기
  • AI 활용 과정을 프롬프트 기록으로 남기는 방법 알아보기
  • 개인정보와 API Key를 안전하게 관리하는 기본 원칙 익히기

목차

  1. 데이터 분석은 질문에서 시작한다
  2. 데이터 분석의 전체 흐름
  3. 데이터 분석에서 AI가 도와주는 일
  4. 사람과 AI의 역할 구분하기
  5. AI가 대신할 수 없는 판단과 검증
  6. EDA와 머신러닝의 차이
  7. AI 활용 과정을 기록하는 방법
  8. 개인정보와 API Key 관리하기
  9. 데이터 분석 프로젝트 구조 알아보기

1. 데이터 분석은 질문에서 시작한다

데이터 분석을 시작한다고 하면 가장 먼저 Python이나 pandas로 코드를 작성해야 한다고 생각하기 쉽습니다.

  • Python(파이썬) = 컴퓨터에 원하는 작업을 시키기 위해 사용하는 언어
  • pandas(판다스) = 엑셀처럼 표로 된 데이터를 정리하고 계산하는 데 사용하는 도구

하지만 코드를 작성하기 전에 먼저 해야 할 일은 분석하려는 질문을 명확하게 정하는 것입니다.

질문이 구체적이지 않으면 어떤 데이터를 사용해야 하는지, 무엇을 계산해야 하는지 결정하기 어렵기 때문입니다.


막연한 질문은 바로 분석하기 어렵다

예를 들어 쇼핑몰 운영자가 다음과 같이 질문했다고 가정해 보겠습니다.

요즘 어떤 상품이 잘 팔리고 있을까?

사람이 듣기에는 자연스러운 질문이지만, 데이터로 분석하기에는 기준이 명확하지 않습니다.

여기서 ‘잘 팔린다’는 말은 여러 의미로 해석할 수 있습니다.

  • 판매 수량이 많은 상품
  • 주문 횟수가 많은 상품
  • 판매 금액이 큰 상품
  • 같은 고객이 반복해서 구매한 상품
  • 취소나 환불을 제외한 완료 주문이 많은 상품

어떤 기준을 선택하느냐에 따라 분석 결과가 달라질 수 있습니다.


분석할 수 있는 질문으로 바꾸기

막연했던 질문에 분석 대상과 기준을 추가하면 다음과 같이 바꿀 수 있습니다.

완료된 주문을 기준으로 상품별 판매 수량과 판매 금액을 계산했을 때, 각각 상위에 해당하는 상품은 무엇인가?

이렇게 질문을 구체적으로 바꾸면 분석에 필요한 데이터도 자연스럽게 찾을 수 있습니다.

  • 상품을 구분하는 product_id
  • 상품명을 확인하는 product_name
  • 판매 수량을 나타내는 quantity
  • 상품 가격을 나타내는 unit_price
  • 주문 상태를 확인하는 order_status

판매 금액은 기본적으로 다음과 같이 계산할 수 있습니다.

판매 금액 = 판매 수량 × 상품 단가

다만 실제 쇼핑몰에서는 할인, 배송비, 세금, 취소, 환불 등이 적용될 수 있습니다.

따라서 계산을 시작하기 전에 어떤 항목을 판매 금액에 포함할 것인지 먼저 정해야 합니다.


질문을 구체화할 때 확인할 기준

분석 질문을 만들 때는 다음 네 가지를 확인하면 좋습니다.

1. 대상

무엇을 분석할 것인지 정합니다.

예: 상품 판매 수량, 완료 주문 금액, 고객 구매 횟수

2. 기준

어떤 조건의 데이터를 사용할지 정합니다.

예: 전체 주문이 아닌 완료된 주문만 사용

3. 비교

결과를 무엇과 비교할지 정합니다.

예: 전월과 비교, 상품별 비교, 카테고리별 비교

4. 목적

분석 결과를 어디에 활용할지 정합니다.

예: 인기 상품 확인, 재고 관리, 마케팅 계획 수립


이번 학습에서 이해한 점

데이터 분석에서는 코드를 빠르게 작성하는 것보다 먼저 질문의 의미와 계산 기준을 명확하게 정하는 과정이 중요합니다.

같은 데이터를 사용하더라도 질문과 기준이 다르면 결과 역시 달라질 수 있습니다.

따라서 분석을 시작하기 전에는 다음 순서로 생각해야 합니다.

막연한 궁금증
→ 분석할 대상과 기준 정하기
→ 필요한 데이터 확인하기
→ 분석 가능한 질문으로 구체화하기


2. 데이터 분석의 전체 흐름

데이터 분석은 데이터를 불러와 바로 계산하는 작업이 아닙니다.

질문을 정하는 단계부터 결과를 해석하고 활용하는 단계까지 하나의 과정으로 이어집니다.

각 단계가 어떤 작업인지 간단히 살펴보겠습니다.


1. 문제 정의

가장 먼저 무엇을 알아보기 위한 분석인지 정합니다.

예를 들어 ‘매출이 감소한 것 같다’라는 막연한 생각을 다음과 같이 구체화할 수 있습니다.

최근 3개월의 완료 주문 금액은 이전 3개월과 비교해 얼마나 달라졌는가?

질문이 명확해야 필요한 데이터와 분석 방법을 결정할 수 있습니다.


2. 데이터 수집

질문에 답하기 위해 필요한 데이터를 모으는 단계입니다.

쇼핑몰을 분석한다면 고객 정보, 상품 목록, 주문 내역, 주문 상세 내역 등이 필요할 수 있습니다.

이때 많은 데이터를 무조건 모으기보다 분석 목적에 필요한 데이터를 선택하는 것이 중요합니다.


3. 데이터 구조 확인

수집한 데이터에 어떤 내용이 들어 있는지 살펴봅니다.

  • 어떤 항목으로 구성되어 있는가?
  • 데이터는 몇 개나 있는가?
  • 숫자와 날짜가 올바른 형식으로 저장되어 있는가?
  • 서로 연결할 수 있는 공통 항목이 있는가?

쉽게 말하면, 본격적인 분석 전에 가지고 있는 데이터의 내용과 상태를 점검하는 과정입니다.


4. 데이터 전처리

수집한 데이터는 바로 분석하기 어려운 상태일 수 있습니다.

  • 비어 있는 값
  • 같은 내용이 반복된 값
  • 잘못 입력된 날짜나 숫자
  • 서로 다르게 작성된 항목
  • 분석에 필요하지 않은 데이터

이러한 문제를 찾아 수정하거나 정리하는 작업을 데이터 전처리라고 합니다.

요리에 비유하면 재료를 씻고 손질하는 과정과 비슷합니다.


5. 탐색적 데이터 분석

정리된 데이터를 여러 기준으로 살펴보며 특징이나 변화를 찾습니다.

  • 어떤 상품이 많이 판매되었는가?
  • 월별 주문 금액은 어떻게 변했는가?
  • 취소된 주문은 얼마나 되는가?
  • 특정 시기에 주문이 증가하거나 감소했는가?

이 과정을 EDA(탐색적 데이터 분석)라고 합니다.

  • EDA = 데이터를 여러 방향으로 살펴보며 특징과 패턴을 찾아가는 과정

6. 데이터 시각화

숫자만으로 이해하기 어려운 결과를 그래프나 차트로 표현합니다.

예를 들어 월별 판매 금액을 선 그래프로 나타내면 언제 증가하고 감소했는지 쉽게 확인할 수 있습니다.

시각화는 결과를 보기 좋게 꾸미는 작업이 아니라 데이터의 변화와 차이를 더 쉽게 발견하고 전달하기 위한 방법입니다.


7. 결과 해석

계산 결과와 그래프가 무엇을 의미하는지 설명합니다.

예를 들어 특정 달의 주문 금액이 감소했다면 단순히 ‘매출이 감소했다’고 끝내는 것이 아니라 다음 내용을 함께 확인해야 합니다.

  • 주문 건수가 줄었는가?
  • 취소나 환불이 증가했는가?
  • 특정 상품의 판매량이 감소했는가?
  • 데이터가 누락된 것은 아닌가?

결과에 나타난 현상과 그 원인을 구분하고, 데이터로 확인할 수 있는 범위 안에서 해석하는 것이 중요합니다.


8. 보고서 작성과 활용

분석 과정과 결과를 다른 사람이 이해할 수 있도록 정리합니다.

보고서에는 보통 다음 내용이 포함됩니다.

  • 분석한 질문
  • 사용한 데이터와 기준
  • 주요 결과
  • 결과에 대한 해석
  • 분석의 한계
  • 추가로 확인할 내용

정리된 결과는 재고 관리, 상품 구성, 마케팅 계획 등 실제 의사결정에 활용할 수 있습니다.


AI를 사용해도 분석 과정은 생략되지 않는다

AI는 분석 질문이나 코드의 초안을 만들고, 오류를 설명하거나 보고서 구성을 제안하는 데 도움을 줄 수 있습니다.

하지만 AI가 답변을 빠르게 만들어준다고 해서 데이터 확인과 검증 과정까지 사라지는 것은 아닙니다.

분석 과정에서는 계속해서 다음 내용을 확인해야 합니다.

  • 현재 데이터로 질문에 답할 수 있는가?
  • 필요한 항목이 실제 데이터에 존재하는가?
  • 계산 기준이 처음 정한 기준과 일치하는가?
  • 코드가 오류 없이 실행된 것만으로 분석이 맞다고 볼 수 있는가?
  • 결과를 실제 데이터보다 과장해서 해석하지 않았는가?

AI는 분석 속도를 높여주는 도구이지만, 분석의 기준을 정하고 결과를 최종 판단하는 역할은 사람에게 있습니다.


3. 데이터 분석에서 AI가 도와주는 일

데이터 분석을 처음 시작하면 어떤 질문을 해야 하는지, 어떤 데이터를 확인해야 하는지부터 막막할 수 있습니다.

이때 ChatGPT와 같은 AI에게 현재 상황을 설명하면 분석 방향을 정하거나 작업 초안을 만드는 데 도움을 받을 수 있습니다.

  • LLM(대규모 언어 모델) = 많은 양의 글을 학습하여 사람의 질문을 이해하고 답변을 만들어내는 AI
  • Prompt(프롬프트) = AI에게 원하는 작업을 요청하기 위해 입력하는 질문이나 명령

AI에게 분석 방향 물어보기

온라인 쇼핑몰의 주문 데이터를 처음 받았다고 가정해 보겠습니다.

어떤 내용을 분석해야 할지 떠오르지 않는다면 AI에게 다음과 같이 요청할 수 있습니다.

온라인 쇼핑몰의 고객, 상품, 주문 데이터가 있습니다.
완료된 주문의 판매 금액과 고객의 구매 패턴을 분석하려고 합니다.

초보자가 먼저 확인하면 좋은 분석 질문을 제안해 주세요.
각 질문에 필요한 데이터도 함께 알려주세요.

AI는 다음과 같은 분석 질문을 제안할 수 있습니다.

  • 월별 완료 주문 금액은 어떻게 변했는가?
  • 가장 많이 판매된 상품은 무엇인가?
  • 상품 종류별 판매 금액은 어떻게 다른가?
  • 주문 취소 비율은 얼마나 되는가?
  • 고객별 구매 횟수와 구매 금액은 어떻게 다른가?

이처럼 AI는 막연한 생각을 분석할 수 있는 질문의 형태로 정리하는 데 도움을 줄 수 있습니다.


필요한 데이터 찾기

분석 질문은 정했지만 어떤 데이터가 필요한지 모를 수도 있습니다.

예를 들어 다음 질문을 분석한다고 생각해 보겠습니다.

가장 많이 판매된 상품은 무엇인가?

이 질문을 AI에게 보여주고 필요한 항목을 물어보면 다음과 같은 내용을 제안받을 수 있습니다.

  • 상품을 구분하는 상품번호
  • 상품명을 확인하기 위한 상품명
  • 판매된 개수를 확인하기 위한 수량
  • 완료 주문을 구분하기 위한 주문 상태

AI의 제안을 참고하면 데이터를 확인할 때 무엇을 먼저 찾아야 하는지 쉽게 정리할 수 있습니다.

다만 AI가 말한 항목이 실제 데이터에 존재하는지는 직접 확인해야 합니다.


코드 초안 만들기

분석에 필요한 데이터가 준비되면 AI에게 계산이나 정리를 위한 코드 초안을 요청할 수 있습니다.

예를 들어 다음과 같이 질문할 수 있습니다.

주문 데이터에서 완료된 주문만 선택한 뒤,
상품별 판매 수량을 계산하는 pandas 코드와
각 코드의 의미를 초보자도 이해할 수 있게 설명해 주세요.

AI는 조건에 맞는 데이터를 선택하고 상품별 수량을 계산하는 코드의 초안을 만들어 줄 수 있습니다.

코드를 요청할 때는 단순히 “분석 코드를 만들어 주세요”라고 말하기보다 다음 정보를 함께 알려주는 것이 좋습니다.

  • 분석하려는 목적
  • 실제 데이터의 항목 이름
  • 계산에 사용할 기준
  • 원하는 결과의 형태
  • 현재 사용 중인 프로그램이나 환경

질문에 포함된 정보가 구체적일수록 실제 데이터에 가까운 코드를 얻을 가능성이 높아집니다.


오류 이해하기

코드를 실행하는 도중 오류가 발생하면 AI에게 오류 메시지의 의미와 확인할 내용을 물어볼 수 있습니다.

다음 오류 메시지가 발생했습니다.
초보자가 이해할 수 있도록 원인을 설명하고,
먼저 확인할 항목을 순서대로 알려주세요.

오류 메시지: 여기에 실제 오류 메시지 입력

AI는 다음과 같은 원인 후보를 제시할 수 있습니다.

  • 파일 경로가 잘못된 경우
  • 데이터의 항목 이름이 다른 경우
  • 필요한 기능이 설치되지 않은 경우
  • 숫자와 문자가 서로 다른 형식으로 저장된 경우

오류 메시지를 지우거나 일부만 보여주기보다 전체 내용을 함께 전달하는 것이 원인을 파악하는 데 도움이 됩니다.

단, 오류 내용에 이름, 이메일, 비밀번호, API Key와 같은 정보가 포함되어 있다면 반드시 제거해야 합니다.


결과를 설명하는 문장 만들기

계산과 그래프를 완성했지만 결과를 글로 표현하기 어려울 때도 AI의 도움을 받을 수 있습니다.

예를 들어 분석 결과를 다음과 같이 전달할 수 있습니다.

1~3월 완료 주문 금액은 3,590,000원이고,
4~6월에 확인 가능한 완료 주문 금액은 1,720,000원입니다.

이 결과를 초보자도 이해할 수 있는 문장으로 정리해 주세요.
가격이 누락된 주문이 있다는 한계도 포함해 주세요.

AI는 제공한 수치를 바탕으로 보고서 문장이나 블로그 설명의 초안을 만들 수 있습니다.

하지만 AI가 작성한 문장이 실제 계산 결과와 일치하는지, 지나치게 확신하는 표현을 사용하지 않았는지는 직접 확인해야 합니다.


AI가 도와줄 수 있는 작업 정리

데이터 분석 과정에서 AI는 다음과 같은 작업을 도와줄 수 있습니다.

  • 막연한 궁금증을 분석 질문으로 정리하기
  • 질문에 필요한 데이터 항목 제안하기
  • 데이터 확인 및 정리 방법 제안하기
  • Python과 pandas 코드 초안 작성하기
  • 오류 메시지를 쉬운 표현으로 설명하기
  • 표와 그래프의 특징을 문장으로 정리하기
  • 보고서나 블로그 글의 구성 제안하기
  • 놓치기 쉬운 검증 항목 정리하기

AI의 답변은 완성된 분석이 아니다

AI는 빠르게 여러 아이디어와 초안을 제안할 수 있지만, 실제 데이터를 직접 확인하지 않은 상태에서 존재하지 않는 항목이나 잘못된 계산 방법을 제시할 수도 있습니다.

따라서 AI의 답변은 그대로 사용하는 정답이 아니라 직접 확인하고 수정해야 하는 초안으로 보는 것이 좋습니다.

사람의 질문과 기준 설정
→ AI의 초안 작성
→ 실제 데이터와 비교
→ 실행 및 결과 확인
→ 사람이 수정하고 최종 판단

AI는 데이터 분석을 대신해 주는 사람이 아니라, 분석가가 더 빠르게 생각하고 작업할 수 있도록 도와주는 보조 도구입니다.


4. 사람과 AI의 역할 구분하기

AI를 활용한다고 해서 데이터 분석의 모든 과정을 AI에게 맡길 수 있는 것은 아닙니다.

AI는 분석에 필요한 방법과 초안을 빠르게 제안할 수 있지만, 분석 기준을 정하고 결과가 올바른지 판단하는 일은 사람이 해야 합니다.


AI는 내비게이션과 비슷하다

AI의 역할은 자동차의 내비게이션에 비유할 수 있습니다.

내비게이션은 목적지까지 갈 수 있는 여러 경로를 빠르게 찾아줍니다. 하지만 어디로 갈지 목적지를 정하고, 제안된 길 중 어떤 길을 선택할지는 운전자가 결정합니다.

사람 = 분석의 목적지와 기준을 정하는 운전자
AI = 목적지까지 가는 방법을 제안하는 내비게이션

AI가 분석 방법을 제안했다고 해서 그 방법이 현재 상황에 항상 맞는 것은 아닙니다.

사람은 AI가 제안한 내용을 실제 정보와 비교하고, 사용할 수 있는 방법인지 확인해야 합니다.


판매 감소를 분석한다고 가정해 보기

어떤 회사에서 다음과 같은 질문을 했다고 가정해 보겠습니다.

최근 판매가 감소한 원인을 분석해 주세요.

AI는 이 질문을 보고 다음과 같은 방법을 제안할 수 있습니다.

  • 월별 판매 금액 비교하기
  • 상품별 판매 수량 확인하기
  • 주문 취소와 환불 비율 확인하기
  • 고객별 구매 횟수 비교하기
  • 이전 기간과 현재 기간 비교하기

분석을 시작할 수 있는 좋은 제안이지만, 아직 그대로 실행하기에는 기준이 부족합니다.

사람이 다음 내용을 추가로 결정해야 합니다.

  • ‘최근’은 정확히 어느 기간인가?
  • 판매를 수량과 금액 중 무엇으로 판단할 것인가?
  • 어떤 기간과 비교할 것인가?
  • 취소와 환불을 계산에 포함할 것인가?
  • 회사에서 사용하는 매출의 기준은 무엇인가?

AI는 여러 분석 방법을 제안할 수 있지만, 회사의 상황과 분석 목적까지 자동으로 정확하게 판단할 수는 없습니다.


분석 질문을 만들 때

AI가 도와줄 수 있는 일

막연한 업무 질문을 구체적인 분석 질문으로 바꾸고, 여러 질문 후보를 제안할 수 있습니다.

사람이 확인해야 하는 일

제안된 질문이 현재 목적과 맞는지, 가지고 있는 정보로 실제 분석할 수 있는지 판단해야 합니다.


코드를 작성할 때

AI가 도와줄 수 있는 일

데이터를 불러오거나 정리하고 계산하는 Python 및 pandas 코드의 초안을 작성할 수 있습니다.

사람이 확인해야 하는 일

AI가 사용한 항목 이름이 실제 데이터에 존재하는지, 계산 조건과 범위가 올바른지 확인해야 합니다.

코드가 오류 없이 실행되었다고 해서 분석 결과까지 정확하다는 의미는 아닙니다.


오류를 해결할 때

AI가 도와줄 수 있는 일

오류 메시지를 설명하고, 발생 가능한 원인과 해결 방법을 제안할 수 있습니다.

사람이 확인해야 하는 일

현재 사용 중인 파일, 프로그램, 설치 환경과 AI의 설명이 일치하는지 직접 확인해야 합니다.

같은 오류 메시지라도 작업 환경에 따라 원인이 달라질 수 있습니다.


결과를 해석할 때

AI가 도와줄 수 있는 일

계산 결과나 그래프를 설명하는 문장과 보고서의 초안을 만들 수 있습니다.

사람이 확인해야 하는 일

AI가 작성한 설명이 실제 수치와 일치하는지 확인하고, 데이터로 알 수 없는 원인을 사실처럼 표현하지 않았는지 검토해야 합니다.

예를 들어 판매가 감소했다는 결과만으로 고객이 상품을 싫어하게 되었다고 단정할 수는 없습니다.


보고서를 작성할 때

AI가 도와줄 수 있는 일

분석 목적, 결과, 해석, 한계 등 보고서의 전체 구성을 제안할 수 있습니다.

사람이 확인해야 하는 일

어떤 결과를 최종 보고서에 포함할지 결정하고, 분석의 한계와 결론을 최종 승인해야 합니다.


사람과 AI가 함께 작업하는 흐름

위에서 생성한 워크플로우 이미지는 이 소제목 바로 아래에 배치하면 됩니다.

사람이 질문 정의
→ AI가 초안 제안
→ 사람이 기준과 정보 확인
→ AI의 도움으로 수정
→ 사람이 결과 검증 및 최종 판단

AI가 만든 결과를 한 번에 완성된 답으로 사용하는 것이 아니라, 사람이 확인하고 수정하는 과정을 반복해야 합니다.


역할 구분 정리

AI는 데이터 분석을 빠르게 시작하고 다양한 방법을 생각할 수 있도록 도와주는 유용한 도구입니다.

하지만 다음과 같은 판단은 사람이 맡아야 합니다.

  • 분석의 목적과 범위 결정
  • 실제 정보와 데이터 확인
  • 계산 기준 선택
  • 결과의 정확성 검증
  • 지나친 해석이나 과장 제거
  • 최종 결론과 활용 방법 결정

AI는 분석의 초안을 빠르게 만들어주지만, 그 초안을 검증하고 최종 결과로 완성하는 것은 사람의 역할입니다.


5. AI가 대신할 수 없는 판단과 검증

AI는 자연스러운 문장으로 빠르게 답변하기 때문에, 그 내용이 모두 정확하다고 느껴질 수 있습니다.

하지만 AI는 실제 데이터와 업무 상황을 완전히 알고 답하는 것이 아닙니다. 학습한 내용을 바탕으로 가능성이 높은 답을 만들어 제안하는 방식이므로, 사실과 다른 내용을 말할 수도 있습니다.

  • 환각(Hallucination) = AI가 사실이 아닌 내용을 실제 정보처럼 자연스럽게 만들어내는 현상

따라서 AI의 답변은 바로 분석 결과로 사용하는 것이 아니라, 실제 정보와 비교하여 검증해야 하는 초안으로 봐야 합니다.


실제 데이터가 정확한지는 판단할 수 없다

AI는 사용자가 보여준 데이터만 확인할 수 있습니다.

원본 데이터에 중복된 주문이나 잘못된 금액이 있어도, 충분한 정보를 제공하지 않으면 이를 알아차리지 못할 수 있습니다.

예를 들어 같은 주문이 두 번 기록되어 있다면 판매 금액이 실제보다 크게 계산될 수 있습니다.

AI가 계산을 완료했더라도 다음 항목은 사람이 직접 확인해야 합니다.

  • 같은 내용이 반복되어 있지 않은가?
  • 비어 있는 값은 없는가?
  • 날짜와 금액이 올바르게 입력되어 있는가?
  • 일부 데이터가 빠진 것은 아닌가?

실제로 존재하는 항목인지 확인할 수 없다

AI는 분석에 필요할 것 같은 데이터 항목을 제안할 수 있습니다.

예를 들어 고객을 분석하기 위해 다음과 같은 항목을 사용하라고 말할 수 있습니다.

  • 고객 나이
  • 거주 지역
  • 직업
  • 구매 횟수

하지만 실제 데이터에 고객의 나이나 직업이 없다면 해당 분석은 진행할 수 없습니다.

AI의 제안
→ 실제 데이터 항목 확인
→ 사용할 수 있는 정보인지 판단
→ 분석 진행

AI가 자연스럽게 항목 이름을 제시하더라도 현재 데이터에 실제로 존재하는지는 별도로 확인해야 합니다.


업무에서 사용하는 기준을 스스로 정할 수 없다

같은 단어라도 회사나 상황에 따라 의미가 달라질 수 있습니다.

예를 들어 ‘매출’은 다음 중 어떤 금액을 뜻하는지 먼저 정해야 합니다.

  • 고객이 주문한 전체 금액
  • 완료된 주문의 금액
  • 취소와 환불을 제외한 금액
  • 할인과 배송비를 포함한 금액
  • 실제 정산이 완료된 금액

AI는 일반적인 계산 방법을 제안할 수 있지만, 해당 회사에서 어떤 기준을 사용하는지는 알 수 없습니다.

따라서 분석을 시작하기 전에 사람이 용어의 의미와 계산 범위를 명확하게 정해야 합니다.


코드가 실행된 것과 분석이 정확한 것은 다르다

AI가 작성한 코드가 오류 없이 실행되면 분석까지 성공한 것처럼 느껴질 수 있습니다.

하지만 코드는 잘못된 조건으로도 정상적으로 실행될 수 있습니다.

예를 들어 완료 주문만 계산해야 하는데 취소 주문까지 포함했다면 코드는 실행되더라도 결과는 잘못됩니다.

다음 두 가지는 서로 구분해야 합니다.

코드 실행 성공 = 컴퓨터가 명령을 처리했다는 의미
분석 성공 = 올바른 데이터와 기준으로 질문에 답했다는 의미

분석이 정확한지 확인하려면 코드뿐만 아니라 사용한 데이터와 계산 조건도 함께 검토해야 합니다.


결과의 원인을 마음대로 단정할 수 없다

판매 금액이 감소했다는 결과가 나왔다고 가정해 보겠습니다.

AI는 다음과 같은 설명을 만들 수도 있습니다.

고객의 관심이 줄어 판매가 감소했습니다.

하지만 판매 데이터만으로는 고객의 관심이 줄었다고 단정할 수 없습니다.

판매 감소에는 여러 원인이 있을 수 있습니다.

  • 상품 재고 부족
  • 광고 노출 감소
  • 가격 인상
  • 할인 행사 종료
  • 쇼핑몰 방문자 감소
  • 데이터 누락

현재 데이터에서 확인할 수 있는 것은 판매가 감소했다는 현상일 뿐, 원인을 확인하려면 추가 데이터가 필요합니다.

AI가 작성한 해석이 실제 데이터가 보여주는 범위를 넘어가지 않았는지 사람이 확인해야 합니다.


개인정보와 중요 정보를 대신 보호해 주지 않는다

AI에게 데이터를 전달할 때 이름, 이메일, 전화번호, 주소와 같은 개인정보가 포함될 수 있습니다.

또한 코드나 오류 메시지에 비밀번호와 API Key가 들어 있을 수도 있습니다.

AI가 이러한 정보를 항상 자동으로 찾아 안전하게 제거해 주는 것은 아닙니다.

따라서 데이터를 전달하기 전에 사람이 직접 민감한 정보가 포함되어 있는지 확인하고, 필요한 내용만 제공해야 합니다.


사람이 반드시 확인해야 할 항목

AI를 데이터 분석에 활용할 때는 다음 내용을 직접 확인해야 합니다.

  • 분석 질문이 실제 목적과 맞는가?
  • 사용한 데이터가 정확한가?
  • AI가 언급한 항목이 실제로 존재하는가?
  • 중복·누락·잘못된 값이 처리되었는가?
  • 계산 기준이 처음 정한 기준과 일치하는가?
  • 코드가 올바른 데이터를 사용하고 있는가?
  • 결과 해석이 실제 수치를 넘어가지 않는가?
  • 개인정보와 중요 정보가 포함되어 있지 않은가?

이번 학습에서 이해한 점

AI 시대에 중요한 능력은 단순히 AI에게 질문하거나 코드를 빠르게 만드는 능력만이 아닙니다.

AI가 제안한 결과를 실제 정보와 비교하고, 잘못된 부분을 찾아 수정하며, 사용할 수 있는 결과인지 판단하는 능력이 필요합니다.

자연스럽게 작성된 AI의 답변이 반드시 정확한 답변은 아닙니다.

AI는 분석을 빠르게 도와줄 수 있지만, 결과의 정확성과 최종 판단을 책임지는 역할은 사람에게 있습니다.


6. EDA와 머신러닝의 차이

EDA(탐색적 데이터 분석)는 이미 수집된 데이터를 여러 방향으로 살펴보며 특징과 변화를 찾는 과정입니다.

예를 들면 다음과 같습니다.

  • 월별 판매 금액은 어떻게 변했는가?
  • 가장 많이 판매된 상품은 무엇인가?
  • 주문 취소가 많이 발생한 시기는 언제인가?

반면 머신러닝은 기존 데이터에서 규칙을 학습해 아직 발생하지 않은 결과를 예측하는 데 사용합니다.

  • 회귀 = 판매 금액처럼 연속된 숫자 예측
  • 분류 = 주문 취소 여부처럼 정해진 종류 예측

다만 예측 결과의 점수가 높다고 해서 항상 좋은 모델은 아닙니다. 예측할 당시 알 수 없는 정보를 사용하지 않았는지, 평가 방법은 적절한지 함께 확인해야 합니다.

EDA는 이미 발생한 데이터를 이해하는 과정이고, 머신러닝은 기존 데이터를 바탕으로 새로운 결과를 예측하는 과정입니다.


7. AI 활용 과정 기록하기

AI를 데이터 분석에 사용했다면 단순히 ‘AI를 사용했다’고 적는 것보다 어떤 도움을 받았고 무엇을 직접 검증했는지 기록하는 것이 좋습니다.

이를 프롬프트 로그라고 합니다.

  • AI를 사용한 목적
  • AI에게 입력한 질문
  • AI가 제안한 내용
  • 실제 분석에 반영한 내용
  • 사람이 직접 확인하고 수정한 내용

예를 들어 AI가 여러 분석 방법을 제안했더라도, 실제 데이터에 적용할 수 있는 방법만 선택했다면 그 이유를 함께 기록합니다.

AI에게 질문
→ 답변 확인
→ 실제 반영 여부 결정
→ 결과 검증
→ 사람의 최종 판단

이러한 기록은 나중에 분석 과정을 다시 확인하거나 다른 사람에게 설명할 때 도움이 됩니다.


8. 개인정보와 API Key 안전하게 관리하기

실제 데이터를 AI에게 전달하거나 공개된 저장소에 올릴 때는 민감한 정보가 포함되어 있지 않은지 확인해야 합니다.

다음 정보는 승인 없이 외부에 공개하면 안 됩니다.

  • 이름, 이메일, 전화번호
  • 주소와 결제 정보
  • 고객을 구분할 수 있는 식별값
  • 회사 내부 자료
  • 비밀번호와 Access Token
  • API Key
  • API Key = 특정 프로그램이나 AI 서비스를 사용할 수 있도록 발급되는 비밀 인증 정보

API Key는 집 열쇠와 비슷합니다. 다른 사람에게 노출되면 내 계정이나 서비스를 허가 없이 사용할 수 있으므로 코드에 직접 작성하거나 공개된 GitHub에 올리면 안 됩니다.

AI에게 데이터를 보여줄 때도 원본 전체를 전달하기보다 분석에 필요한 구조와 일부 정보만 제공하는 것이 안전합니다.

필요한 정보만 최소한으로 제공하고, 개인정보와 인증 정보는 반드시 제거합니다.


학습 마무리

이번 학습을 통해 데이터 분석은 단순히 코드를 실행하는 작업이 아니라는 것을 알게 되었습니다.

분석은 다음과 같은 흐름으로 진행됩니다.

질문 구체화
→ 필요한 데이터 확인
→ 데이터 정리와 분석
→ 결과 검증
→ 해석과 활용

AI는 분석 질문, 코드, 오류 설명과 보고서의 초안을 빠르게 만드는 데 도움을 줄 수 있습니다.

하지만 AI가 만든 답변이 실제 데이터와 일치하는지 확인하고, 분석 기준을 정하며, 최종 결과를 판단하는 역할은 사람이 해야 합니다.

이번 학습에서 가장 중요하게 이해한 내용은 다음과 같습니다.

AI의 답변은 완성된 정답이 아니라, 사람이 확인하고 수정해야 하는 초안입니다.

/