데이터 분석 포트폴리오, 그래프 앞에 ‘한 행의 의미’부터 쓰세요
대시보드는 보기 좋은데 ‘평균 구매액’이 무엇을 뜻하는지 설명하기 어렵나요? 데이터 분석 포트폴리오에서는 그래프뿐 아니라, 어떤 자료를 어떤 단위로 계산했는지도 보여줘야 해요. 같은 숫자라도 집계 기준에 따라 답하는 질문이 달라집니다. 한 행이 주문인가요, 고객인가요? 아래는 설명을 위해 만든 가상 데이터이며 실제 거래가 아닙니다. 고객 A / 주문 1 / 10,000원 고객 A / 주문 2 / 20,000원 고객 B / 주문 3 / 30,000원 세 행이 각각 주문 한 건이라면 주문당 평균 금액은 60,000원 ÷ 3건 = 20,000원이에요. 반면 고객별 구매 합계를 먼저 구하면 A와 B가 각각 30,000원이고, 구매 고객 1명당 평균 합계는 60,000원 ÷ 2명 = 30,000원입니다. 둘 중 하나가 틀린 게 아니라 분모와 질문이 달라요. ‘평균 구매액’ 대신 ‘분석 기간 내 주문 1건당 평균 금액’처럼 지표 이름에 기준을 붙여보세요. 구매하지 않은 고객은 이 예시에 없으므로 전체 회원의 평균으로 해석할 수 없습니다. 그래프 옆에 붙이는 데이터 설명 틀 아래는 폴리오쉽의 편집 제안입니다. • 출처·버전: 어디서 받았고 어느 날짜의 자료인가? 원문 링크와 이용 조건은 무엇인가? • 범위: 어느 기간·지역·대상을 포함하며 빠진 대상은 누구인가? • 한 행의 의미: 주문 한 건, 주문 상품 한 개, 고객 한 명 중 무엇인가? • 지표 정의: 무엇을 합하거나 세었고 분모·단위는 무엇인가? • 처리 내역: 중복·취소·누락값을 어떻게 다뤘고 처리 전후 행 수는 얼마인가? Cornell의 데이터 README 지침도 변수 정의, 단위, 누락값 표기, 수집·처리 방법 등을 기록하도록 안내합니다. ‘중복 제거’와 ‘빈칸 채우기’에는 이유가 필요해요 위 예시에서 고객 A가 두 번 나온다고 한 행을 지우면 정상적인 두 주문 중 하나를 잃게 됩니다. 중복 판단은 고객 이름만이 아니라 데이터의 식별 기준과 한 행의 의미를 확인한 뒤 해야 해요. 누락값도 ‘구매액 0원’과 ‘금액을 알 수 없음’은 다릅니다. 빈칸을 0으로 바꿨다면 이유와 평균에 미칠 영향을 설명하고, 의미를 모르면 원자료 설명부터 확인하세요. 다시 계산할 사람을 위한 메모 원본 파일의 버전, 실제 실행한 코드·쿼리, 필터와 실행 순서를 남겨보세요. 파일을 갱신했다면 이전 결과와 달라진 이유를 추적할 수 있게 변경 내역도 적습니다. 결과를 확인하지 않은 코드는 실행 완료로 표시하지 마세요. 한 기간의 차이만으로 특정 캠페인이 매출 증가의 원인이라고 단정하지 않는 것도 중요합니다. 공개 범위는 별도로 확인해요 재현성을 설명하려고 고객별 원자료나 내부 데이터베이스 접속 정보를 공개할 필요는 없습니다. 이용 조건과 공개 권한을 확인하고, 합성 데이터를 썼다면 실제 데이터가 아니라는 점과 원래 분석에서 달라진 부분을 표시하세요. 오늘은 그래프 하나의 제목을 골라 ‘누구의 무엇을, 어떤 분모로 계산했는지’ 한 문장으로 적어보세요. 그 문장이 데이터의 한 행과 맞는지 대조하는 것부터 시작하면 됩니다. 폴리오쉽 에디터 · 공식 에디토리얼 AI의 도움으로 작성한 정보성 글이며, 개인의 실제 경험담이 아닙니다. 참고: Cornell Data Services · Data README https://data.research.cornell.edu/data-management/sharing/readme/
첫 댓글을 남겨 대화를 시작해보세요.