논문 제출 전 데이터를 확인하는 방법 (2026년 가이드)

논문을 제출하기 전에 수치에 대해 네 가지 점검을 수행하세요. 본문의 모든 표본 크기는 표와 일치해야 하며, 백분율 합계가 정확해야 합니다. 소수점 자릿수는 일관되어야 하고, 누락된 데이터는 설명되고 반영되어야 합니다. 이러한 오류는 검토자가 가장 찾기 쉽기 때문에 가장 먼저 발견하는 오류입니다.
검토자는 제한된 시간과 합리적인 휴리스틱(경험칙)을 가지고 검토에 임합니다. 표의 산술적 계산이 맞지 않는다면, 그 바탕이 되는 분석 역시 제대로 검증되지 않았을 가능성이 큽니다. 이러한 추론은 개별 사례에서는 억울할 수 있지만, 실제로 들어맞는 경우가 많아 검토 결과에 큰 영향을 미칩니다.
이 가이드에서는 왜 수치 오류가 검토자 의견의 대부분을 차지하는지, 그리고 논문을 제출하기 전에 어떤 점검을 수행해야 하는지 다룹니다. 마지막에는 모든 표를 일일이 직접 읽지 않고도 이러한 점검을 수행하는 방법을 소개합니다.
검토자가 이론이 아닌 수치를 먼저 잡아내는 이유
일치하지 않는 N 수치
연구는 120명의 참가자로 시작합니다. 불성실한 응답으로 8명이 제외되고, 주의력 검사(attention check) 미달로 3명이 더 탈락하며, 기술적 오류로 인해 특정 조건에서 2명이 제외됩니다. 방법론 섹션에는 120명이라고 적혀 있고, 실제 분석은 107명을 대상으로 수행되었는데, 어떤 표는 마지막 제외 단계 전에 작성되어 여전히 109명으로 표시되어 있습니다.
여기서 누구도 잘못한 것은 없습니다. 단지 수치가 네 번 바뀌었을 뿐이고, 원고는 그 과정의 서로 다른 시점을 기록하고 있을 뿐입니다. 하지만 방법론 섹션과 표를 비교하는 검토자의 눈에는 아무런 설명도 없는 모순으로 보입니다.
일관성 없는 반올림
통계 프로그램의 출력 결과는 많은 소수점 자릿수를 제공합니다. 서로 다른 시점에 여러 수치가 복사되면서, 어떤 것은 소수점 둘째 자리까지, 어떤 것은 셋째 자리까지 반올림됩니다. 반올림된 소계로 계산된 백분율은 100이 아니라 99.8이 되기도 합니다.
개별적으로 보면 사소한 문제입니다. 하지만 모이면 부주의함으로 비치며, 꼼꼼한 독자가 표를 훑어볼 때 정확히 눈에 띄는 부분입니다.
그림과 본문의 불일치
차트를 먼저 내보낸 후 분석을 보완하고 본문을 수정하는 경우가 있습니다. 이때 그림에는 이전 수치가 그대로 남게 됩니다. 이는 매우 흔히 발생하는 일이기 때문에, 경험 많은 검토자들은 일상적으로 그림과 본문 내용을 대조해 봅니다.
이 세 가지 오류의 원인은 동일합니다. 분석 자체에 문제가 있었던 것이 아니라, 계속 진행되는 과정 속에서 원고가 서로 다른 시점들을 기록했기 때문입니다. 이를 잡아내는 것은 통계적인 문제가 아니라 문서화(documentation)의 문제입니다.
이로 인해 치러야 할 대가
피할 수 있었던 수정 보완(Revision) 단계. 수치의 불일치 자체만으로 논문이 거절(Rejection)되는 경우는 드물지만, 수개월이 더 소요되는 메이저 리비전(Major Revision) 단계를 초래합니다.
엉뚱한 곳에 낭비되는 검토자의 주의력. 일치하지 않는 N 수치에 대한 지적은 곧 여러분의 논지에 쓰였어야 할 피드백을 빼앗는 결과를 낳습니다. 검토자가 한 논문에 쏟을 수 있는 에너지는 한정되어 있습니다.
출판 후 정정 고시. 가장 최악의 상황은 논문 제출 전 아무도 이를 발견하지 못하고 그대로 출판되는 것입니다. 출판 후 정정(Correction)은 영구적이고 공개적으로 기록되며, 이를 놓친 검토자가 아니라 저자 본인의 이름에 꼬리표처럼 따라다닙니다.
반드시 수행해야 할 점검 사항
옵션 1: 모든 표본 크기 일치시키기
방법론, 각 표, 각 그림 캡션, 초록 등 어디에나 등장하는 모든 N과 n을 목록화하세요. 그리고 각각의 수치가 어떤 필터링 단계를 거쳐 나왔는지 추적해 보십시오. 추적할 수 없는 수치는 오류이거나 문서화되지 않은 제외 대상입니다.
그런 다음 제외된 수치들의 합이 맞는지 확인하세요. 시작 표본에서 문서화된 각 제외 수치를 뺀 값이 분석된 표본 크기와 일치해야 합니다. 이 일련의 과정을 방법론 섹션에 명시하십시오. 검토자들은 설명이 된 제외 처리에 대해서는 거의 이의를 제기하지 않지만, 설명되지 않은 제외 처리에 대해서는 항상 문제를 제기합니다.
옵션 2: 모든 표의 산술 계산 확인하기
카테고리 내의 백분율 합계는 100이 되어야 하며, 반올림 관련 주석이 문서화되어 있어야 합니다. 하위 그룹의 수치 합계는 전체 그룹의 총합과 일치해야 합니다. 하위 그룹의 크기로 가중치를 부여한 평균값은 전체 평균과 일치해야 합니다.
이는 지루한 작업이며 대부분의 오류가 발생하는 지점입니다. 또한 검토자들이 직접 확인해 볼 가능성이 가장 높은 부분이기도 하므로, 이 단계를 건너뛰는 것은 무모한 도박입니다.
옵션 3: 누락된 데이터 및 이상치 감사하기
누락된 데이터의 양, 무작위 누락 여부, 그리고 이를 어떻게 처리했는지 명시하세요. 목록별 삭제(Listwise deletion), 대체법(Imputation), 쌍별 분석(Pairwise analysis)은 서로 다른 표본 크기를 생성하므로, N 수치 불일치 문제의 빈번한 원인이 됩니다.
제외된 극단값(이상치)에 대해서도 동일하게 처리하세요. 몇 개가 어떤 규칙에 의해 제거되었는지 명시하십시오. 이상치를 포함한 결과와 제외한 결과 모두를 보고하는 것도 고려해 보세요. 코드 없이 이상치 찾는 방법 가이드를 참고하시기 바랍니다. 이러한 비교를 거치고도 유지되는 결과는 더욱 강력하며, 그렇지 않은 결과라면 검토자가 발견하기 전에 여러분이 먼저 알아내야 합니다.
세 가지 방법 모두가 부딪히는 한계
각 점검은 기계적이며, 원고 전체를 한 번에 머릿속에 담고 있어야 합니다. 방법론의 수치와 표 3의 수치, 그리고 그림 캡션의 수치를 비교해야 합니다. 하지만 이 문서는 여러분이 이미 너무 많이 읽어서 더 이상 오류가 눈에 보이지 않는 상태일 것입니다.
이것이 진짜 어려운 점입니다. 점검 자체가 어렵다기보다는, 자신이 쓴 문서를 스스로 검토하는 것은 아무리 주의를 기울여도 한계가 있어 신뢰하기 어렵기 때문입니다.
Powerdrill Bloom으로 이러한 점검을 수행하는 방법
1단계: 데이터 업로드하기
분석 데이터 세트를 업로드합니다. Powerdrill Bloom은 업로드 즉시 모든 열을 프로파일링하므로, 누락된 값의 개수와 그룹 크기를 머릿속으로 기억할 필요 없이 팩트로 바로 확인할 수 있습니다.
2단계: 자연어로 점검 사항 설명하기
수치 일치 여부를 직접 물어보세요. 이러한 제외 기준을 적용한 후 그룹당 완전한 케이스는 몇 개인지, 카테고리 백분율 합계가 100이 되는지, 어떤 열에 누락된 값이 있는지 질문하십시오. 그런 다음 가장 중요한 비교, 즉 제외된 케이스가 있을 때와 없을 때 핵심 결과가 어떻게 달라지는지 물어보세요.
3단계: 차트, 보고서 또는 프레젠테이션 내보내기
원고와 대조해 볼 수 있도록 수치 및 누락값 요약 표를 내보내세요. 방법론 섹션에 기록할 제외 단계를 정리한 서면 노트도 동일한 요청을 통해 얻을 수 있습니다.
수작업 검토보다 이 방법이 더 나은 이유
| 수작업 점검 | Powerdrill Bloom | |
|---|---|---|
| 여러 섹션 간 N 수치 일치시키기 | 직접 읽고 수작업으로 비교 | 필터 단계별로 반환되는 수치 |
| 누락값 감사 | 열별로 일일이 검사 | 업로드 시 프로파일링 완료 |
| 제외 대상 포함 여부에 따른 결과 | 분석을 두 번 다시 실행 | 두 가지 결과 모두 요청 |
| 수정 보완(Revision) 후 | 전체 과정 다시 반복 | 새 파일에 대해 다시 요청 |
마지막 행은 실제로 점검이 이루어질지 여부를 결정하는 핵심입니다. 반나절이 걸리는 감사는 첫 제출 전에 딱 한 번 수행되고, 재제출 전에는 생략되기 마련입니다. 하지만 바로 그 시점이 수치가 방금 변경된 때입니다.
제출 전 체크리스트
모든 N 수치를 필터링 단계까지 추적하세요. 어떤 규칙에 의해 해당 수치가 도출되었는지 설명할 수 없다면, 출판하지 마십시오.
표의 총합을 다시 계산하세요. 백분율은 100이 되어야 하고, 하위 그룹의 합은 전체 그룹의 총합과 일치해야 하며, 표 자체에 반올림 주석이 명시되지 않은 예외는 없어야 합니다.
최종 분석 후 그림을 다시 생성하세요. 마지막 수정 전에 내보낸 차트를 절대 재사용하지 마십시오. 연구 논문용 차트 만드는 방법 가이드에서 형식 요구사항을 다루고 있습니다.
누락된 데이터 처리 방식을 명확히 명시하세요. 방법론 섹션에 처리 방법과 그에 따른 표본 크기를 적으십시오.
초록과 결과를 대조해 보세요. 초록은 가장 먼저 작성되고 가장 마지막에 업데이트되기 때문에, 원고에서 가장 오래된 수치를 담고 있는 경우가 많습니다. 또한 대부분의 독자가 가장 먼저 읽는 부분이므로, 초록의 오류는 유독 눈에 잘 띕니다.
다른 사람에게 표를 읽어달라고 부탁하세요. 데이터를 본 적 없는 동료는 여러분이 몇 주 동안 놓친 부분을 10분 만에 찾아낼 것입니다. 논지보다는 산술적 계산을 확인해 달라고 요청하십시오. 그것이 바로 여러분이 자신의 원고에서 직접 수행할 수 없는 점검이기 때문입니다.
결론
수정 보완 단계를 방지하는 점검들은 그리 거창하지 않습니다. 표본 크기를 일치시키고, 산술 계산을 검증하고, 누락된 데이터를 설명하고, 마지막에 그림을 다시 생성하는 것입니다. 이 중 통계적 정교함을 요구하는 것은 없으며, 마감일이 다가오면 모두 쉽게 건너뛰기 쉬운 것들입니다.
이러한 점검을 건너뛰는 이유는 반복하는 데 많은 비용(시간과 노력)이 들고, 분석이 바뀔 때마다 매번 반복해야 하기 때문입니다. 다음 논문을 제출하기 전에 데이터 세트에 Powerdrill Bloom을 사용해 보세요. 또한 AI data cleaning 페이지와 데이터 정제 및 중복 제거 가이드도 참고해 보시기 바랍니다.
자주 묻는 질문
검토자가 논문에서 가장 먼저 확인하는 것은 무엇인가요?
수치의 내부 일관성입니다. 방법론, 표, 초록 전반에 걸친 표본 크기, 백분율 합계의 정확성, 그림과 본문의 일치 여부 등을 확인합니다. 이러한 점검은 빠르게 수행할 수 있으며, 나머지 부분이 얼마나 신중하게 준비되었는지를 보여주는 신호가 됩니다.
논문을 제출하기 전에 무엇을 확인해야 하나요?
시작 표본, 각 제외 기준과 그 수치, 그리고 최종 분석된 표본을 명시하여 산술적 인과관계가 맞도록 하십시오. 설명된 제외 처리는 거의 의문이 제기되지 않지만, 설명되지 않은 표본 크기의 변화는 항상 의문을 자아냅니다.
이상치를 포함한 결과와 제외한 결과를 모두 보고해야 하나요?
결론이 소수의 극단값에 크게 좌우된다면 그렇습니다. 두 가지 버전을 모두 보고하는 것이 조용히 제외하는 것보다 더 설득력 있으며, 검토자가 여러분 대신 민감도(sensitivity) 문제를 발견하는 것을 방지할 수 있습니다.
왜 My 백분율 합계가 100이 되지 않나요?
대개 각 구성 요소를 독립적으로 반올림하기 때문입니다. 반올림으로 인해 백분율 합계가 100이 되지 않을 수 있다는 주석을 추가하거나, 합계가 100이 되도록 계산하십시오. 두 방법 모두 허용되지만, 아무런 언급도 하지 않는 것은 허용되지 않습니다.
누락된 데이터가 어느 정도여야 너무 많은 것인가요?
전 세계적으로 통용되는 기준은 없으며, 양보다는 패턴이 더 중요합니다. 무작위로 누락된 데이터는 체계적으로 누락된 데이터보다 더 용인하기 쉽습니다. 누락된 양, 패턴, 처리 방법을 명시하고 검토자가 판단하도록 하십시오.