저희 플랫폼에서 글로벌 데이터베이스를 구매하거나 다운로드하시면 대부분의 데이터 세트가 .XLSX, .CSV, .TXT의 세 가지 범용 파일 형식으로 제공됩니다. 데이터를 단순히 보거나 검색하거나 수동으로 편집하는 등의 대부분의 작업에는 .XLSX 파일을 사용하는 것을 적극 권장합니다.
하지만 프로젝트 요구 사항에 따라 다른 파일 형식을 사용해야 할 수도 있습니다. 워크플로에 가장 적합한 형식을 선택하는 데 도움이 되도록 각 파일의 작동 방식, 여는 방법, 그리고 흔히 발생하는 서식 오류를 피하는 방법에 대한 간단한 설명을 아래에 제시합니다.
XLSX (Microsoft Excel 스프레드시트)
이 제품을 훌륭하게 만드는 요소:
사용자 친화적 : 이는 수동으로 보기 위한 가장 직관적인 형식입니다. 모든 정보가 깔끔한 시각적 격자 형태로 바로 표시됩니다.
풍부한 서식 지원 : 글꼴 스타일, 열 색상 및 내장 텍스트 필터링과 같은 유용한 스프레드시트 기능을 지원합니다.
고급 도구 : 스프레드시트 내에서 수학 공식을 실행하거나, 데이터 피벗 테이블을 만들거나, 차트를 직접 작성할 수 있습니다.
여는 방법:
Microsoft Excel 또는 WPS Office를 사용하여 바탕 화면에서 바로 열어보세요.
구글 시트를 사용하여 온라인으로 업로드하고 편집하세요.
개발자라면 특수 라이브러리를 사용하여 프로그래밍 방식으로 읽고 처리할 수도 있습니다.
최적의 사용 용도:
이 형식은 우편번호 행을 수동으로 검사하거나, 특정 지역을 조회하거나, 내부 보고서를 작성하거나, 코드 한 줄도 건드리지 않고 주소 데이터를 무작위로 확인해야 할 때 이상적입니다.
CSV(쉼표로 구분된 값)
이 제품을 훌륭하게 만드는 요소:
간단한 구조 : CSV 파일은 일반 텍스트 파일입니다. 각 행은 하나의 레코드를 나타내며, 도시 이름과 우편번호와 같은 다양한 정보는 쉼표로 구분됩니다.
뛰어난 범용성 : 전 세계 거의 모든 데이터베이스 관리자, 데이터 분석 도구 또는 프로그래밍 언어가 CSV 파일을 완벽하게 읽을 수 있습니다.
경량성 : 모든 시각적 스타일을 제거하기 때문에 파일 크기가 매우 작습니다. 따라서 수십만 개의 행으로 구성된 대규모 데이터 세트를 처리하는 데 적합합니다.
여는 방법:
메모장과 같은 일반 텍스트 편집기로 즉시 열 수 있습니다.
필터링을 위해 Microsoft Excel이나 Google Sheets와 같은 스프레드시트 프로그램에 입력하세요.
관계형 데이터베이스 플랫폼으로 직접 가져올 수 있습니다.
최적의 사용 용도:
CSV 파일은 데이터 교환을 위한 업계 표준 형식입니다. 당사 파일에서 대량의 데이터를 추출하여 자체 데이터베이스 또는 온라인 애플리케이션 백엔드에 입력해야 하는 경우 CSV가 가장 빠른 옵션입니다. 또한 R이나 Python과 같은 데이터 분석 도구에 데이터를 불러오는 데에도 적합합니다.
TXT(일반 텍스트)
이 제품을 훌륭하게 만드는 요소:
최대한의 자유 : CSV 파일처럼 TXT 파일은 스타일이 적용되지 않은 원본 텍스트입니다. 하지만 엄격한 쉼표 구분 기호를 사용하지 않으므로 사용자 지정 간격이나 구분 기호를 사용할 수 있습니다.
데이터 손상 없음 : 일반 텍스트 파일은 독점 파일 손상이나 소프트웨어 버전 문제로 인해 접근이 차단되는 일이 없습니다. 모든 장치에서 완벽하게 읽을 수 있습니다.
여는 방법:
시스템에 설치된 메모장, TextEdit 또는 Visual Studio Code와 같은 텍스트 편집기나 코드 편집기를 사용하십시오.
최적의 사용 용도:
TXT 파일은 사용자 지정 스크립트(예: Python 구문 분석 도구)에 대한 훌륭한 대체 계층 역할을 합니다. 또한 엄격한 데이터베이스 열 형식이 필수적이지 않은 경우 간단한 텍스트 구성, 시스템 로그 또는 깔끔하고 사람이 읽기 쉬운 참조 데이터를 저장하는 데에도 이상적입니다.
중요 설정 경고: 인코딩 및 텍스트 유형에 주의하세요
플랫 파일은 호환성이 매우 높지만, 소프트웨어 설정이 잘못되면 대규모 국제 데이터 세트를 열 때 간혹 시각적 오류가 발생할 수 있습니다. 다음 두 가지 규칙을 기억하세요.
1. 언어 인코딩 함정 (혼란스러운 기호 수정)
Because we provide data for over 100 different nations, our files use UTF-8 text encoding to preserve international characters, foreign language text, and local regional accents. If you open a file and see unreadable, corrupted text symbols, the data is not broken. Your spreadsheet software is simply trying to read it using an old default local region setting (like ANSI). To fix this, always choose UTF-8 in your program's file import wizard. For highly specific regional languages, make sure to cross-reference the text guidelines included in your product documentation.
2. 0이 빠진 함정 (우편번호 오류 수정)
Microsoft Excel과 같은 프로그램은 기본적으로 데이터 형식을 추측하려고 합니다. 열에 숫자만 포함되어 있으면 Excel은 해당 열을 "텍스트"가 아닌 "숫자"로 처리합니다. 이로 인해 우편번호를 처리할 때 심각한 문제가 발생합니다. 예를 들어 우편번호가 0100인 경우 Excel의 기본 계산 방식은 앞의 0을 제거하고 100으로 잘못 표시합니다. 이러한 데이터 손실을 방지하려면 파일을 가져올 때 우편번호 열을 항상 "숫자"가 아닌 "텍스트"로 지정해야 합니다.