当社のプラットフォームからグローバルデータベースを購入またはダウンロードすると、ほとんどのデータセットが.XLSX、.CSV、.TXTという3つの汎用ファイル形式で提供されることがわかります。データの閲覧、検索、手動編集など、ほとんどの作業には.XLSXファイルのご利用を強くお勧めします。
ただし、プロジェクトのニーズによっては、他のファイル形式を使用したい場合もあるでしょう。ワークフローに最適な形式を選択できるよう、各ファイルの仕組み、開き方、よくある書式設定ミスを回避する方法について、以下に簡単に説明します。
XLSX(Microsoft Excelスプレッドシート)
その素晴らしさ:
ユーザーフレンドリー:これは、手動で閲覧するのに最も直感的な形式です。すべてがすぐに分かりやすい視覚的なグリッドで表示されます。
豊富な書式設定:フォントスタイル、列の色、組み込みのテキストフィルタリングなど、便利なスプレッドシート機能をサポートしています。
高度なツール:シート内で簡単に数式を実行したり、データのピボットテーブルを作成したり、グラフを直接作成したりできます。
開封方法:
Microsoft ExcelまたはWPS Officeを使用して、デスクトップ上で直接開いてください。
Googleスプレッドシートを使ってオンラインでアップロードおよび編集できます。
開発者であれば、専用ライブラリを使用してプログラム的に読み込んで処理することも可能です。
最適な用途:
この形式は、郵便番号の行を手動で検査したり、特定の地域を検索したり、内部レポートを作成したり、コードを一行も変更せずに住所データを抜き取り検査したりする必要がある場合に最適です。
CSV(カンマ区切り値)
その素晴らしさ:
シンプルな構造:CSVファイルは単なるプレーンテキストです。各行は1つのレコードを表し、都市名や郵便番号などのさまざまな情報は、基本的なカンマで区切られています。
非常に汎用性が高い:地球上のほぼすべてのデータベースマネージャー、データ分析ツール、またはプログラミング言語は、CSVファイルを完璧に読み込むことができます。
軽量:視覚的なスタイルをすべて排除しているため、ファイルサイズが非常に小さくなっています。そのため、数十万行にも及ぶ大規模なデータセットの処理に最適です。
開封方法:
メモ帳などのテキストエディタですぐに開くことができます。
Microsoft ExcelやGoogle Sheetsなどの表計算ソフトに取り込んで、フィルタリング処理を行います。
リレーショナルデータベースプラットフォームに直接インポートします。
最適な用途:
CSVファイルは、データ交換における業界標準です。大量のデータを当社のファイルから取り出し、独自のデータベースやオンラインアプリケーションのバックエンドに投入する必要がある場合、CSVは最速の選択肢です。また、RやPythonなどのデータ分析ツールにデータを読み込むのにも最適です。
TXT(プレーンテキスト)
その素晴らしさ:
最大限の自由度:CSVと同様に、TXTファイルはスタイルが適用されていない生のテキストです。ただし、厳密なカンマ区切りを強制しないため、カスタムのスペースや区切り文字を使用できます。
破損ゼロ:プレーンテキストファイルは、独自のファイル形式による破損やソフトウェアのバージョン問題でアクセスできなくなることはありません。あらゆるデバイスで完全に読み取り可能です。
開封方法:
お使いのシステムにインストールされているテキストエディタやコードエディタ(メモ帳、TextEdit、Visual Studio Codeなど)を使用してください。
最適な用途:
TXTファイルは、カスタムスクリプト(Pythonの解析ツールなど)の優れたフォールバックレイヤーとして機能します。また、シンプルなテキスト設定、システムログの保存、あるいは厳密なデータベースの列構造が必須ではない場合に、人間が読みやすいクリーンな参照データの表示にも最適です。
重要な設定上の警告:エンコードとテキストの種類に注意してください
フラットファイルは互換性が非常に高いものの、ソフトウェアの設定が間違っていると、大規模な国際データセットを開く際に表示エラーが発生する場合があります。以下の2つのルールに注意してください。
1. 言語符号化の落とし穴(混沌とした記号の修正)
Because we provide data for over 100 different nations, our files use UTF-8 text encoding to preserve international characters, foreign language text, and local regional accents. If you open a file and see unreadable, corrupted text symbols, the data is not broken. Your spreadsheet software is simply trying to read it using an old default local region setting (like ANSI). To fix this, always choose UTF-8 in your program's file import wizard. For highly specific regional languages, make sure to cross-reference the text guidelines included in your product documentation.
2. ゼロの欠落という落とし穴(郵便番号の誤りを修正する)
Microsoft Excelなどのプログラムは、デフォルトではデータ型を自動的に推測しようとします。列に数値のみが含まれている場合、Excelはそれを「テキスト」ではなく標準の「数値」として扱います。これは郵便番号の場合に大きな問題となります。たとえば、郵便番号が0100の場合、Excelのデフォルトの計算ロジックは先頭のゼロを削除し、誤って100と表示します。このようなデータ損失を防ぐには、ファイルインポート時に郵便番号の列を必ず「数値」ではなく「テキスト」として書式設定してください。