При покупке или загрузке глобальной базы данных с нашей платформы вы обнаружите, что большинство наших наборов данных предоставляются в трех универсальных форматах файлов: .XLSX, .CSV и .TXT. Для подавляющего большинства задач — таких как простой просмотр, поиск или ручное редактирование данных — мы настоятельно рекомендуем использовать файл .XLSX.
Однако, в зависимости от потребностей вашего проекта, вы можете использовать и другие типы файлов. Чтобы помочь вам выбрать оптимальный формат для вашего рабочего процесса, ниже приведено простое описание того, как работает каждый файл, как их открыть и как избежать распространенных ошибок форматирования.
XLSX (электронная таблица Microsoft Excel)
Что делает его замечательным:
Удобный для пользователя : это наиболее интуитивно понятный формат для просмотра вручную. Все сразу отображается в виде четкой визуальной сетки.
Расширенное форматирование : поддерживает полезные функции электронных таблиц, такие как стили шрифтов, цвета столбцов и встроенную фильтрацию текста.
Расширенные инструменты : Вы можете легко запускать математические формулы, создавать сводные таблицы или строить диаграммы непосредственно в таблице.
Как это открыть:
Откройте его непосредственно на рабочем столе с помощью Microsoft Excel или WPS Office.
Загрузите и отредактируйте его онлайн с помощью Google Таблиц.
Если вы разработчик, вы также можете читать и обрабатывать это программно, используя специализированные библиотеки.
Для чего лучше всего подходит:
Этот формат идеально подходит, когда вам нужно вручную проверить строки почтовых индексов, найти конкретные регионы, создать внутренние отчеты или выборочно проверить данные об адресах, не касаясь ни одной строки кода.
CSV (значения, разделенные запятыми)
Что делает его замечательным:
Простая структура : CSV-файл — это просто текстовый файл. Каждая строка представляет собой отдельную запись, а различные элементы информации (например, название города и почтовый индекс) разделены обычной запятой.
Исключительная универсальность : практически любой менеджер баз данных, инструмент анализа данных или язык программирования в мире может безупречно читать CSV-файлы.
Легковесность : Поскольку он удаляет все визуальные стили, размер файла невероятно мал. Это делает его идеальным для обработки огромных наборов данных, содержащих сотни тысяч строк.
Как это открыть:
Откройте его мгновенно с помощью текстовых редакторов, таких как Блокнот.
Загрузите эти данные в табличные редакторы, такие как Microsoft Excel или Google Sheets, для фильтрации.
Непосредственно импортируйте его в реляционные базы данных.
Для чего лучше всего подходит:
CSV-файлы — это отраслевой стандарт для обмена данными. Если вам нужно переместить большие объемы данных из наших файлов и заполнить ими собственную базу данных или бэкэнд онлайн-приложения, CSV — это самый быстрый вариант. Он также идеально подходит для загрузки данных в инструменты анализа данных, такие как R или Python.
TXT (простой текст)
Что делает его замечательным:
Максимальная свобода : как и CSV-файл, TXT-файл представляет собой необработанный, не отформатированный текст. Однако он не требует строгого использования запятых, позволяя устанавливать собственные интервалы или разделители.
Отсутствие повреждений : текстовые файлы никогда не заблокируют вам доступ из-за повреждения файлов или проблем с версией программного обеспечения. Они полностью читаемы на любом устройстве.
Как это открыть:
Используйте любую текстовую утилиту или редактор кода, установленный в вашей системе, например, Блокнот, TextEdit или Visual Studio Code.
Для чего лучше всего подходит:
Текстовые файлы (TXT) служат отличным резервным слоем для пользовательских скриптов (например, инструментов анализа кода на Python). Они также идеально подходят для хранения простых текстовых настроек, системных журналов или отображения понятных, удобочитаемых справочных данных, где строгое требование к столбцам базы данных не является обязательным.
Внимание! Внимание: проверьте кодировку и типы текста!
Хотя плоские файлы обладают высокой совместимостью, открытие больших международных наборов данных иногда может вызывать визуальные ошибки, если настройки вашего программного обеспечения неверны. Помните о двух правилах:
1. Ловушка кодирования языка (Исправление хаотичных символов)
Because we provide data for over 100 different nations, our files use UTF-8 text encoding to preserve international characters, foreign language text, and local regional accents. If you open a file and see unreadable, corrupted text symbols, the data is not broken. Your spreadsheet software is simply trying to read it using an old default local region setting (like ANSI). To fix this, always choose UTF-8 in your program's file import wizard. For highly specific regional languages, make sure to cross-reference the text guidelines included in your product documentation.
2. Ловушка пропущенных нулей (Исправление ошибок в почтовых индексах)
По умолчанию такие программы, как Microsoft Excel, пытаются определить тип ваших данных. Если столбец содержит только числа, Excel будет рассматривать его как стандартный «числовой», а не «текстовый» тип. Это создает огромную проблему для почтовых индексов. Например, если почтовый индекс равен 0100, стандартная логика Excel удалит ведущий ноль и неправильно отобразит его как 100. Чтобы предотвратить эту потерю данных, всегда форматируйте столбцы с почтовыми индексами как «текст», а не как «числа» в процессе импорта файла.