Как очистить Excel или CSV перед анализом нейросетью
Сделайте рабочую копию и превратите данные в прямоугольную таблицу: заголовки в первой строке, одна запись на строку и один признак в столбце. Затем приведите значения к единым типам, разберите пропуски и дубли, подпишите единицы и проверьте скрытые данные. Оставьте только сведения для поставленной задачи и повторно откройте экспорт. Очистка уменьшает неоднозначность, но выводы нейросети все равно нужно сверять с исходником.
Что учесть до начала работы
Очистка таблицы не гарантирует корректность выводов нейросети, поэтому результаты нужно сверять с исходными данными и контрольными расчетами.
Разные сервисы и библиотеки могут по-разному интерпретировать формулы, разделители, локальные даты и обозначения пропусков.
Псевдонимизация не всегда делает данные анонимными: повторная идентификация может быть возможна по косвенным признакам.
Рекомендации по защите персональных данных не являются юридическим заключением и должны соотноситься с применимыми правилами.
Что подготовить
Что делать
Сохраните оригинал и определите смысл строки
Не чистите единственный экземпляр. Создайте копию и запишите, что представляет строка: заказ, клиент, товар, день или событие. Сформулируйте вопросы анализа и выберите нужный период. Не смешивайте данные разной детализации, например месячные итоги и отдельные операции.
Результат: Есть неизмененный оригинал, рабочая копия и короткое описание единицы наблюдения для каждой строки.Соберите данные в прямоугольную таблицу
Поместите названия столбцов в первую строку и используйте уникальные заголовки. Уберите объединенные ячейки, декоративные шапки, пустые строки и столбцы-разделители. Каждая строка должна иметь одинаковый набор полей. Несвязанные таблицы разнесите по листам или файлам, а итоги не смешивайте с первичными записями.
Результат: Таблица читается слева направо без визуальной верстки: одна запись на строку, один признак в столбце и одинаковое число полей.Проверьте скрытые листы, строки и столбцы
Покажите скрытые листы, строки и столбцы и решите, нужны ли они. Невидимый лист может участвовать в формулах, поэтому скрытие не удаляет данные. Проверьте фильтры: часть строк может быть не показана. Если лист нельзя открыть обычной командой, уточните устройство книги у владельца.
Результат: Состав книги известен, скрытые диапазоны проверены, а в итоговой копии нет случайно включенных или исключенных данных.Приведите каждый столбец к одному типу
В числовом столбце оставьте числа, в столбце дат - даты, в логическом поле - два значения. Артикулы, телефоны и другие идентификаторы храните как текст, чтобы не потерять ведущие нули. Для CSV используйте однозначную дату, например YYYY-MM-DD, а время и часовой пояс вынесите отдельно.
Результат: Внутри каждого столбца нет смеси чисел, текстовых чисел, дат разных форматов и случайных обозначений.Согласуйте пропуски и категориальные значения
Определите смысл пустой ячейки: неизвестно, не применимо или не получено. Не заменяйте пропуски нулем без основания. Выберите одно правило и опишите его. Учтите, что CSV-парсеры могут считать пустую строку, N/A или NULL пропуском. Унифицируйте категории: не смешивайте «Москва», «москва» и «Moscow».
Результат: Пропуски и категории обозначены последовательно, а спорные значения перечислены в кратком словаре данных.Найдите дубли по осмысленному ключу
Определите ключ уникальности: номер заказа, идентификатор операции или комбинацию полей. Просмотрите повторения до удаления. Одинаковые строки не всегда ошибочны: похожие покупки могут быть разными событиями. Запишите число строк до и после очистки. Удаление дублей меняет рабочую копию, поэтому оригинал храните отдельно.
Результат: Каждый удаленный дубль объясним правилом, а число сохраненных и исключенных строк записано.Подпишите единицы, валюты и формулы
Укажите единицу в названии столбца или словаре: revenue_rub, weight_kg, duration_min. Не смешивайте валюты, единицы веса, доли 0,15 и проценты 15 в одном поле. Уберите «10k» и «2 млн» из расчетных столбцов. Формулы сохраните в оригинале, а в чистой копии при необходимости зафиксируйте значения и опишите расчет.
Результат: Любое число можно интерпретировать без догадок, а расчетные показатели имеют указанную единицу и происхождение.Минимизируйте данные и проверьте итоговый файл
Удалите ненужные поля, особенно имена, телефоны, почту, адреса и платежные реквизиты. Если связь строк нужна, замените прямой идентификатор псевдонимом и храните соответствие отдельно. Для CSV выберите UTF-8, один разделитель и корректное экранирование. Повторно откройте файл и сверьте строки, столбцы, даты, ведущие нули и кириллицу.
Результат: Готов отдельный минимальный файл, который открывается без искажений и содержит только данные, необходимые для анализа.Что проверить перед загрузкой
Что чаще всего портит результат
Удалять все одинаковые строки как ошибки
Определите ключ уникальности. Повторяющиеся значения могут описывать разные события.
Заполнять любой пропуск нулем
Разделяйте фактический ноль и неизвестное значение. Применяйте одно правило ко всему столбцу.
Смешивать даты, числа и подписи в одном столбце
Разнесите значение, единицу и комментарий по полям, даты приведите к одному формату.
Считать скрытый лист удаленным
Покажите скрытые листы и проверьте формулы, ссылки и фильтры. В итоговую копию переносите только осознанно выбранные данные.
Загружать полную клиентскую базу на всякий случай
Оставьте минимальный набор полей для задачи, замените прямые идентификаторы псевдонимами и проверьте правила выбранного сервиса.
Короткие ответы
Что лучше передать нейросети: Excel или CSV?
CSV удобен для одной плоской таблицы, но не хранит листы и формулы. Excel подходит для нескольких связанных листов или исходных формул. Выбирайте поддерживаемый сервисом формат и готовьте отдельную чистую копию.
Можно ли оставить формулы в Excel?
Можно, если инструмент их поддерживает. Разные системы могут читать формулу, сохраненное значение или только результат. Сохраните оригинал с формулами, а в отдельной копии зафиксируйте значения и опишите расчет.
Какой формат даты использовать в CSV?
Используйте однозначный формат YYYY-MM-DD. Не смешивайте его с 01.02.26 или названиями месяцев. Если важно время, храните его и часовой пояс явно.
Чем обозначать отсутствующие значения?
Используйте пустую ячейку или один документированный маркер. Не смешивайте пусто, тире, 0, N/A и NULL: парсеры могут трактовать часть этих строк как пропуски.
Достаточно ли удалить имена, чтобы обезличить таблицу?
Нет. Человека могут выдавать телефон, почта, адрес, номер клиента и сочетание косвенных признаков. Удаляйте ненужные поля, используйте псевдонимы и оценивайте риск повторной идентификации.
Коротко
Подготовленный Excel или CSV должен быть простой, документированной и минимальной таблицей. Сохраните оригинал, выровняйте структуру, типы, пропуски, дубли, единицы и даты, проверьте скрытые данные и создайте отдельный файл для ИИ.