Практический гайд

Как очистить Excel или CSV перед анализом нейросетью

Сделайте рабочую копию и превратите данные в прямоугольную таблицу: заголовки в первой строке, одна запись на строку и один признак в столбце. Затем приведите значения к единым типам, разберите пропуски и дубли, подпишите единицы и проверьте скрытые данные. Оставьте только сведения для поставленной задачи и повторно откройте экспорт. Очистка уменьшает неоднозначность, но выводы нейросети все равно нужно сверять с исходником.

Проверено 29 июля 2026 годаМатериал основан на официальных открытых источниках OpenAI, Microsoft, pandas, IETF и ICO, проверенных 2026-07-29. Ручное тестирование сервисов не проводилось. Разные инструменты по-разному читают формулы, локальные даты, разделители и обозначения пропусков. Рекомендации по персональным данным являются общими мерами предосторожности и не заменяют требования вашей юрисдикции или организации.
Важные ограничения

Что учесть до начала работы

Очистка таблицы не гарантирует корректность выводов нейросети, поэтому результаты нужно сверять с исходными данными и контрольными расчетами.

Разные сервисы и библиотеки могут по-разному интерпретировать формулы, разделители, локальные даты и обозначения пропусков.

Псевдонимизация не всегда делает данные анонимными: повторная идентификация может быть возможна по косвенным признакам.

Рекомендации по защите персональных данных не являются юридическим заключением и должны соотноситься с применимыми правилами.

Перед началом

Что подготовить

Кому подойдет гайд

  • Аналитикам и владельцам малого бизнеса, которые передают в ИИ продажи, остатки, заявки или результаты опросов.
  • Сотрудникам, получившим таблицу из CRM, учетной системы, формы или чужого Excel-файла.
  • Пользователям без опыта программирования, которым нужен воспроизводимый порядок очистки данных.

Что понадобится

  • Исходный Excel или CSV и отдельная рабочая копия.
  • Понимание, что означает одна строка и какой показатель хранится в каждом столбце.
  • Список вопросов, на которые должен ответить анализ.
  • Правила учета пропусков, дублей, единиц и дат.
  • Политика организации по загрузке персональных и конфиденциальных данных во внешние сервисы.
Пошаговый процесс

Что делать

01

Сохраните оригинал и определите смысл строки

Не чистите единственный экземпляр. Создайте копию и запишите, что представляет строка: заказ, клиент, товар, день или событие. Сформулируйте вопросы анализа и выберите нужный период. Не смешивайте данные разной детализации, например месячные итоги и отдельные операции.

Результат: Есть неизмененный оригинал, рабочая копия и короткое описание единицы наблюдения для каждой строки.
02

Соберите данные в прямоугольную таблицу

Поместите названия столбцов в первую строку и используйте уникальные заголовки. Уберите объединенные ячейки, декоративные шапки, пустые строки и столбцы-разделители. Каждая строка должна иметь одинаковый набор полей. Несвязанные таблицы разнесите по листам или файлам, а итоги не смешивайте с первичными записями.

Результат: Таблица читается слева направо без визуальной верстки: одна запись на строку, один признак в столбце и одинаковое число полей.
03

Проверьте скрытые листы, строки и столбцы

Покажите скрытые листы, строки и столбцы и решите, нужны ли они. Невидимый лист может участвовать в формулах, поэтому скрытие не удаляет данные. Проверьте фильтры: часть строк может быть не показана. Если лист нельзя открыть обычной командой, уточните устройство книги у владельца.

Результат: Состав книги известен, скрытые диапазоны проверены, а в итоговой копии нет случайно включенных или исключенных данных.
04

Приведите каждый столбец к одному типу

В числовом столбце оставьте числа, в столбце дат - даты, в логическом поле - два значения. Артикулы, телефоны и другие идентификаторы храните как текст, чтобы не потерять ведущие нули. Для CSV используйте однозначную дату, например YYYY-MM-DD, а время и часовой пояс вынесите отдельно.

Результат: Внутри каждого столбца нет смеси чисел, текстовых чисел, дат разных форматов и случайных обозначений.
05

Согласуйте пропуски и категориальные значения

Определите смысл пустой ячейки: неизвестно, не применимо или не получено. Не заменяйте пропуски нулем без основания. Выберите одно правило и опишите его. Учтите, что CSV-парсеры могут считать пустую строку, N/A или NULL пропуском. Унифицируйте категории: не смешивайте «Москва», «москва» и «Moscow».

Результат: Пропуски и категории обозначены последовательно, а спорные значения перечислены в кратком словаре данных.
06

Найдите дубли по осмысленному ключу

Определите ключ уникальности: номер заказа, идентификатор операции или комбинацию полей. Просмотрите повторения до удаления. Одинаковые строки не всегда ошибочны: похожие покупки могут быть разными событиями. Запишите число строк до и после очистки. Удаление дублей меняет рабочую копию, поэтому оригинал храните отдельно.

Результат: Каждый удаленный дубль объясним правилом, а число сохраненных и исключенных строк записано.
07

Подпишите единицы, валюты и формулы

Укажите единицу в названии столбца или словаре: revenue_rub, weight_kg, duration_min. Не смешивайте валюты, единицы веса, доли 0,15 и проценты 15 в одном поле. Уберите «10k» и «2 млн» из расчетных столбцов. Формулы сохраните в оригинале, а в чистой копии при необходимости зафиксируйте значения и опишите расчет.

Результат: Любое число можно интерпретировать без догадок, а расчетные показатели имеют указанную единицу и происхождение.
08

Минимизируйте данные и проверьте итоговый файл

Удалите ненужные поля, особенно имена, телефоны, почту, адреса и платежные реквизиты. Если связь строк нужна, замените прямой идентификатор псевдонимом и храните соответствие отдельно. Для CSV выберите UTF-8, один разделитель и корректное экранирование. Повторно откройте файл и сверьте строки, столбцы, даты, ведущие нули и кириллицу.

Результат: Готов отдельный минимальный файл, который открывается без искажений и содержит только данные, необходимые для анализа.
Перед началом

Что проверить перед загрузкой

Исходный файл сохранен отдельно и не изменяется.
Понятно, что означает одна строка и какой период включен.
Заголовки находятся в первой строке и однозначно называют поля.
В диапазоне нет объединенных ячеек, декоративных шапок и пустых разделителей.
Скрытые листы, строки, столбцы и активные фильтры проверены.
Каждый столбец содержит один тип данных, а даты записаны единообразно.
Пропуски и категории имеют согласованные обозначения.
Дубли проверены по заранее определенному ключу, а не удалены автоматически.
Единицы, валюты, проценты и часовые пояса указаны явно.
Персональные поля минимизированы, а экспорт повторно открыт и сверен.
Разбор ошибок

Что чаще всего портит результат

Удалять все одинаковые строки как ошибки

Определите ключ уникальности. Повторяющиеся значения могут описывать разные события.

Заполнять любой пропуск нулем

Разделяйте фактический ноль и неизвестное значение. Применяйте одно правило ко всему столбцу.

Смешивать даты, числа и подписи в одном столбце

Разнесите значение, единицу и комментарий по полям, даты приведите к одному формату.

Считать скрытый лист удаленным

Покажите скрытые листы и проверьте формулы, ссылки и фильтры. В итоговую копию переносите только осознанно выбранные данные.

Загружать полную клиентскую базу на всякий случай

Оставьте минимальный набор полей для задачи, замените прямые идентификаторы псевдонимами и проверьте правила выбранного сервиса.

Частые вопросы

Короткие ответы

Что лучше передать нейросети: Excel или CSV?

CSV удобен для одной плоской таблицы, но не хранит листы и формулы. Excel подходит для нескольких связанных листов или исходных формул. Выбирайте поддерживаемый сервисом формат и готовьте отдельную чистую копию.

Можно ли оставить формулы в Excel?

Можно, если инструмент их поддерживает. Разные системы могут читать формулу, сохраненное значение или только результат. Сохраните оригинал с формулами, а в отдельной копии зафиксируйте значения и опишите расчет.

Какой формат даты использовать в CSV?

Используйте однозначный формат YYYY-MM-DD. Не смешивайте его с 01.02.26 или названиями месяцев. Если важно время, храните его и часовой пояс явно.

Чем обозначать отсутствующие значения?

Используйте пустую ячейку или один документированный маркер. Не смешивайте пусто, тире, 0, N/A и NULL: парсеры могут трактовать часть этих строк как пропуски.

Достаточно ли удалить имена, чтобы обезличить таблицу?

Нет. Человека могут выдавать телефон, почта, адрес, номер клиента и сочетание косвенных признаков. Удаляйте ненужные поля, используйте псевдонимы и оценивайте риск повторной идентификации.

Главный вывод

Коротко

Подготовленный Excel или CSV должен быть простой, документированной и минимальной таблицей. Сохраните оригинал, выровняйте структуру, типы, пропуски, дубли, единицы и даты, проверьте скрытые данные и создайте отдельный файл для ИИ.

Проверяемые данные

Источники