В двух записях о доставке указаны одинаковые товар и количество. Возможно, одну доставку импортировали дважды, а возможно, обе действительно состоялись. По сходству текста нельзя решить, какую строку удалить.
Сначала определите признаки одной записи
Выберите поля, которые однозначно обозначают запись именно в этом списке. Номер заказа вместе с номером позиции может подойти, если такая комбинация уникальна в исходной системе. Название товара отвечает на другой вопрос: что заказали, а не о каком событии идёт речь.
Попросите помощника предложить группы возможных дубликатов, сохранив все исходные строки и идентификаторы. Отделите точные совпадения от приблизительных, а сомнительные случаи оставьте для проверки. NIST описывает риск уверенных, но ошибочных ответов генеративных систем. Предложенный порядок проверки — практическое применение этой идеи, а не испытанная гарантия для конкретной модели.
Заранее подготовьте примеры с ожидаемыми решениями:
- Один заказ и одна позиция импортированы дважды: возможный дубликат, который нужно подтвердить.
- Разные номера заказов при одинаковом товаре и количестве: сохранить оба события.
- Разное написание без общего идентификатора: разобраться, а не объединять автоматически.
Сохраните то, что может потеряться
Сравните все поля внутри каждой группы. Разные примечания, даты или количества требуют отдельного решения даже при одинаковых идентификаторах. Отличающееся поле может означать исправление, а не лишнюю копию.
Работайте в отдельном выходном файле. Запишите, какие исходные строки соответствуют каждой оставленной записи и почему вы согласились на объединение. Сравните число строк и нужные итоги до и после, объяснив каждое ожидаемое изменение. Если разница непонятна, оставьте источник нетронутым и пересмотрите группу. Сокращённый список полезен, только если он по-прежнему правильно описывает исходные события.