tf.compat.v2.data.experimental.make_csv_dataset
Читает CSV-файлы в набор данных.
tf.compat.v2.data.experimental.make_csv_dataset(
file_pattern, batch_size, column_names=None, column_defaults=None,
label_name=None, select_columns=None, field_delim=',', use_quote_delim=True,
na_value='', header=True, num_epochs=None, shuffle=True,
shuffle_buffer_size=10000, shuffle_seed=None, prefetch_buffer_size=None,
num_parallel_reads=None, sloppy=False, num_rows_for_inference=100,
compression_type=None, ignore_errors=False
)
Читает CSV-файлы в набор данных, где каждый элемент — это кортеж (признаки, метки), который соответствует пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с тензорами, содержащими соответствующие данные признаков, а метки — с тензором, содержащим данные меток пакета.
| Аргументы | |
|---|---|
file_pattern | Список файлов или шаблонов путей к файлам, содержащим записи CSV. Смотрите tf.io.gfile.glob для правил шаблонов. |
batch_size | Целое число, представляющее количество записей, которые нужно объединить в одном пакете. |
column_names | Необязательный список строк, соответствующих столбцам CSV в порядке. По одному для каждого столбца входной записи. Если это не указано, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных. |
column_defaults | Необязательный список значений по умолчанию для полей CSV. Один элемент на выбранный столбец входной записи. Каждый элемент списка — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или тензор с одним из упомянутых типов. Тензор может быть скалярным значением по умолчанию (если столбец необязательный) или пустым тензором (если столбец обязательный). Если указан тип данных вместо тензора, столбец также считается обязательным. Если этот список не указан, пытается определить типы на основе чтения первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательные, принимая по умолчанию 0 для числовых значений и "" для строковых значений. Если и этот, и select_columns указаны, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным по возрастанию индекса столбца. |
label_name | Необязательная строка, соответствующая столбцу меток. Если указано, данные для этого столбца возвращаются как отдельный тензор из словаря признаков, чтобы набор данных соответствовал формату, ожидаемому функцией ввода tf.Estimator.train или tf.Estimator.evaluate. |
select_columns | Необязательный список целочисленных индексов или имен столбцов в строковом формате, который определяет подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, указанным в column_names или выведенным из строк заголовков файла. Когда этот аргумент указан, будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующие указанным столбцам. Использование этого приводит к более быстрому анализу и меньшему потреблению памяти. Если и этот, и column_defaults указаны, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным по возрастанию индекса столбца. |
field_delim | Необязательный string. По умолчанию ",". Разделитель символов для разделения полей в записи. |
use_quote_delim | Необязательный булевый тип. По умолчанию True. Если ложь, двойные кавычки обрабатываются как обычные символы внутри строковых полей. |
na_value | Дополнительная строка для распознавания NA/NaN. |
header | Булевый тип, указывающий, соответствуют ли первые строки предоставленных CSV-файлов строкам заголовков со именами столбцов и не должны ли включаться в данные. |
num_epochs | Целое число, определяющее количество раз, которое этот набор данных повторяется. Если None, циклически проходит через набор данных бесконечно. |
shuffle | Булевый тип, указывающий, нужно ли перемешивать входные данные. |
shuffle_buffer_size | Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска. |
shuffle_seed | Семена для случайного перемешивания. |
prefetch_buffer_size | Целое число, определяющее количество пакетов признаков, которые нужно предварительно извлечь для повышения производительности. Рекомендуемое значение — количество пакетов, потребляемых на шаге обучения. По умолчанию — автоматическая настройка. |
num_parallel_reads | Количество потоков, используемых для чтения записей CSV из файлов. Если >1, результаты будут чередоваться. По умолчанию 1. |
sloppy | Если True, производительность чтения будет улучшена за счет недетерминированного порядка. Если False, порядок элементов, произведённых до перемешивания, является детерминированным (элементы всё ещё случайным образом перемешиваются, если shuffle=True. Обратите внимание, что если seed установлен, то порядок элементов после перемешивания является детерминированным). По умолчанию False. |
num_rows_for_inference | Количество строк файла, используемых для определения типа, если record_defaults не указано. Если None, читает все строки всех файлов. По умолчанию 100. |
compression_type | (Необязательно.) tf.string скаляр, равный одному из "" (без сжатия), "ZLIB", или "GZIP". По умолчанию — без сжатия. |
ignore_errors | (Необязательно.) Если True, игнорирует ошибки в парсинге CSV-файлов, такие как неверные данные или пустые строки, и переходит к следующей допустимой записи CSV. В противном случае набор данных выдает ошибку и прекращает обработку при обнаружении любых неверных записей. По умолчанию False. |
| Возвращаемое значение | |
|---|---|
Набор данных, где каждый элемент — это кортеж (признаки, метки), соответствующий пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с тензорами, содержащими соответствующие данные столбцов, а метки — с тензором, содержащим данные столбца меток, указанного в label_name. |
| Исключения | |
|---|---|
ValueError | Если какой-либо из аргументов имеет неправильный формат. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r1.15/api_docs/python/tf/compat/v2/data/experimental/make_csv_dataset