tf.compat.v1.data.experimental.make_csv_dataset
Читает CSV-файлы в набор данных.
tf.compat.v1.data.experimental.make_csv_dataset(
file_pattern, batch_size, column_names=None, column_defaults=None,
label_name=None, select_columns=None, field_delim=',',
use_quote_delim=True, na_value='', header=True, num_epochs=None,
shuffle=True, shuffle_buffer_size=10000, shuffle_seed=None,
prefetch_buffer_size=None, num_parallel_reads=None, sloppy=False,
num_rows_for_inference=100, compression_type=None, ignore_errors=False
)
Читает CSV-файлы в набор данных, где каждый элемент — это кортеж (признаки, метки), который соответствует пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные признаков, а метки — это Tensor содержащие данные меток пакета.
| Аргументы | |
|---|---|
file_pattern | Список файлов или шаблонов путей к файлам, содержащим записи CSV. См. tf.io.gfile.glob для правил шаблонов. |
batch_size | Целое число, представляющее количество записей, объединяемых в один пакет. |
column_names | Необязательный список строк, соответствующих столбцам CSV в порядке следования. По одному для каждого столбца входной записи. Если это значение не указано, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных. |
column_defaults | Необязательный список значений по умолчанию для полей CSV. По одному значению на выбранный столбец входной записи. Каждый элемент списка — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или Tensor с одним из перечисленных типов. Тензор может быть скалярным значением по умолчанию (если столбец является необязательным) или пустым тензором (если столбец является обязательным). Если вместо тензора указан тип данных, столбец также рассматривается как обязательный. Если этот список не указан, он пытается вывести типы на основе чтения первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательные, устанавливая по умолчанию 0 для числовых значений и "" для строковых значений. Если оба этих параметра указаны, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца. |
label_name | Необязательная строка, соответствующая столбцу меток. Если указано, данные для этого столбца возвращаются как отдельный Tensor из словаря признаков, так что набор данных соответствует формату, ожидаемому функцией ввода tf.Estimator.train или tf.Estimator.evaluate. |
select_columns | Необязательный список целочисленных индексов или имен столбцов, определяющих подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, предоставленным в column_names или выведенным из заголовков строк файла. При указании этого аргумента будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующее указанным столбцам. Это приводит к более быстрому анализу и меньшему использованию памяти. Если оба этих параметра указаны, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца. |
field_delim | Необязательный string. По умолчанию ",". Разделитель символов для разделения полей в записи. |
use_quote_delim | Необязательный булево значение. По умолчанию True. Если false, двойные кавычки рассматриваются как обычные символы внутри строковых полей. |
na_value | Дополнительная строка, распознаваемая как NA/NaN. |
header | Булево значение, указывающее, соответствуют ли первые строки предоставленных CSV-файлов строкам заголовка со именами столбцов и не должны включаться в данные. |
num_epochs | Целое число, указывающее количество повторений этого набора данных. Если None, набор данных циклически повторяется бесконечно. |
shuffle | Булево значение, указывающее, должен ли ввод быть перемешан. |
shuffle_buffer_size | Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска. |
shuffle_seed | Семена случайности для перемешивания. |
prefetch_buffer_size | Целое число, указывающее количество пакетов признаков, которые нужно предварительно загрузить для повышения производительности. Рекомендуемое значение — количество пакетов, потребляемых на шаге обучения. По умолчанию настраивается автоматически. |
num_parallel_reads | Количество потоков, используемых для чтения записей CSV из файлов. Если >1, результаты будут чередующимися. По умолчанию 1. |
sloppy | Если True, производительность чтения будет улучшена за счёт недетерминированного порядка. Если False, порядок элементов, произведённых до перемешивания, является детерминированным (элементы всё равно случайны, если shuffle=True. Обратите внимание, что если seed установлен, то порядок элементов после перемешивания детерминирован). По умолчанию False. |
num_rows_for_inference | Количество строк файла, используемых для вывода типа, если record_defaults не указано. Если None, читает все строки всех файлов. По умолчанию 100. |
compression_type | (Необязательно.) tf.string скаляр, вычисляемый как один из "" (без сжатия), "ZLIB", или "GZIP". По умолчанию без сжатия. |
ignore_errors | (Необязательно.) Если True, игнорирует ошибки при разборе CSV-файлов, такие как неправильные данные или пустые строки, и переходит к следующей корректной CSV-записи. В противном случае набор данных генерирует ошибку и прекращает обработку при обнаружении некорректных записей. По умолчанию False. |
| Возвращает | |
|---|---|
Набор данных, где каждый элемент — это кортеж (признаки, метки), соответствующий пакету batch_size строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные столбцов, а метки — это Tensor содержащие данные столбца меток, указанного в label_name. |
| Исключения | |
|---|---|
ValueError | Если любой из аргументов имеет неправильный формат. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/compat/v1/data/experimental/make_csv_dataset