tf.compat.v1.data.experimental.make_csv_dataset
Считывает файлы CSV в набор данных.
tf.compat.v1.data.experimental.make_csv_dataset(
file_pattern, batch_size, column_names=None, column_defaults=None,
label_name=None, select_columns=None, field_delim=',', use_quote_delim=True,
na_value='', header=True, num_epochs=None, shuffle=True,
shuffle_buffer_size=10000, shuffle_seed=None, prefetch_buffer_size=None,
num_parallel_reads=None, sloppy=False, num_rows_for_inference=100,
compression_type=None, ignore_errors=False
)
Считывает файлы CSV в набор данных, где каждый элемент представляет собой кортеж (признаки, метки), который соответствует пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные признаков, а метки — с Tensor содержащими данные меток пакета.
| Аргументы | |
|---|---|
file_pattern | Список файлов или шаблонов путей к файлам, содержащим записи CSV. Смотрите tf.io.gfile.glob для правил шаблонов. |
batch_size | Целое число, представляющее количество записей, объединяемых в один пакет. |
column_names | Необязательный список строк, соответствующих столбцам CSV в порядке следования. По одному для каждого столбца входной записи. Если этот параметр не указан, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных. |
column_defaults | Необязательный список значений по умолчанию для полей CSV. По одному значению для каждого выбранного столбца входной записи. Каждый элемент в списке — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или Tensor с одним из указанных типов. Тензор может быть скалярным значением по умолчанию (если столбец необязателен) или пустым тензором (если столбец обязателен). Если вместо тензора указан тип данных, столбец также рассматривается как обязательный. Если этот список не указан, пытается вывести типы на основе чтения первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательны, принимая по умолчанию 0 для числовых значений и "" для строковых значений. Если оба параметра указаны, они должны иметь одинаковую длину, и select_columns предполагается отсортированным в порядке возрастания индекса столбца. |
label_name | Необязательная строка, соответствующая столбцу меток. Если указана, данные для этого столбца возвращаются как отдельный Tensor из словаря признаков, чтобы набор данных соответствовал формату, ожидаемому функцией входных данных tf.Estimator.train или tf.Estimator.evaluate. |
select_columns | Необязательный список целочисленных индексов или имен столбцов строк, которые задают подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, указанным в column_names или выведенным из строк заголовка файла. Когда этот аргумент указан, будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующее указанным столбцам. Это приводит к более быстрому анализу и меньшему потреблению памяти. Если оба этих параметра указаны, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца. |
field_delim | Необязательный string. По умолчанию ",". Разделитель символов для разделения полей в записи. |
use_quote_delim | Необязательный булев параметр. По умолчанию True. Если значение ложь, двойные кавычки внутри строковых полей рассматриваются как обычные символы. |
na_value | Дополнительная строка для распознавания как NA/NaN. |
header | Булев параметр, указывающий, соответствуют ли первые строки предоставленных файлов CSV строкам заголовков с именами столбцов и не должны ли они включаться в данные. |
num_epochs | Целое число, определяющее количество повторений этого набора данных. Если None, набор данных циклически повторяется бесконечно. |
shuffle | Булев параметр, указывающий, нужно ли перемешивать входные данные. |
shuffle_buffer_size | Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска. |
shuffle_seed | Семена для перемешивания. |
prefetch_buffer_size | Целое число, определяющее количество пакетов признаков, которые предварительно загружаются для повышения производительности. Рекомендуемое значение равно количеству пакетов, потребляемых на шаге обучения. По умолчанию настраивается автоматически. |
num_parallel_reads | Количество потоков, используемых для чтения записей CSV из файлов. Если > 1, результаты будут чередоваться. По умолчанию 1. |
sloppy | Если True, производительность чтения будет улучшена за счет недетерминированного порядка. Если False, порядок элементов, созданных до перемешивания, является детерминированным (элементы все равно случайны, если shuffle=True. Обратите внимание, что если seed установлен, то порядок элементов после перемешивания детерминирован). По умолчанию False. |
num_rows_for_inference | Количество строк файла, используемых для вывода типа, если record_defaults не указаны. Если None, читаются все строки всех файлов. По умолчанию 100. |
compression_type | (Необязательно.) tf.string скаляр, принимающий значение одного из "" (без сжатия), "ZLIB", или "GZIP". По умолчанию без сжатия. |
ignore_errors | (Необязательно.) Если True, игнорирует ошибки в анализе файла CSV, такие как неправильно сформированные данные или пустые строки, и переходит к следующей допустимой записи CSV. В противном случае набор данных вызывает ошибку и прекращает обработку при обнаружении любых недопустимых записей. По умолчанию False. |
| Возвращаемое значение | |
|---|---|
Набор данных, где каждый элемент представляет собой кортеж (признаки, метки), соответствующий пакету batch_size строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные столбцов, а метки — с Tensor содержащими данные столбца меток, указанного в label_name. |
| Исключения | |
|---|---|
ValueError | Если любой из аргументов имеет неправильный формат. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/compat/v1/data/experimental/make_csv_dataset