Spec-Zone.ru › TensorFlow 2.4

tf.data.experimental.make_csv_dataset

Просмотреть исходный код на GitHub

Читает файлы CSV в набор данных.

tf.data.experimental.make_csv_dataset(
    file_pattern, batch_size, column_names=None, column_defaults=None,
    label_name=None, select_columns=None, field_delim=',',
    use_quote_delim=True, na_value='', header=True, num_epochs=None,
    shuffle=True, shuffle_buffer_size=10000, shuffle_seed=None,
    prefetch_buffer_size=None, num_parallel_reads=None, sloppy=False,
    num_rows_for_inference=100, compression_type=None, ignore_errors=False
)

Читает файлы CSV в набор данных, где каждый элемент — кортеж (признаки, метки), соответствующий пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные признаков, а метки — с Tensor содержащими данные меток пакета.

Аргументы
file_pattern Список файлов или шаблонов путей к файлам, содержащим записи CSV. Смотрите tf.io.gfile.glob для правил шаблонов.
batch_size Целое число, представляющее количество записей, объединяемых в один пакет.
column_names Необязательный список строк, соответствующих столбцам CSV в порядке. По одному на каждый столбец входной записи. Если этот параметр не указан, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных.
column_defaults Необязательный список значений по умолчанию для полей CSV. По одному элементу на выбранный столбец входной записи. Каждый элемент в списке — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или Tensor с одним из перечисленных типов. Tensor может быть скалярным значением по умолчанию (если столбец необязателен) или пустым тензором (если столбец обязателен). Если вместо типа данных указан тензор, столбец также рассматривается как обязательный. Если этот список не указан, пытается определить типы, основываясь на чтении первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательны, по умолчанию используя 0 для числовых значений и "" для строковых значений. Если указаны и этот, и select_columns, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца.
label_name Необязательная строка, соответствующая столбцу меток. Если указана, данные для этого столбца возвращаются как отдельный Tensor из словаря признаков, чтобы набор данных соответствовал формату, ожидаемому функцией ввода tf.Estimator.train или tf.Estimator.evaluate.
select_columns Необязательный список целочисленных индексов или строк имён столбцов, который определяет подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, указанным в column_names или определённым из заголовочных строк файла. Когда этот аргумент указан, будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующее указанным столбцам. Это приводит к более быстрому анализу и меньшему использованию памяти. Если указаны и этот, и column_defaults, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца.
field_delim Необязательный string По умолчанию ",". Разделитель символов для разделения полей в записи.
use_quote_delim Необязательный bool. По умолчанию True. Если false, двойные кавычки обрабатываются как обычные символы внутри строковых полей.
na_value Дополнительная строка, распознаваемая как NA/NaN.
header Boolean, указывающий, соответствуют ли первые строки предоставленных файлов CSV строкам заголовков с именами столбцов, и не должны ли они включаться в данные.
num_epochs Целое число, указывающее количество повторений этого набора данных. Если None, цикл по набору данных продолжается бесконечно.
shuffle Boolean, указывающий, должен ли ввод быть перемешан.
shuffle_buffer_size Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска.
shuffle_seed Семена для рандомизации при перемешивании.
prefetch_buffer_size Целое число, указывающее количество пакетов признаков для предварительной обработки с целью повышения производительности. Рекомендуемое значение — количество пакетов, потребляемых на шаге обучения. По умолчанию настраивается автоматически.
num_parallel_reads Количество потоков, используемых для чтения записей CSV из файлов. При >1 результаты будут переплетены. По умолчанию 1.
sloppy Если True, производительность чтения улучшится за счёт недетерминированного порядка. Если False, порядок элементов, производимых перед перемешиванием, является детерминированным (элементы всё равно рандомизируются, если shuffle=True. Обратите внимание, что если семя установлено, то порядок элементов после перемешивания является детерминированным). По умолчанию False.
num_rows_for_inference Количество строк файла, используемых для вывода типа, если record_defaults не указано. Если None, читает все строки всех файлов. По умолчанию 100.
compression_type (Необязательно.) tf.string скаляр, принимающий одно из значений "" (без сжатия), "ZLIB", или "GZIP". По умолчанию без сжатия.
ignore_errors (Необязательно.) Если True, игнорирует ошибки при разборе файла CSV, такие как неправильные данные или пустые строки, и переходит к следующей корректной записи CSV. В противном случае набор данных выдаёт ошибку и останавливает обработку при обнаружении каких-либо некорректных записей. По умолчанию False.
Возвращает
Набор данных, где каждый элемент — кортеж (признаки, метки), соответствующий пакету batch_size строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные столбца, а метки — с Tensor содержащими данные столбца меток, указанного label_name.
Возбуждает
ValueError Если любой из аргументов имеет неправильный формат.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/data/experimental/make_csv_dataset

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API