Spec-Zone.ru › TensorFlow 2.3

tf.compat.v1.data.experimental.make_csv_dataset

Считывает файлы CSV в набор данных.

tf.compat.v1.data.experimental.make_csv_dataset(
    file_pattern, batch_size, column_names=None, column_defaults=None,
    label_name=None, select_columns=None, field_delim=',', use_quote_delim=True,
    na_value='', header=True, num_epochs=None, shuffle=True,
    shuffle_buffer_size=10000, shuffle_seed=None, prefetch_buffer_size=None,
    num_parallel_reads=None, sloppy=False, num_rows_for_inference=100,
    compression_type=None, ignore_errors=False
)

Считывает файлы CSV в набор данных, где каждый элемент представляет собой кортеж (признаки, метки), который соответствует пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные признаков, а метки — с Tensor содержащими данные меток пакета.

Аргументы
file_pattern Список файлов или шаблонов путей к файлам, содержащим записи CSV. Смотрите tf.io.gfile.glob для правил шаблонов.
batch_size Целое число, представляющее количество записей, объединяемых в один пакет.
column_names Необязательный список строк, соответствующих столбцам CSV в порядке следования. По одному для каждого столбца входной записи. Если этот параметр не указан, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных.
column_defaults Необязательный список значений по умолчанию для полей CSV. По одному значению для каждого выбранного столбца входной записи. Каждый элемент в списке — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или Tensor с одним из указанных типов. Тензор может быть скалярным значением по умолчанию (если столбец необязателен) или пустым тензором (если столбец обязателен). Если вместо тензора указан тип данных, столбец также рассматривается как обязательный. Если этот список не указан, пытается вывести типы на основе чтения первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательны, принимая по умолчанию 0 для числовых значений и "" для строковых значений. Если оба параметра указаны, они должны иметь одинаковую длину, и select_columns предполагается отсортированным в порядке возрастания индекса столбца.
label_name Необязательная строка, соответствующая столбцу меток. Если указана, данные для этого столбца возвращаются как отдельный Tensor из словаря признаков, чтобы набор данных соответствовал формату, ожидаемому функцией входных данных tf.Estimator.train или tf.Estimator.evaluate.
select_columns Необязательный список целочисленных индексов или имен столбцов строк, которые задают подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, указанным в column_names или выведенным из строк заголовка файла. Когда этот аргумент указан, будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующее указанным столбцам. Это приводит к более быстрому анализу и меньшему потреблению памяти. Если оба этих параметра указаны, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца.
field_delim Необязательный string. По умолчанию ",". Разделитель символов для разделения полей в записи.
use_quote_delim Необязательный булев параметр. По умолчанию True. Если значение ложь, двойные кавычки внутри строковых полей рассматриваются как обычные символы.
na_value Дополнительная строка для распознавания как NA/NaN.
header Булев параметр, указывающий, соответствуют ли первые строки предоставленных файлов CSV строкам заголовков с именами столбцов и не должны ли они включаться в данные.
num_epochs Целое число, определяющее количество повторений этого набора данных. Если None, набор данных циклически повторяется бесконечно.
shuffle Булев параметр, указывающий, нужно ли перемешивать входные данные.
shuffle_buffer_size Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска.
shuffle_seed Семена для перемешивания.
prefetch_buffer_size Целое число, определяющее количество пакетов признаков, которые предварительно загружаются для повышения производительности. Рекомендуемое значение равно количеству пакетов, потребляемых на шаге обучения. По умолчанию настраивается автоматически.
num_parallel_reads Количество потоков, используемых для чтения записей CSV из файлов. Если > 1, результаты будут чередоваться. По умолчанию 1.
sloppy Если True, производительность чтения будет улучшена за счет недетерминированного порядка. Если False, порядок элементов, созданных до перемешивания, является детерминированным (элементы все равно случайны, если shuffle=True. Обратите внимание, что если seed установлен, то порядок элементов после перемешивания детерминирован). По умолчанию False.
num_rows_for_inference Количество строк файла, используемых для вывода типа, если record_defaults не указаны. Если None, читаются все строки всех файлов. По умолчанию 100.
compression_type (Необязательно.) tf.string скаляр, принимающий значение одного из "" (без сжатия), "ZLIB", или "GZIP". По умолчанию без сжатия.
ignore_errors (Необязательно.) Если True, игнорирует ошибки в анализе файла CSV, такие как неправильно сформированные данные или пустые строки, и переходит к следующей допустимой записи CSV. В противном случае набор данных вызывает ошибку и прекращает обработку при обнаружении любых недопустимых записей. По умолчанию False.
Возвращаемое значение
Набор данных, где каждый элемент представляет собой кортеж (признаки, метки), соответствующий пакету batch_size строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные столбцов, а метки — с Tensor содержащими данные столбца меток, указанного в label_name.
Исключения
ValueError Если любой из аргументов имеет неправильный формат.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/compat/v1/data/experimental/make_csv_dataset

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API