Читает файлы CSV в набор данных, где каждый элемент — кортеж (признаки, метки), соответствующий пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные признаков, а метки — с Tensor содержащими данные меток пакета.
Аргументы
file_pattern
Список файлов или шаблонов путей к файлам, содержащим записи CSV. Смотрите tf.io.gfile.glob для правил шаблонов.
batch_size
Целое число, представляющее количество записей, объединяемых в один пакет.
column_names
Необязательный список строк, соответствующих столбцам CSV в порядке. По одному на каждый столбец входной записи. Если этот параметр не указан, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных.
column_defaults
Необязательный список значений по умолчанию для полей CSV. По одному элементу на выбранный столбец входной записи. Каждый элемент в списке — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или Tensor с одним из перечисленных типов. Tensor может быть скалярным значением по умолчанию (если столбец необязателен) или пустым тензором (если столбец обязателен). Если вместо типа данных указан тензор, столбец также рассматривается как обязательный. Если этот список не указан, пытается определить типы, основываясь на чтении первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательны, по умолчанию используя 0 для числовых значений и "" для строковых значений. Если указаны и этот, и select_columns, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца.
label_name
Необязательная строка, соответствующая столбцу меток. Если указана, данные для этого столбца возвращаются как отдельный Tensor из словаря признаков, чтобы набор данных соответствовал формату, ожидаемому функцией ввода tf.Estimator.train или tf.Estimator.evaluate.
select_columns
Необязательный список целочисленных индексов или строк имён столбцов, который определяет подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, указанным в column_names или определённым из заголовочных строк файла. Когда этот аргумент указан, будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующее указанным столбцам. Это приводит к более быстрому анализу и меньшему использованию памяти. Если указаны и этот, и column_defaults, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным в порядке возрастания индекса столбца.
field_delim
Необязательный string По умолчанию ",". Разделитель символов для разделения полей в записи.
use_quote_delim
Необязательный bool. По умолчанию True. Если false, двойные кавычки обрабатываются как обычные символы внутри строковых полей.
na_value
Дополнительная строка, распознаваемая как NA/NaN.
header
Boolean, указывающий, соответствуют ли первые строки предоставленных файлов CSV строкам заголовков с именами столбцов, и не должны ли они включаться в данные.
num_epochs
Целое число, указывающее количество повторений этого набора данных. Если None, цикл по набору данных продолжается бесконечно.
shuffle
Boolean, указывающий, должен ли ввод быть перемешан.
shuffle_buffer_size
Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска.
shuffle_seed
Семена для рандомизации при перемешивании.
prefetch_buffer_size
Целое число, указывающее количество пакетов признаков для предварительной обработки с целью повышения производительности. Рекомендуемое значение — количество пакетов, потребляемых на шаге обучения. По умолчанию настраивается автоматически.
num_parallel_reads
Количество потоков, используемых для чтения записей CSV из файлов. При >1 результаты будут переплетены. По умолчанию 1.
sloppy
Если True, производительность чтения улучшится за счёт недетерминированного порядка. Если False, порядок элементов, производимых перед перемешиванием, является детерминированным (элементы всё равно рандомизируются, если shuffle=True. Обратите внимание, что если семя установлено, то порядок элементов после перемешивания является детерминированным). По умолчанию False.
num_rows_for_inference
Количество строк файла, используемых для вывода типа, если record_defaults не указано. Если None, читает все строки всех файлов. По умолчанию 100.
compression_type
(Необязательно.) tf.string скаляр, принимающий одно из значений "" (без сжатия), "ZLIB", или "GZIP". По умолчанию без сжатия.
ignore_errors
(Необязательно.) Если True, игнорирует ошибки при разборе файла CSV, такие как неправильные данные или пустые строки, и переходит к следующей корректной записи CSV. В противном случае набор данных выдаёт ошибку и останавливает обработку при обнаружении каких-либо некорректных записей. По умолчанию False.
Возвращает
Набор данных, где каждый элемент — кортеж (признаки, метки), соответствующий пакету batch_size строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные столбца, а метки — с Tensor содержащими данные столбца меток, указанного label_name.
Возбуждает
ValueError
Если любой из аргументов имеет неправильный формат.