Spec-Zone.ru › TensorFlow 1.15

tf.contrib.data.make_csv_dataset

Считывает CSV-файлы в набор данных. (устаревший)

tf.contrib.data.make_csv_dataset(
    file_pattern, batch_size, column_names=None, column_defaults=None,
    label_name=None, select_columns=None, field_delim=',', use_quote_delim=True,
    na_value='', header=True, num_epochs=None, shuffle=True,
    shuffle_buffer_size=10000, shuffle_seed=None, prefetch_buffer_size=None,
    num_parallel_reads=None, sloppy=False, num_rows_for_inference=100,
    compression_type=None
)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.data.experimental.make_csv_dataset(...).

Считывает CSV-файлы в набор данных, где каждый элемент — это кортеж (признаки, метки), соответствующий пакету строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные признаков, а метки — это Tensor содержащий данные меток пакета.

Аргументы
file_pattern Список файлов или шаблонов путей к файлам, содержащим записи CSV. См. tf.io.gfile.glob для правил шаблонов.
batch_size Целое число, представляющее количество записей, объединяемых в один пакет.
column_names Необязательный список строк, соответствующий столбцам CSV в порядке. По одному на каждый столбец входной записи. Если это не указано, имена столбцов выводятся из первой строки записей. Эти имена будут ключами словаря признаков каждого элемента набора данных.
column_defaults Необязательный список значений по умолчанию для полей CSV. По одному элементу на выбранный столбец входной записи. Каждый элемент в списке — это допустимый тип данных CSV (float32, float64, int32, int64 или строка) или Tensor с одним из указанных выше типов. Тензор может быть скалярным значением по умолчанию (если столбец необязателен) или пустым тензором (если столбец обязателен). Если вместо тензора предоставлен тип данных, столбец также рассматривается как обязательный. Если этот список не предоставлен, пытается определить типы, основываясь на чтении первых num_rows_for_inference строк указанных файлов и предполагает, что все столбцы необязательны, по умолчанию используя 0 для числовых значений и "" для строковых значений. Если указаны и этот, и select_columns, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным по возрастанию индекса столбца.
label_name Необязательная строка, соответствующая столбцу меток. Если указано, данные этого столбца возвращаются как отдельный Tensor из словаря признаков, чтобы набор данных соответствовал формату, ожидаемому функцией ввода tf.Estimator.train или tf.Estimator.evaluate.
select_columns Необязательный список целочисленных индексов или имен столбцов, которые указывают подмножество столбцов данных CSV для выбора. Если указаны имена столбцов, они должны соответствовать именам, предоставленным в column_names или определённым из заголовков строк файла. При указании этого аргумента будут анализироваться и возвращаться только подмножество столбцов CSV, соответствующее указанным столбцам. Использование этого приводит к более быстрому анализу и меньшему использованию памяти. Если указаны и этот, и column_defaults, они должны иметь одинаковую длину, и column_defaults предполагается отсортированным по возрастанию индекса столбца.
field_delim Необязательный string. По умолчанию ",". Символ разделитель для разделения полей в записи.
use_quote_delim Необязательный булево значение. По умолчанию True. Если ложно, то двойные кавычки обрабатываются как обычные символы внутри строковых полей.
na_value Дополнительная строка для распознавания как NA/NaN.
header Булево значение, указывающее, соответствуют ли первые строки CSV-файлов строкам заголовков со именами столбцов и не должны включаться в данные.
num_epochs Целое число, определяющее количество раз, которое повторяется этот набор данных. Если None, набор данных циклически повторяется бесконечно.
shuffle Булево значение, указывающее, должен ли ввод перемешиваться.
shuffle_buffer_size Размер буфера для перемешивания. Большой размер буфера обеспечивает лучшее перемешивание, но увеличивает использование памяти и время запуска.
shuffle_seed Семена случайности для использования при перемешивании.
prefetch_buffer_size Целое число, определяющее количество пакетов признаков для предварительной выборки для улучшения производительности. Рекомендуемое значение — количество пакетов, потребляемых на шаге обучения. По умолчанию настраивается автоматически.
num_parallel_reads Количество потоков, используемых для чтения записей CSV из файлов. Если >1, результаты будут чередоваться. По умолчанию 1.
sloppy Если True, производительность чтения будет улучшена за счёт не-детерминированного порядка. Если False, порядок элементов, генерируемых до перемешивания, является детерминированным (элементы по-прежнему случайны, если shuffle=True. Обратите внимание, что если семя установлено, тогда порядок элементов после перемешивания детерминирован). По умолчанию False.
num_rows_for_inference Количество строк файла, используемых для вывода типа, если record_defaults не предоставлено. Если None, считывает все строки всех файлов. По умолчанию 100.
compression_type (Необязательно.) tf.string скалярное выражение, равное одному из "" (без сжатия), "ZLIB", или "GZIP". По умолчанию без сжатия.
Возвращает
Набор данных, где каждый элемент — кортеж (признаки, метки), соответствующий пакету batch_size строк CSV. Словарь признаков сопоставляет имена столбцов признаков с Tensor содержащими соответствующие данные столбца, а метки — это Tensor содержащий данные столбца меток, указанного в label_name.
Возбуждает
ValueError Если какой-либо из аргументов имеет неправильный формат.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r1.15/api_docs/python/tf/contrib/data/make_csv_dataset

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API