tf.keras.preprocessing.image_dataset_from_directory
Генерирует tf.data.Dataset из файлов изображений в каталоге.
tf.keras.preprocessing.image_dataset_from_directory(
directory, labels='inferred', label_mode='int', class_names=None,
color_mode='rgb', batch_size=32, image_size=(256, 256), shuffle=True, seed=None,
validation_split=None, subset=None, interpolation='bilinear', follow_links=False
)
Если структура каталога выглядит так:
main_directory/ ...class_a/ ......a_image_1.jpg ......a_image_2.jpg ...class_b/ ......b_image_1.jpg ......b_image_2.jpg
Тогда вызов image_dataset_from_directory(main_directory, labels='inferred') вернёт tf.data.Dataset, который выдаёт пакеты изображений из подкаталогов class_a и class_b, вместе с метками 0 и 1 (0 соответствует class_a и 1 соответствует class_b).
Поддерживаемые форматы изображений: jpeg, png, bmp, gif. Анимированные gif обрезаются до первого кадра.
| Аргументы | |
|---|---|
directory | Каталог, где расположена информация. Если labels равно "inferred", он должен содержать подкаталоги, каждый из которых содержит изображения для одного класса. В противном случае, структура каталога игнорируется. |
labels | Либо "inferred" (метки генерируются из структуры каталога), либо список/кортеж целых меток такого же размера, как количество файлов изображений, найденных в каталоге. Метки должны быть отсортированы в соответствии с алфавитно-цифровым порядком путей к файлам изображений (полученных с помощью os.walk(directory) в Python). |
label_mode |
|
class_names | Действительно только если "labels" равно "inferred". Это явный список имён классов (должен совпадать с именами подкаталогов). Используется для управления порядком классов (в противном случае используется алфавитно-цифровой порядок). |
color_mode | Один из "grayscale", "rgb", "rgba". По умолчанию: "rgb". Определяет, будут ли изображения преобразовываться в 1, 3 или 4 канала. |
batch_size | Размер пакетов данных. По умолчанию: 32. |
image_size | Размер для изменения размера изображений после считывания с диска. По умолчанию (256, 256). Поскольку конвейер обрабатывает пакеты изображений, которые должны иметь одинаковый размер, это значение должно быть указано. |
shuffle | Нужно ли перемешивать данные. По умолчанию: True. Если установлено в False, данные сортируются в алфавитно-цифровом порядке. |
seed | Необязательное случайное зерно для перемешивания и преобразований. |
validation_split | Необязательное число с плавающей точкой от 0 до 1, доля данных, резервируемых для валидации. |
subset | Один из "training" или "validation". Используется только если validation_split задано. |
interpolation | Строка, метод интерполяции, используемый при изменении размера изображений. По умолчанию bilinear. Поддерживает bilinear, nearest, bicubic, area, lanczos3, lanczos5, gaussian, mitchellcubic. |
follow_links | Нужно ли посещать подкаталоги, на которые ссылаются символьные ссылки. По умолчанию False. |
| Возвращаемое значение | |
|---|---|
Объект tf.data.Dataset.
|
Правила формата меток:
- Если
label_modeравноint, метки представляют собойint32тензор формы(batch_size,). - Если
label_modeравноbinary, метки представляют собойfloat32тензор из 1 и 0 с формой(batch_size, 1). - Если
label_modeравноcategorial, метки представляют собойfloat32тензор с формой(batch_size, num_classes), представляющий одноканальное кодирование индекса класса.
Правила относительно количества каналов на выводимых изображениях:
- Если
color_modeравноgrayscale, в тензорах изображений есть 1 канал. - Если
color_modeравноrgb, в тензорах изображений есть 3 канала. - Если
color_modeравноrgba, в тензорах изображений есть 4 канала.
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/keras/preprocessing/image_dataset_from_directory