Spec-Zone.ru › PyTorch 1

Свертка

class torch.nn.Fold(output_size, kernel_size, dilation=1, padding=0, stride=1) [source]

Комбинирует массив скользящих локальных блоков в один большой содержащий тензор.

Рассмотрим пакетный input тензор, содержащий скользящие локальные блоки, например, патчи изображений, с формой (N,C×∏(kernel_size),L)(N, C \times \prod(\text{kernel\_size}), L), где NN — размерность пакета, C×∏(kernel_size)C \times \prod(\text{kernel\_size}) — число значений в блоке (блок имеет ∏(kernel_size)\prod(\text{kernel\_size}) пространственных местоположений, каждое из которых содержит CC-канальный вектор), а LL — общее количество блоков. (Это полностью соответствует спецификации выходной формы Unfold.) Эта операция объединяет эти локальные блоки в большой output тензор с формой (N,C,output_size[0],output_size[1],…)(N, C, \text{output\_size}[0], \text{output\_size}[1], \dots) путем суммирования перекрывающихся значений. Аналогично Unfold, аргументы должны удовлетворять

L=∏d⌊output_size[d]+2×padding[d]−dilation[d]×(kernel_size[d]−1)−1stride[d]+1⌋,L = \prod_d \left\lfloor\frac{\text{output\_size}[d] + 2 \times \text{padding}[d] % - \text{dilation}[d] \times (\text{kernel\_size}[d] - 1) - 1}{\text{stride}[d]} + 1\right\rfloor,

где dd — по всем пространственным измерениям.

  • output_size описывает пространственную форму большого содержащего тензора скользящих локальных блоков. Это полезно для разрешения неоднозначности, когда несколько форм входных данных отображаются на одинаковое количество скользящих блоков, например, при stride > 0.

Аргументы padding, stride и dilation задают способ извлечения скользящих блоков.

  • stride управляет шагом скользящих блоков.
  • padding управляет количеством неявных нулевых дополнений с обеих сторон на padding точек для каждого измерения перед преобразованием в нужную форму.
  • dilation управляет интервалом между точками ядра; также известен как алгоритм à trous. Это сложнее описать, но эта ссылка содержит наглядную визуализацию того, что делает dilation.
Параметры:
  • output_size (int или кортеж) – форма пространственных измерений вывода (то есть output.sizes()[2:])
  • kernel_size (int или кортеж) – размер скользящих блоков
  • stride (int или кортеж) – шаг скользящих блоков во входных пространственных измерениях. По умолчанию: 1
  • padding (int или кортеж, необязательно) – неявное дополнение нулями с обеих сторон входа. По умолчанию: 0
  • dilation (int или кортеж, необязательно) – параметр, который контролирует шаг элементов внутри окрестности. По умолчанию: 1
  • Если output_size, kernel_size, dilation, padding или stride — целое число или кортеж длиной 1, то их значения будут дублироваться по всем пространственным измерениям.
  • В случае двух выходных пространственных измерений эта операция иногда называется col2im.

Примечание

Fold вычисляет каждое комбинированное значение в результирующем большом тензоре путем суммирования всех значений из всех содержащих блоков. Unfold извлекает значения в локальных блоках путем копирования из большого тензора. Поэтому, если блоки перекрываются, они не являются обратными друг другу.

В общем, операции свертки и развертки связаны следующим образом. Рассмотрим экземпляры Fold и Unfold, созданные с одинаковыми параметрами:

>>> fold_params = dict(kernel_size=..., dilation=..., padding=..., stride=...)
>>> fold = nn.Fold(output_size=..., **fold_params)
>>> unfold = nn.Unfold(**fold_params)

Тогда для любого (поддерживаемого) input тензора справедливо следующее равенство:

fold(unfold(input)) == divisor * input

где divisor — тензор, зависящий только от формы и типа данных input:

>>> input_ones = torch.ones(input.shape, dtype=input.dtype)
>>> divisor = fold(unfold(input_ones))

Если тензор divisor не содержит нулевых элементов, то операции fold и unfold являются взаимно обратными (до постоянного делителя).

Предупреждение

В настоящее время поддерживаются только непакетированные (3D) или пакетированные (4D) тензоры вывода, подобные изображениям.

Форма:
  • Вход: (N,C×∏(kernel_size),L)(N, C \times \prod(\text{kernel\_size}), L) или (C×∏(kernel_size),L)(C \times \prod(\text{kernel\_size}), L)
  • Выход: (N,C,output_size[0],output_size[1],…)(N, C, \text{output\_size}[0], \text{output\_size}[1], \dots) или (C,output_size[0],output_size[1],…)(C, \text{output\_size}[0], \text{output\_size}[1], \dots) как описано выше

Примеры:

>>> fold = nn.Fold(output_size=(4, 5), kernel_size=(2, 2))
>>> input = torch.randn(1, 3 * 2 * 2, 12)
>>> output = fold(input)
>>> output.size()
torch.Size([1, 3, 4, 5])

© 2024, PyTorch Contributors
PyTorch has a BSD-style license, as found in the LICENSE file.
https://pytorch.org/docs/1.13/generated/torch.nn.Fold.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API